chore(freeze): snapshot demo state before Plan-07 hardening work

Freeze current submission/demo baseline:
- casan-next-plans/: full task-level plan set (Plan 00 index + 02/04/06/07/08/09/12, QA, slide deck)
- optimize-docs/video-steps/: per-vector scene breakdown (commands/screen-text/script) + start-tmux
- run-all.sh / scorecard.sh / map-live.sh: REAL=1 live-battery wiring
- regenerated evidence + audit/telemetry logs from live REAL=1 run
- submission README + video recording guide updates
- dry-run pipeline logs for 001-okr-web-app

Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com>
This commit is contained in:
thanhnv
2026-07-03 22:03:44 +09:00
co-authored by Claude Opus 4.8
parent fabd5f8783
commit fbcef967e5
182 changed files with 3865 additions and 341 deletions
@@ -0,0 +1,14 @@
#!/usr/bin/env bash
# D1 — 🔥 Cost-spike: step tốn 3× token bị bắt (SHOWPIECE H6)
# cwd = thư mục gốc dự án. Offline OK (dùng telemetry seed).
# provider-usage.jsonl: 3 step ~200 token, 1 step "plan" = 710 (spike)
printf '%s\n' \
'{"step":"srs","total_tokens":210}' \
'{"step":"bd","total_tokens":195}' \
'{"step":"spec","total_tokens":230}' \
'{"step":"plan","total_tokens":710}' > /tmp/usage.jsonl
bash .specify/scripts/bash/cost-spike-detect.sh /tmp/usage.jsonl 3.0; echo "exit=$?"
# Kỳ vọng: median_tokens=220.0 threshold=660 · SPIKE step=plan tokens=710 (>660)
# COST_SPIKE_DETECTED count=1 · exit=2
@@ -0,0 +1,20 @@
# TEXT HIỂN THỊ — D1 🔥 SHOWPIECE H6 (không cắt)
## Title card
```
D1 · COST-SPIKE (step tốn 3× token)
AgentOps · câu hỏi chốt H6
```
## Caption trong khi chạy
```
Telemetry 4 step: srs=210 · bd=195 · spec=230 · plan=710 (plan ~3×)
Ngưỡng = 3.0 × median
```
## Caption kết quả (nhấn mạnh lớn)
```
✅ median=220 · threshold=660 · SPIKE step=plan tokens=710 (>660)
COST_SPIKE_DETECTED count=1 · exit = 2 → GATE ĐỎ
"Nếu một step đột nhiên tốn gấp 3 lần token, có ai biết không?" → CÓ.
```
@@ -0,0 +1,12 @@
# SCRIPT / MÔ TẢ — D1 🔥 SHOWPIECE H6
**Kịch bản:** đây là **câu hỏi chốt của H6** — *"nếu một step đột nhiên tốn gấp 3 lần token, có ai biết không?"*. Ta nạp telemetry 4 step, trong đó step `plan` tốn **710 token** (~3× so với median 220).
**Control phát hiện thế nào:** `cost-spike-detect.sh` tính **median = 220**, ngưỡng = `3.0 × median = 660`. Step `plan=710 > 660` → `SPIKE`, `COST_SPIKE_DETECTED count=1`, **exit=2** → gate đỏ, có người biết ngay.
**Vai trò AI local:** logic này **deterministic** — chạy trên telemetry bất kỳ (ở đây là seed để chứng minh offline). Khi chạy pipeline thật, ornith:9b cấp token thật (xem D4).
**Text mô tả (phụ đề):**
> "Step tốn 3× token → gate đỏ, exit=2. Đúng câu hỏi chốt của H6 — và câu trả lời là CÓ, biết ngay."
**Lưu ý dựng:** SHOWPIECE — giữ chắc trong bản cuối, phóng to dòng `COST_SPIKE_DETECTED ... exit=2`.
@@ -0,0 +1,12 @@
#!/usr/bin/env bash
# D2 — Negative control: KHÔNG báo động giả (khi không có spike)
# cwd = thư mục gốc dự án. Offline OK.
printf '%s\n' \
'{"step":"srs","total_tokens":210}' \
'{"step":"bd","total_tokens":195}' \
'{"step":"spec","total_tokens":230}' \
'{"step":"plan","total_tokens":240}' > /tmp/nospike.jsonl
bash .specify/scripts/bash/cost-spike-detect.sh /tmp/nospike.jsonl 3.0; echo "exit=$?"
# Kỳ vọng: COST_SPIKE_NONE · exit=0 — control không la làng
@@ -0,0 +1,18 @@
# TEXT HIỂN THỊ — D2
## Title card
```
D2 · NEGATIVE CONTROL (không báo động giả)
AgentOps · chống false positive
```
## Caption trong khi chạy
```
Telemetry 4 step đều bình thường: 210 · 195 · 230 · 240 (không step nào 3×)
```
## Caption kết quả
```
✅ COST_SPIKE_NONE · exit = 0
Cost bình thường → XANH. Control KHÔNG la làng — có cả positive (D1) và negative (D2)
```
@@ -0,0 +1,10 @@
# SCRIPT / MÔ TẢ — D2
**Mục tiêu:** chứng minh control **không báo động giả** (false positive). Cùng detector như D1 nhưng telemetry toàn step bình thường (240 vẫn dưới ngưỡng 660).
**Kết quả:** `COST_SPIKE_NONE`, **exit=0** → xanh. Có cặp **positive (D1) + negative (D2)** mới chứng minh detector đáng tin — không phải cứ chạy là báo đỏ.
**Text mô tả (phụ đề):**
> "Cost bình thường → xanh. Control không la làng — có cả positive và negative test."
**Lưu ý dựng:** đặt ngay sau D1 để tạo cặp đối chứng đỏ/xanh.
@@ -0,0 +1,9 @@
#!/usr/bin/env bash
# D3 — Drift-detect: hành vi output lệch bị cảnh báo
# cwd = thư mục gốc dự án. Offline OK.
printf 'line one\nline two\nline three\n' > /tmp/gold.txt
printf 'line one\nline two CHANGED\nline four\n' > /tmp/cand.txt
bash .specify/scripts/bash/drift-detect.sh /tmp/gold.txt /tmp/cand.txt /tmp/drift.json; echo "exit=$?"
# Kỳ vọng: DRIFT_WARN similarity=0.7692 length_delta=0.2414 (difflib thật)
@@ -0,0 +1,19 @@
# TEXT HIỂN THỊ — D3
## Title card
```
D3 · DRIFT DETECT (hành vi output lệch)
AgentOps · phát hiện model đổi hành vi
```
## Caption trong khi chạy
```
So 2 artifact: gold vs candidate (khác 1 dòng + đổi độ dài)
Đo bằng difflib THẬT
```
## Caption kết quả
```
✅ DRIFT_WARN similarity=0.7692 length_delta=0.2414
similarity ≠ 1.0 → phát hiện model đổi hành vi theo thời gian
```
@@ -0,0 +1,8 @@
# SCRIPT / MÔ TẢ — D3
**Kịch bản:** model có thể **đổi hành vi theo thời gian** (drift) — cùng input nhưng output khác dần. Ta so một artifact "gold" (chuẩn) với "candidate" (mới) khác nhau về nội dung lẫn độ dài.
**Control phát hiện thế nào:** `drift-detect.sh` dùng **difflib thật** tính `similarity=0.7692` (≠ 1.0) và `length_delta=0.2414` → `DRIFT_WARN`. Con số thật, không ước lượng.
**Text mô tả (phụ đề):**
> "So 2 artifact bằng difflib thật, similarity ≠ 1.0 → phát hiện model đổi hành vi theo thời gian."
@@ -0,0 +1,10 @@
#!/usr/bin/env bash
# D4 — Telemetry TOKEN THẬT từ model (nguồn dữ liệu H6)
# ⚠️ CẦN OLLAMA LIVE (bật tunnel). cwd = thư mục gốc dự án. Dùng lại /tmp/a1.txt.
# Mỗi lời gọi model-router tự ghi provider-usage.jsonl với token THẬT
bash .specify/scripts/bash/model-router.sh /tmp/a1.txt /tmp/v.json --role classify >/dev/null 2>&1
tail -1 .specify/logs/level5/provider-usage.jsonl 2>/dev/null
# Kỳ vọng: dòng JSON có cost_source=ollama_local_real_tokens
# total_tokens = input_tokens + output_tokens (prompt_eval_count + eval_count THẬT của ornith:9b)
@@ -0,0 +1,19 @@
# TEXT HIỂN THỊ — D4 🟢 CẦN OLLAMA
## Title card
```
D4 · TELEMETRY TOKEN THẬT (nguồn dữ liệu H6)
AgentOps · MAESTRO L5
```
## Caption trong khi chạy
```
Gọi model-router → tự ghi provider-usage.jsonl → xem dòng cuối
```
## Caption kết quả
```
✅ cost_source=ollama_local_real_tokens total_tokens=...
Token = prompt_eval_count + eval_count THẬT của ornith:9b (không ước lượng)
Đây là nguồn dữ liệu THẬT nuôi cost-spike (D1) & agent-metrics
```
@@ -0,0 +1,10 @@
# SCRIPT / MÔ TẢ — D4 (🟢 cần Ollama live)
**Mục tiêu:** cho thấy H6 đo **token THẬT**, không bịa. Mỗi lời gọi `model-router` tới ornith:9b **tự ghi** một dòng vào `.specify/logs/level5/provider-usage.jsonl` với nhãn `cost_source=ollama_local_real_tokens`.
**Vai trò AI local:** đây là chỗ **AI local đóng vai nguồn dữ liệu** cho H6 — `total_tokens = input_tokens + output_tokens` (tức `prompt_eval_count + eval_count`) thật của ornith:9b. Chạy pipeline ≥3 step → cost-spike (D1) có dữ liệu đầy đủ để phán đoán trên telemetry thật.
**Ghi chú:** `import-provider-telemetry.sh` chỉ cần khi **nhập telemetry từ provider ngoài** (nó yêu cầu tham số `<provider-usage-json>`). Với ornith:9b local, `model-router` đã ghi trực tiếp nên bước này không cần trong demo.
**Text mô tả (phụ đề):**
> "Token đo được là số thật của ornith:9b, không phải ước lượng. Đây là nguồn dữ liệu nuôi các control deterministic của H6."
@@ -0,0 +1,10 @@
#!/usr/bin/env bash
# D5 — (tuỳ chọn) Hallucination scan
# cwd = thư mục gốc dự án. Offline OK.
ls .specify/scripts/bash/hallucination-scan.py
# Chạy thật khi có tracking artifact:
# python .specify/scripts/bash/hallucination-scan.py <hallucination-tracking.yaml> <output-file>
# Kỳ vọng: scanner đối chiếu claim của agent với tracking yaml → gắn cờ claim vô căn cứ
@@ -0,0 +1,18 @@
# TEXT HIỂN THỊ — D5 (tuỳ chọn)
## Title card
```
D5 · HALLUCINATION SCAN (tuỳ chọn)
AgentOps · đối chiếu claim vs bằng chứng
```
## Caption trong khi chạy
```
Scanner đối chiếu claim của agent với hallucination-tracking.yaml
vd: "đã pass 999 test" nhưng không có bằng chứng → gắn cờ
```
## Caption kết quả
```
Chạy khi có tracking artifact thật → claim vô căn cứ bị gắn cờ
```
@@ -0,0 +1,10 @@
# SCRIPT / MÔ TẢ — D5 (tuỳ chọn)
**Mục tiêu:** phát hiện **hallucination** — agent tuyên bố điều không có bằng chứng (vd "đã pass 999 test"). Scanner đối chiếu claim với `hallucination-tracking.yaml`.
**Control phát hiện thế nào:** `hallucination-scan.py` so từng claim với tracking yaml; claim nào không có bằng chứng tương ứng → **gắn cờ**.
**Lưu ý dựng:** đây là bước **tuỳ chọn** — chỉ chạy đầy đủ khi có tracking artifact thật. Nếu thiếu, chỉ cần `ls` cho thấy scanner tồn tại và mô tả cơ chế.
**Text mô tả (phụ đề):**
> "Scanner đối chiếu claim của agent với tracking yaml → claim vô căn cứ bị gắn cờ. Chạy khi có tracking artifact thật."
@@ -0,0 +1,11 @@
# CHỐT H6 — card kết cụm
## TEXT HIỂN THỊ (title card chốt)
```
CHỐT H6 · AGENTOPS
cost thật · cost-spike 3× (positive + negative) · drift · telemetry thật
GAP 30 → "step tốn gấp 3× token, có ai biết?" → CÓ, gate đỏ ngay
```
## SCRIPT / MÔ TẢ (phụ đề)
> "H6 từ GAP=30 nay đo được cost thật, bắt spike 3× (cả positive lẫn negative), phát hiện drift. Câu hỏi chốt — 'có ai biết khi một step tốn gấp 3 lần token?' — câu trả lời là CÓ, gate đỏ ngay. AI local cấp telemetry thật cho các control deterministic này."