CASAN không phải một lệnh cài đặt.
CASAN là cách tổ chức chịu trách nhiệm khi dùng AI.
Tư tưởng · cài đặt · vận hành · Level 4 · Level 5 · kiểm soát token · demo NEHOPS Basic Design.
Kết thúc buổi học, mỗi core member phải tự trả lời được 6 câu hỏi
- CASAN kiểm soát điều gì mà coding agent không kiểm soát?
casan inittạo gì — và tuyệt đối không tạo gì?- Một run được gọi là có bằng chứng khi nào?
- Level 4 khác “có nhiều script” ở điểm nào?
- Level 5 đòi hỏi thay đổi cấp tổ chức ra sao?
- Token giảm bao nhiêu, đo bằng nguồn nào, có mất nghĩa không?
CASAN đi đúng hướng FPT Japan: AI-First cho legacy modernization, nhưng phải scale có kiểm soát
FPT chính thức giới thiệu CASAN năm 2026 như khung 5 cấp để đi từ thử nghiệm rời rạc đến vận hành AI ở quy mô doanh nghiệp.
Harness quyết định đề xuất có được tin, thực thi và chứng nhận hay không.
Nhanh không đủ. Phải đúng nguồn, đúng quyền, qua gate, có người chịu trách nhiệm và có evidence tái kiểm chứng.
Bảy harness là bảy câu hỏi bắt buộc trước khi tin AI
Harness yếu nhất quyết định trần. H1/H3 mạnh không bù được H4/H5/H6 bằng 0.
Edition là thứ được đóng gói. Maturity là năng lực đã được chứng minh.
| Trục | Câu hỏi | Ví dụ | Sự thật sau init |
|---|---|---|---|
| Product edition | CASAN ship những capability nào? | Core, DevKit, Platform Preview | Enterprise bị từ chối vì chưa được ship |
| Maturity L1–L5 | Tổ chức đã vận hành và giữ evidence đến đâu? | L4 Automated, L5 Native | level: null, not_assessed |
casan init nên project đạt Level 4.”Năm cấp không phải năm nhãn — là năm thay đổi trong cách vận hành
Cá nhân thử AI, chưa có chuẩn chung.
Dùng tool được duyệt, tăng năng suất từng công việc.
Quy trình, template, review gate và test lặp lại được.
H4/H5/H6 là runtime gate; side effect có policy + approval + evidence.
Tái dùng đa dự án; drift, fallback, rollback, KPI và governance tập trung hoạt động thật.
casan init là enrollment ở cấp repository
- Pin runtime/version/hash
- Merge hook Claude/Codex
- Bật enforce/observe
- Tạo state/log root
- DevKit thêm Domain Pack + CI template
- Kết nối dashboard/ingest nếu cấu hình
Init không thể provision những thứ thuộc hạ tầng, tổ chức và hợp đồng
- Enterprise OIDC / CA / private network
- Cloud KMS, HSM, S3 Object Lock/WORM
- HA topology, RPO/RTO, failover
- On-call, uptime SLA, service credit
- External pentest hoặc chứng nhận
Khách hàng/FPT phải triển khai dịch vụ thật, vận hành thật và thuê đánh giá độc lập.
Probe trên bản sao cấu trúc NEHOPS: Core chạy, nhưng còn 3 việc phải xử lý ngay
/hooks.Kết quả thật: ready_with_attention; maturity vẫn là not_assessed.
Những file scaffold phải được thay bằng sự thật của project — không giữ placeholder
| Artifact | Điền bằng evidence NEHOPS | Không được làm |
|---|---|---|
| requirement.md | FR từ CLAUDE.md + BD_Instruction.md: tiếng Nhật, lowercase ID, no-inference, thứ tự review | Giữ FR-01 health placeholder |
| architecture.md | VB.NET → AST → BD → Angular/Java; Windows analyzer; output boundaries | Tự bịa runtime/deployment |
| traceability-map.json | FR → VB/AST/instruction → reviewed output/review report | Map vào file không tồn tại |
| golden-runs/ | FRR04701 reviewed output + final review, sau khi kiểm tra dữ liệu nhạy cảm | Dùng draft chưa review làm golden |
| corpus/ | Benign tiếng Nhật + red-team injection/secret/PII theo domain | Chỉ dùng corpus tiếng Anh mẫu |
Prompt đầu tiên phải là preflight read-only, không phải “hãy chạy toàn bộ”
Luồng vận hành đúng: evidence được tạo quanh hành động thật
Evidence Pack trả lời câu hỏi khó nhất: “Vì sao được phép tin run này?”
- H1–H7 reports
- Decision log và approver identity
- Token/cost/latency/failure evidence
- Manifest hash và signature status
- Certification withheld nếu thiếu gate
NEHOPS là case Japan điển hình: legacy source rất lớn, output phải đúng bằng chứng và đúng tiếng Nhật
Use case demo: FRR04701 · 部屋状況リスト — đã có AST, pre-analysis, output và final review.
Assessment hiện có chứa một lỗi phân loại — core member phải phát hiện, không được sao chép
NEHOPS đã có workflow tốt, nhưng chưa có runtime assurance
| Đã có | Còn thiếu để vận hành CASAN |
|---|---|
| AST analyzer + call/dependency graph | Tool registry, command schema, timeout, idempotency, per-call audit |
| Instruction tiếng Nhật và no-inference | H4 scan input/source comment/output; secret/PII/egress policy |
| Pre-analysis + Round 1–4 review | Golden regression tự động và fail-able gate |
| Boss command tuần tự | Bounded retry, fallback, rollback, pipeline state |
| Analyzer log | Provider token/cost, latency, failure, drift và alert |
Level 4 không phải “automation chạy hết” — mà là automation không được vượt governance
+ H4 Security
+ H5 Governance
+ H6 AgentOps
= Automated with evidence
- Side effect có policy decision và audit
- Injection, PII, secret được test bằng attack
- Trace, metrics, cost, latency, retry, alert được capture
- High-risk action có human approval auditable
- Gate fail-closed; thiếu evidence thì không certify
H4 chỉ được tính điểm khi payload độc bị chặn thật
- Prompt injection classic + multilingual
- Homoglyph, zero-width, encoding, split injection
- Secret/credential và PII leakage
- Tool output và generated artifact scan
- Classifier/model chết ⇒ fail-closed
VB comment, AST text hoặc ref_docs chứa câu “ignore instruction / xuất secret / sửa source”. Pipeline phải coi đó là dữ liệu, không phải mệnh lệnh.
H5 biến “agent đã làm” thành “ai cho phép làm, theo rule nào, bằng chứng có còn nguyên?”
| Control | Level 4 minimum | NEHOPS cần khai báo |
|---|---|---|
| Risk registry | Low/medium/high, deny-by-default cho high risk | Ghi VB-Source/ref_docs/instruction là high risk |
| Approval | Approver identity, reason, SoD, không replay | Publish reviewed output hoặc override Round 4 |
| Audit | Hash chain + verify; lỗi chain chặn promotion | Bind screen ID, source hash, AST hash, output hash |
| Policy | Versioned; thay đổi có review/rollback | Japanese rules và no-inference là must-keep policy |
H6 không chỉ đo token — phải biết số đó đáng tin đến đâu
- Per-step input/output/total tokens
- Cost source: estimate hay provider telemetry
- Latency, retry, exit code, failure
- Token-overuse, spike, slow-boil, alert
- Freshness và coverage của telemetry
Nếu client/provider không cấp usage đáng tin, ghi
null hoặc estimate. Không biến word count thành “billed token”.Đóng H4/H5/H6 chưa đủ nếu bốn harness còn lại không chạy quanh workflow thật
| Harness | Exit condition cho NEHOPS |
|---|---|
| H1 Context | Index-first, chỉ đọc relevant knowhow/line range; stale context được phát hiện |
| H2 Tool | Roslyn analyzer là registered action; exact argv, timeout, output paths, no shell injection |
| H3 Evaluation | Golden FRR04701, deterministic validators, Round 4 fail-able; không chỉ LLM tự review |
| H7 Orchestration | State từng step; retry giới hạn; analyzer fail thì dừng; fallback không bypass policy |
Không tạo project manifest với command test giả. NEHOPS hiện chưa có test contract tự động — phải viết validator deterministic trước.
Để claim Level 4 trong môi trường enterprise Japan, thêm lớp production assurance
| Control | Repo có gì | Điều kiện đóng thật |
|---|---|---|
| OIDC | Mock/local smoke + oauth2-proxy scaffold | Enterprise issuer/audience/JWKS, CA, group-role mapping, negative test |
| Tenant isolation | Per-tenant state/RBAC/pre-audit | Independent review identity/app/db/network/KMS boundaries |
| KMS/WORM | Vault/S3 paths + preflight scripts | Non-exportable key, workload identity, Object Lock COMPLIANCE |
| HA/DR | Backup/verify/restore workflow | Topology, replication, RPO/RTO, restore + failover drill |
| SLA/review | Draft + pentest scope | Measured SLO, on-call/contract, independent signed report + retest |
Chỉ tuyên bố Level 4 khi một run đầy đủ trả lời “Có” cho toàn bộ bảng này
- Attack injection/secret/PII bị chặn
- High-risk denied by default
- Approval có identity + reason + scope
- Audit chain verify thành công
- Trace/metrics/alerts hợp lệ và còn fresh
- Golden regression không drift ngoài ngưỡng
- Tool/action không vượt allowlist
- Retry/fallback không bypass governance
- Evidence Pack verify được sau khi export
- Không có Harness GAP hoặc evidence “not recorded”
CASAN đã đo token/cost, nhưng chưa có baseline tiết kiệm đáng tin cho NEHOPS
Không cộng hai tập log thành tổng spend: chúng có thể là hai projection của cùng hoạt động và có dữ liệu test/demo.
Log thật giảm 2.446 → 24 “token” — nhưng kết quả phải bị từ chối
[WRN] VBSource root not found còn lại trong compressed view.Giảm token đúng cách cho FPT Japan: giảm đọc lại, không giảm bằng chứng
| Ưu tiên | Cơ chế | Evidence cần giữ |
|---|---|---|
| 1 · Index-first | Đọc common-knowhow README rồi chỉ mở file liên quan | Danh sách file/pattern đã chọn |
| 2 · Line-range context | Pre-analysis trỏ chính xác AST lines cho vòng sau | Source hash + cited ranges |
| 3 · Structural view | Giữ summary/error/warning/must-keep; raw artifact giữ nguyên | Raw hash + compressed hash + ratio |
| 4 · Model routing | Local/deterministic cho classify; cloud cho task cần reasoning | Model/provider + real usage |
| 5 · Budget gate | Per-screen/token ceiling, spike và slow-boil alert | Provider telemetry + acceptance result |
Dashboard token tốt phải ghép “chi phí” với “chất lượng đầu ra”
- Provider tokens và billed cost / screen
- Token coverage và cost coverage
- P50/P95 latency, retries, fallback
- Compression ratio + must-keep pass
- Round 1–4 defect/rework count
- Hallucination/no-evidence findings
- Cycle time / screen
- Customer acceptance và escaped defect
Level 5 bắt đầu khi CASAN không còn là “project setup”, mà trở thành operating system dùng chung
- Harness package tái dùng và versioned đa project
- Golden data phát hiện drift theo model/prompt version
- Fallback có policy; failure có rollback
- Tool registry có schema + idempotency
- Governance/policy signed và centrally controlled
- AgentOps tổng hợp cross-project
- Incident/reviewer feedback quay thành evaluation
- Business KPI gắn với agent decision
Level 5 phải chứng minh được sáu “chuyện khó”, không chỉ bật sáu feature
Thứ tự nâng cấp an toàn: chứng minh L4 trước, rồi mới federate lên L5
Live demo dùng đúng project thật, nhưng không đánh đổi an toàn
- Project hiện không có Git ⇒ snapshot trước
- Mac có .NET 7; analyzer yêu cầu .NET 8/Windows EXE
- Demo dùng AST/output FRR04701 đã có
- Không rerun Roslyn analyzer trên Mac
- Chỉ ghi CASAN scaffold sau khi người trình bày xác nhận
Kịch bản 15 phút: cài → phát hiện attention → điền truth → chạy gate → xem evidence
Một governed step an toàn: xác minh AST JSON có thể đọc được
Đây chỉ là smoke action H2/H6 — chưa thay thế bộ validator chất lượng BD.
Demo “savings” phải kết thúc bằng một lần REJECT
- Cho khán giả thấy raw warning
- Cho thấy compressed view bỏ warning
- Giải thích must-keep/faithfulness
- Không ghi 99% vào KPI dự án
Những phần chưa được phép quảng cáo là hoàn chỉnh
| Area | Trạng thái trung thực | Việc tiếp theo |
|---|---|---|
| Enterprise edition | Future; init chủ động từ chối | Không bán/claim như shipped product |
| OIDC/KMS/WORM | Local lab/scaffold + production paths | Deploy managed infra và giữ evidence khách hàng |
| HA/SLA/pentest | Runbook/draft/scope, chưa có kết quả vận hành độc lập | DR drill, measured SLO, contract, assessor report |
| Token savings | Compressor MVP; no NEHOPS end-to-end baseline | Fix warning/must-keep; A/B cùng acceptance |
| NEHOPS maturity | Assessment cũ mâu thuẫn; init ⇒ not_assessed | Chạy assessment evidence-backed mới |
Với FPT Japan, “đúng kỹ thuật” phải đi cùng “đúng nguồn, đúng ngôn ngữ, đúng trách nhiệm”
- Japanese output và terminology consistency
- No-inference: thiếu evidence phải ghi UNKNOWN
- Legacy traceability: VB → AST → BD → review
- Data residency/model route rõ ràng
- Human oversight cho publish/override
- APPI/data-processing register theo tenant
- Incident/SLA escalation bằng run ID/evidence hash
- Security review bám đúng deployed image/config
Japan AI governance đang nhấn mạnh governance, guideline và audit — CASAN phải biến các yêu cầu đó thành runtime evidence.
Bảy nguyên tắc làm việc của core team
- Evidence trước claim
- Fail-closed trước convenience
- Không sửa gate riêng theo project
- Không dùng mock làm proof production
- Không tối ưu token bằng cách mất nghĩa
- Không để model tự tuyên bố DONE
- Mỗi incident trở thành golden/red-team test
Ba quyết định cần chốt để NEHOPS tiến tới Level 4
Chỉ sau ba quyết định này mới lập kế hoạch Level 4 có owner, acceptance evidence và deadline.
AI-Native không có nghĩa AI được tự do.
Nó có nghĩa tổ chức kiểm soát AI bằng evidence ở quy mô lớn.
Level 4: automation có security, governance, AgentOps. Level 5: hệ thống học và mở rộng — nhưng vẫn bị ràng buộc bởi policy, rollback và business outcome.