Files
CASAN/optimize-docs/CASAN_TU_TUONG_QA.md
T
2026-07-02 22:17:03 +09:00

17 KiB
Raw Blame History

CASAN — Q&A Tư tưởng & Ngưỡng đạt chuẩn (điểm → cần đạt gì)

Mục đích: hiểu sâu tư tưởng CASAN và biết rõ đạt bao nhiêu điểm thì phải làm được gì ở mỗi harness và mỗi cấp. Nguồn: FPT_CASAN_Full.md + casan_harness_assessment.md. Đây là định nghĩa khung (không phải số đo của riêng dự án).


PHẦN A — TƯ TƯỞNG NỀN

A1. Vì sao CASAN ra đời? Giai đoạn 2025–2026, model nền tảng phổ biến/rẻ → lợi thế không còn ở "có model" mà ở khả năng biến model thành hệ thống doanh nghiệp thật: đúng dữ liệu, đúng ngữ cảnh, đúng công cụ, đúng quyền, có kiểm định, có hàng rào, có AgentOps, có hoàn tác, có trách nhiệm giải trình, có kết quả kinh doanh.

A2. CASAN là gì trong 1 câu? Khung Năng lực AI-Native 5 cấp (Curious→Augmented→Standard→Automated→Native) do FPT phát triển để đánh giá và dẫn dắt chuyển đổi AI.

A3. CASAN trả lời 4 câu hỏi nào? (1) Đang ở đâu? (2) Cần làm gì để lên cấp? (3) FPT cung cấp dịch vụ/nền tảng/nhân lực/IP gì mỗi cấp? (4) Làm sao AI tạo giá trị kinh doanh thật, không chỉ thử nghiệm?

A4. Triết lý cốt lõi (thuộc lòng)?

  • "Điểm = thứ chứng minh được, không phải thứ khai báo" → có file ≠ có năng lực.
  • "Harness thấp nhất quyết định trần" → không nhảy cấp bằng cách mua nhiều agent.
  • "Thu hẹp khoảng cách từ trình diễn đến vận hành thật" → demo ≠ production.

A5. Rủi ro Agentic AI khác rủi ro LLM thường thế nào? LLM thường: AI trả lời sai. Agentic: AI hành động sai / vượt quyền / bị chiếm quyền để hành động thay. Vì agent đọc dữ liệu, gọi tool, ghi hệ thống, gửi mail → bề mặt tấn công lớn hơn nhiều.


PHẦN B — 4 LỚP TƯ DUY NGUYÊN BẢN

B1. Harness Engineering? Lớp kỹ thuật bao quanh model (7 thành phần). Đây là điểm khác biệt kỹ thuật quan trọng nhất — model có thể thay, harness là tài sản giữ lại.

B2. Computational × Inferential Blend? Kết hợp tầng tính toán (ERP/core banking/rule engine — chính xác, kiểm toán được) với tầng suy luận (LLM — hiểu ngữ cảnh, xử lý phi cấu trúc). Không thay hết bằng LLM; chia ranh giới rõ: phần nào logic xác định, phần nào AI, phần nào người duyệt.

B3. Human-led, AI-first? Con người giữ mục tiêu/giá trị/đạo đức/trách nhiệm cuối; AI là lớp năng lực thực thi đầu tiên mở rộng năng lực con người trong harness có kiểm soát. Tránh 2 cực đoan: coi AI là phụ trợ nhỏ / trao quyền quá nhanh thiếu kiểm soát.

B4. AI Delegation Architecture? Khung phân quyền cho AI (L0–L5): AI được làm gì, dùng dữ liệu nào, gọi tool nào, ai duyệt, rollback thế nào, ai chịu trách nhiệm. Rào cản Agentic AI không nằm ở model làm được không, mà ở tổ chức có dám giao việc trong production không.


PHẦN C — 5 CẤP CASAN: MỖI CẤP CẦN ĐẠT GÌ

C1. Cấp 1 — Curious (xưởng thủ công): cần đạt gì để coi là ở cấp này / lên cấp? Đặc điểm: dùng AI cá nhân rời rạc, chưa chuẩn, chưa quản trị. Để lên L2 phải: ban hành Acceptable Use Policy, xác định dữ liệu cấm đưa vào AI công cộng, cấp phép công cụ AI, chọn 5–10 use case năng suất, đào tạo dùng AI an toàn, đo thời gian tiết kiệm.

C2. Cấp 2 — Augmented (dây chuyền lắp ráp): cần gì? Đặc điểm: công cụ AI chính thức (Copilot/M365), DLP cấp endpoint, AUP đã ban hành, một số quy trình cải thiện. Để lên L3 phải: danh mục use case theo tác động/rủi ro, chuẩn hoá dữ liệu, phân loại + nhãn nhạy cảm + RBAC, vòng đời AI đầy đủ, thư viện prompt/mẫu agent/bộ kiểm định, hội đồng quản trị AI, các vai trò chuyên trách.

C3. Cấp 3 — Standard (nhà máy thông minh): cần gì? Đặc điểm: đã chuẩn hoá dữ liệu/quy trình/chính sách/nền tảng. Bắt buộc ĐẠT ĐỦ 6 tiêu chuẩn dữ liệu. Sở hữu harness chung, sổ đăng ký agent, danh mục tool có schema, đường ống kiểm định hồi quy trước deploy, RAG chuẩn, giám sát chi phí/chất lượng, ISO 42001 readiness. Để lên L4: agent hoá luồng công việc có kiểm soát.

C4. Cấp 4 — Automated (điểm bứt phá giá trị): cần gì? Đặc điểm: AI Agent vận hành luồng công việc thật có kiểm soát. Cần: đủ 7 harness ở mức vận hành (đặc biệt Tool/Security/Governance/AgentOps/Orchestration); AgentOps giám sát hiệu năng/chi phí/ảo giác/lỗi; control plane (quyền, phê duyệt, hoàn tác, audit); định danh riêng mỗi agent; kill switch + rollback đã kiểm thử; kiểm thử prompt-injection/jailbreak/rò rỉ trước production.

C5. Cấp 5 — Native (vận hành trên "hệ điều hành AI"): cần gì? Đặc điểm: kiến trúc lại doanh nghiệp quanh AI. Cần: điều phối Multi-Agent phức tạp, tầng tri thức + bộ nhớ agent dài hạn là tầng kiến trúc thật, dữ liệu phục vụ suy luận thời gian thực + học liên tục, quản trị thích ứng, red-teaming chủ động. KPI chuyển từ "hiệu quả tự động hoá" sang "đổi mới mô hình kinh doanh / tăng doanh thu / trải nghiệm KH / tốc độ học". Cần cam kết của Chủ tịch/HĐQT.

C6. Nguyên tắc chuyển cấp bất biến? Cấp cao kế thừa cấp dưới (L5 vẫn cần năng lực L1–L4). Không nhảy cấp. Không kéo dài L2 quá lâu (Copilot tạo ảo giác "đã làm AI"). L4 là điểm bứt phá giá trị; L5 là quyết định kiến trúc lại.


PHẦN D — THANG ĐIỂM HARNESS: ĐIỂM BAO NHIÊU = CẤP GÌ

D1. Thang điểm 1 harness (0–100) nghĩa là gì?

Điểm Mức Ý nghĩa
0–30 GAP Gần như không có control này, rủi ro cao
31–60 Partial Có vài cơ chế nhưng thiếu bài bản
61–80 Good Hoạt động tốt, còn điểm cần cứng hoá
81–100 Strong Đủ tiêu chuẩn vận hành thật

D2. Công thức quy đổi ra CASAN Level?

Average = (H1+…+H7)/7
Critical GAP = bất kỳ harness nào < 30
Điều kiện CASAN Level
Average < 40 hoặc ≥ 3 GAP Level 2 — Augmented
Average 40–65, ≤ 2 GAP Level 3 — Standard
Average 65–80, ≤ 1 GAP Level 3 → 4 (đang chuyển)
Average > 80, không GAP Level 4 — Automated
Average > 80 + tất cả > 70 + Multi-Agent phức tạp Level 5 — Native

D3. "Đạt điểm bao nhiêu thì cần chứng minh được gì?" — bảng cụ thể:

Ngưỡng harness Phải chứng minh được (bằng tấn công/lệnh, không khai báo)
Vượt 30 (thoát GAP) Control tồn tại và chạy — vd H4 chặn được 1 câu injection kinh điển (rc=2).
Vượt 60 (Good) Control có bài bản: có positive + negative test, có audit/log, không chỉ happy-path. Vd H6 vừa COST_SPIKE_DETECTED (có spike) vừa COST_SPIKE_NONE (không spike).
Vượt 80 (Strong) Control chống được tấn công đối kháng thật + fail-closed + đo được: vd H4 recall model ≥ 0.8 và > regex; H5 sửa 1 ký tự → HASH_MISMATCH; H2 tool sai schema bị chặn + tool treo bị timeout.

D4. Muốn tuyên bố "Level 4 thật" cần gì (chốt)? Cả 7 harness đều > 30 (không GAP) VÀ trung bình > 80. Không được có 1 harness dưới 30 dù các harness khác cao — vì "harness thấp nhất quyết định trần".

D5. Muốn lên Level 5 cần gì thêm so với L4? Ngoài L4: mọi harness > 70 + điều phối Multi-Agent phức tạp + tầng tri thức/bộ nhớ dài hạn + quản trị thích ứng + red-teaming chủ động (MITRE ATLAS) + KPI kinh doanh (không còn chỉ hiệu quả tự động hoá).


PHẦN E — TỪNG HARNESS: NGƯỠNG "STRONG" ĐÒI HỎI GÌ

E1. H1 Context — Strong (>80) cần: sub-agent lấy được đường dẫn artifact từ context (không hardcode/đoán), context cập nhật sau mỗi step, có làm sạch khi stale.

E2. H2 Tool — Strong cần: tool có schema (input/output/error), registry (không hardcode URL/credential), idempotency key cho tool ghi, rate-limit + retry, audit log mỗi tool call. Chốt: chạy 2 lần vẫn safe.

E3. H3 Evaluation — Strong cần: golden dataset trước implement, LLM-as-judge tiêu chí rõ, gate cứng REJECTED dừng pipeline, auto-retry với fix agent, regression trước deploy, feedback từ production quay lại spec.

E4. H4 Security — Strong cần: scan prompt-injection input, không hardcode credential, chặn PII/secret vào log, sandbox/timeout tool, jailbreak detection, semantic recall ≥ 0.8 và > regex.

E5. H5 Governance — Strong cần: approval workflow trước action rủi ro cao, audit log BẤT BIẾN (không ai xoá được, kể cả admin), risk registry, policy engine (agent tự check quyền), báo cáo compliance. Chốt: trả lời được "ai làm gì, lúc nào, được ai duyệt".

E6. H6 AgentOps — Strong cần: đo cost/task (token/thời gian/tiền), track hallucination/error per step, alert khi step tốn bất thường, drift detection, dashboard throughput/latency. Chốt: "step tốn 3× token có ai biết không?" → CÓ.

E7. H7 Orchestration — Strong cần: DAG rõ (biết phụ thuộc), parallel cho step độc lập, BACK-TO-PLAN/retry khi gate fail, giới hạn retry (chống loop), fallback model, transaction rollback giữa pipeline.


PHẦN F — L0–L5 UỶ QUYỀN AI (khác với 5 cấp CASAN)

F1. 6 mức uỷ quyền:

Mức Tên Ý nghĩa Ví dụ
L0 Observe quan sát/tóm tắt/phân loại, không đổi hệ thống tóm tắt họp, phân loại ticket
L1 Draft AI nháp, người duyệt 100% nháp email/code
L2 Recommend AI đề xuất, người quyết đề xuất giá, chiến lược test
L3 Execute bounded thực thi rủi ro thấp, giới hạn rõ tạo test case, cập nhật tài liệu
L4 Operate workflow vận hành luồng có hàng rào + audit hỗ trợ KH tuyến 1, phân loại sự cố
L5 Restricted autonomy tự chủ cao vùng governance nghiêm ngặt giám sát gian lận, bảo trì phần mềm tự chủ

F2. Nguyên tắc thiết kế uỷ quyền: AI càng gần quyết định kinh doanh / càng gọi tool ghi / càng xử lý dữ liệu nhạy cảm → quản trị càng mạnh (định danh, RBAC, phê duyệt, hoàn tác, DLP). Tự chủ AI không phải quyền tuyệt đối — là quyền được thiết kế, đo lường và thu hồi được.

F3. Câu hỏi bắt buộc trước khi đưa agent vào production: AI được giao mục tiêu gì / ranh giới ở đâu / đọc-ghi hệ thống nào / bước nào tự quyết bước nào người duyệt / ai duyệt / sai thì hoàn tác thế nào / có kill switch không / đã kiểm thử đối kháng (MITRE ATLAS) chưa? Thiếu các câu này = doanh nghiệp bị AI quản lý, không phải quản lý AI.


PHẦN G — 6 TIÊU CHUẨN DỮ LIỆU (bắt buộc từ Level 3)

G1. 6 tiêu chuẩn: Đúng (phản ánh thực tế) · Đủ (đủ trường/phạm vi/thời gian) · Sạch (không trùng/rác, 1 thực thể 1 ID) · Sống (cập nhật thời gian thực) · Thống nhất (1 nguồn sự thật) · Dùng chung (chia sẻ giữa đơn vị).

G2. Ngưỡng: muốn đạt Level 3 trở lên → phải đạt ĐỦ 6 tiêu chuẩn. Không có dữ liệu sẵn sàng thì không thể chuyển đổi AI cấp doanh nghiệp.


PHẦN H — STACK BẢO MẬT THEO CẤP (áp dụng tích luỹ)

Cấp Bắt buộc kích hoạt
L1 NIST AI RMF (Govern khởi đầu); biết OWASP LLM Top 10 (tham khảo đào tạo)
L2 NIST Govern+Map; OWASP LLM01 (injection)/LLM02 (insecure output)/LLM06 (rò rỉ) cho Copilot
L3 NIST đủ 4 chức năng (Govern/Map/Measure/Manage); OWASP LLM Top 10 toàn diện; ISO 42001 readiness
L4 OWASP Agentic Top 10 baseline bắt buộc; CSA MAESTRO 7 lớp threat model bắt buộc; ISO 42001 chứng nhận; NIST Manage liên tục
L5 MITRE ATLAS red-teaming chủ động; EU AI Act; quản trị thích ứng đa khu vực pháp lý

H1. Cross-layer attack chain là gì (điểm MAESTRO nhấn mạnh)? Chuỗi tấn công vượt nhiều lớp: injection L1 → lạm dụng tool L3 → rò rỉ data L2 → hành động sai L4. Framework theo từng lớp riêng lẻ bỏ sót; MAESTRO bắt buộc nhận diện cho mọi agent từ L4.


PHẦN I — HUMAN-LED, VAI TRÒ, THƯƠNG MẠI

I1. Vai trò mới cốt lõi? Kỹ sư Harness (3 bậc: Operator/Engineer/Architect × Level 1/2/3), Kỹ sư Context, Tư vấn ngành AIX, Kiến trúc sư trưởng AIX. Vai trò bổ trợ: Kỹ sư kiểm định, Kỹ sư AgentOps, Trưởng quản trị AI.

I2. Copilot vs Autopilot? Copilot bán công cụ (tối ưu, dễ bị thay khi model tốt lên). Autopilot bán công việc (vận hành workflow có kết quả → hào sâu bền hơn nhờ vòng lặp dữ liệu + harness tích luỹ).

I3. Vì sao harness là "tài sản giữ lại"? Model có thể thành hàng hoá phổ biến; harness (điều phối, kiểm định, bảo mật, AgentOps) là IP khách hàng giữ được — đây là lớp khác biệt nhất trong "AI tự chủ 4 lớp".


PHẦN J — TÌNH HUỐNG (áp dụng ngưỡng)

J1. Một pipeline có H1=90, H3=88, H7=85 nhưng H4=20. CASAN Level? Không phải Level 4 — H4 là GAP (<30). Theo công thức: có ≥1 GAP → trần bị kéo xuống. Phải đưa H4 vượt 30 trước, rồi cả 7 >30 + trung bình >80 mới là L4 thật.

J2. Khách hàng L1–2 muốn triển khai "dịch vụ tự vận hành" (agent làm trọn quy trình) ngay? Không nên — cần tối thiểu Level 3 về dữ liệu/quản trị/luồng/kiểm định. Nhảy thẳng L4, agent dễ gây sự cố production.

J3. Đội khoe "đã triển khai AI" vì dùng Copilot nhiều? Đó là ảo giác Level 2. Năng suất Copilot sẽ bão hoà nếu không lên L3 (chuẩn hoá + quản trị). Copilot ≠ chuyển đổi mô hình vận hành.

J4. Muốn nâng 1 harness từ 60 (Good) lên 80+ (Strong) làm gì? Thêm test đối kháng (dựng lại đúng cuộc tấn công) + fail-closed + đo được (định lượng). Vd H4: từ "chặn câu đã biết" → "recall model ≥0.8 trên corpus paraphrase mới".

J5. Giám khảo hỏi "cấp 5 khác cấp 4 chỗ nào ngắn gọn?" L4 = tự động hoá luồng công việc trên nền hệ thống cũ. L5 = kiến trúc lại doanh nghiệp quanh AI như hệ điều hành; KPI là đổi mới mô hình kinh doanh, không chỉ hiệu quả.


PHẦN K — CHECKLIST NGƯỠNG (in 1 trang)

  • Thuộc thang: 0–30 GAP · 31–60 Partial · 61–80 Good · 81–100 Strong.
  • Thuộc công thức Level (Average + số GAP).
  • Level 4 = 7 harness đều >30 + trung bình >80.
  • Level 5 = L4 + mọi harness >70 + Multi-Agent + KPI kinh doanh.
  • 6 tiêu chuẩn dữ liệu bắt buộc từ Level 3.
  • OWASP Agentic + MAESTRO bắt buộc từ Level 4; MITRE ATLAS từ Level 5.
  • L0–L5 uỷ quyền: càng gần quyết định/tool ghi/dữ liệu nhạy cảm → quản trị càng mạnh.
  • "Điểm = chứng minh được, không khai báo" + "harness thấp nhất quyết định trần".

Nguồn định nghĩa khung: FPT_CASAN_Full.md (5 cấp, 4 lớp tư duy, L0–L5, 6 tiêu chuẩn dữ liệu, stack bảo mật) + casan_harness_assessment.md (thang điểm harness + công thức Level). Các con số ở đây là ngưỡng khung chuẩn, không phải số đo của một dự án cụ thể.