Files
CASAN/optimize-docs/CASAN_TU_TUONG_QA.md
T
2026-07-02 22:17:03 +09:00

197 lines
17 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# CASAN — Q&A Tư tưởng & Ngưỡng đạt chuẩn (điểm → cần đạt gì)
> **Mục đích:** hiểu sâu **tư tưởng CASAN** và biết rõ **đạt bao nhiêu điểm thì phải làm được gì** ở mỗi harness và mỗi cấp.
> **Nguồn:** `FPT_CASAN_Full.md` + `casan_harness_assessment.md`. Đây là **định nghĩa khung** (không phải số đo của riêng dự án).
---
## PHẦN A — TƯ TƯỞNG NỀN
**A1. Vì sao CASAN ra đời?**
Giai đoạn 2025–2026, model nền tảng phổ biến/rẻ → lợi thế **không còn ở "có model"** mà ở khả năng biến model thành **hệ thống doanh nghiệp thật**: đúng dữ liệu, đúng ngữ cảnh, đúng công cụ, đúng quyền, có kiểm định, có hàng rào, có AgentOps, có hoàn tác, có trách nhiệm giải trình, có kết quả kinh doanh.
**A2. CASAN là gì trong 1 câu?**
Khung Năng lực AI-Native **5 cấp** (Curious→Augmented→Standard→Automated→Native) do FPT phát triển để đánh giá và dẫn dắt chuyển đổi AI.
**A3. CASAN trả lời 4 câu hỏi nào?**
(1) Đang ở đâu? (2) Cần làm gì để lên cấp? (3) FPT cung cấp dịch vụ/nền tảng/nhân lực/IP gì mỗi cấp? (4) Làm sao AI tạo giá trị kinh doanh thật, không chỉ thử nghiệm?
**A4. Triết lý cốt lõi (thuộc lòng)?**
- **"Điểm = thứ chứng minh được, không phải thứ khai báo"** → có file ≠ có năng lực.
- **"Harness thấp nhất quyết định trần"** → không nhảy cấp bằng cách mua nhiều agent.
- **"Thu hẹp khoảng cách từ trình diễn đến vận hành thật"** → demo ≠ production.
**A5. Rủi ro Agentic AI khác rủi ro LLM thường thế nào?**
LLM thường: AI **trả lời sai**. Agentic: AI **hành động sai / vượt quyền / bị chiếm quyền để hành động thay**. Vì agent đọc dữ liệu, gọi tool, ghi hệ thống, gửi mail → bề mặt tấn công lớn hơn nhiều.
---
## PHẦN B — 4 LỚP TƯ DUY NGUYÊN BẢN
**B1. Harness Engineering?** Lớp kỹ thuật bao quanh model (7 thành phần). Đây là **điểm khác biệt kỹ thuật quan trọng nhất** — model có thể thay, harness là tài sản giữ lại.
**B2. Computational × Inferential Blend?** Kết hợp tầng **tính toán** (ERP/core banking/rule engine — chính xác, kiểm toán được) với tầng **suy luận** (LLM — hiểu ngữ cảnh, xử lý phi cấu trúc). Không thay hết bằng LLM; chia ranh giới rõ: phần nào logic xác định, phần nào AI, phần nào người duyệt.
**B3. Human-led, AI-first?** Con người giữ mục tiêu/giá trị/đạo đức/trách nhiệm cuối; AI là **lớp năng lực thực thi đầu tiên** mở rộng năng lực con người trong harness có kiểm soát. Tránh 2 cực đoan: coi AI là phụ trợ nhỏ / trao quyền quá nhanh thiếu kiểm soát.
**B4. AI Delegation Architecture?** Khung phân quyền cho AI (L0–L5): AI được làm gì, dùng dữ liệu nào, gọi tool nào, ai duyệt, rollback thế nào, ai chịu trách nhiệm. Rào cản Agentic AI **không nằm ở model làm được không**, mà ở **tổ chức có dám giao việc trong production không**.
---
## PHẦN C — 5 CẤP CASAN: MỖI CẤP CẦN ĐẠT GÌ
**C1. Cấp 1 — Curious (xưởng thủ công): cần đạt gì để coi là ở cấp này / lên cấp?**
Đặc điểm: dùng AI cá nhân rời rạc, chưa chuẩn, chưa quản trị. **Để lên L2 phải:** ban hành Acceptable Use Policy, xác định dữ liệu cấm đưa vào AI công cộng, cấp phép công cụ AI, chọn 5–10 use case năng suất, đào tạo dùng AI an toàn, đo thời gian tiết kiệm.
**C2. Cấp 2 — Augmented (dây chuyền lắp ráp): cần gì?**
Đặc điểm: công cụ AI chính thức (Copilot/M365), DLP cấp endpoint, AUP đã ban hành, một số quy trình cải thiện. **Để lên L3 phải:** danh mục use case theo tác động/rủi ro, chuẩn hoá dữ liệu, phân loại + nhãn nhạy cảm + RBAC, vòng đời AI đầy đủ, thư viện prompt/mẫu agent/bộ kiểm định, hội đồng quản trị AI, các vai trò chuyên trách.
**C3. Cấp 3 — Standard (nhà máy thông minh): cần gì?**
Đặc điểm: đã chuẩn hoá dữ liệu/quy trình/chính sách/nền tảng. **Bắt buộc ĐẠT ĐỦ 6 tiêu chuẩn dữ liệu.** Sở hữu **harness chung**, sổ đăng ký agent, danh mục tool có schema, đường ống kiểm định hồi quy trước deploy, RAG chuẩn, giám sát chi phí/chất lượng, ISO 42001 readiness. **Để lên L4:** agent hoá luồng công việc có kiểm soát.
**C4. Cấp 4 — Automated (điểm bứt phá giá trị): cần gì?**
Đặc điểm: **AI Agent vận hành luồng công việc thật** có kiểm soát. Cần: **đủ 7 harness ở mức vận hành** (đặc biệt Tool/Security/Governance/AgentOps/Orchestration); AgentOps giám sát hiệu năng/chi phí/ảo giác/lỗi; **control plane** (quyền, phê duyệt, hoàn tác, audit); **định danh riêng mỗi agent**; **kill switch + rollback đã kiểm thử**; kiểm thử prompt-injection/jailbreak/rò rỉ trước production.
**C5. Cấp 5 — Native (vận hành trên "hệ điều hành AI"): cần gì?**
Đặc điểm: **kiến trúc lại doanh nghiệp quanh AI**. Cần: điều phối Multi-Agent phức tạp, tầng tri thức + bộ nhớ agent dài hạn là tầng kiến trúc thật, dữ liệu phục vụ suy luận thời gian thực + học liên tục, quản trị thích ứng, red-teaming chủ động. **KPI chuyển từ "hiệu quả tự động hoá" sang "đổi mới mô hình kinh doanh / tăng doanh thu / trải nghiệm KH / tốc độ học".** Cần cam kết của Chủ tịch/HĐQT.
**C6. Nguyên tắc chuyển cấp bất biến?**
Cấp cao **kế thừa** cấp dưới (L5 vẫn cần năng lực L1–L4). **Không nhảy cấp.** Không kéo dài L2 quá lâu (Copilot tạo ảo giác "đã làm AI"). **L4 là điểm bứt phá giá trị**; **L5 là quyết định kiến trúc lại**.
---
## PHẦN D — THANG ĐIỂM HARNESS: ĐIỂM BAO NHIÊU = CẤP GÌ
**D1. Thang điểm 1 harness (0–100) nghĩa là gì?**
| Điểm | Mức | Ý nghĩa |
|---|---|---|
| **0–30** | **GAP** | Gần như không có control này, rủi ro cao |
| **31–60** | **Partial** | Có vài cơ chế nhưng thiếu bài bản |
| **61–80** | **Good** | Hoạt động tốt, còn điểm cần cứng hoá |
| **81–100** | **Strong** | Đủ tiêu chuẩn vận hành thật |
**D2. Công thức quy đổi ra CASAN Level?**
```
Average = (H1+…+H7)/7
Critical GAP = bất kỳ harness nào < 30
```
| Điều kiện | CASAN Level |
|---|---|
| Average < 40 **hoặc** ≥ 3 GAP | **Level 2 — Augmented** |
| Average 40–65, ≤ 2 GAP | **Level 3 — Standard** |
| Average 65–80, ≤ 1 GAP | **Level 3 → 4 (đang chuyển)** |
| Average > 80, **không GAP** | **Level 4 — Automated** |
| Average > 80 **+ tất cả > 70** + Multi-Agent phức tạp | **Level 5 — Native** |
**D3. "Đạt điểm bao nhiêu thì cần chứng minh được gì?" — bảng cụ thể:**
| Ngưỡng harness | Phải chứng minh được (bằng tấn công/lệnh, không khai báo) |
|---|---|
| **Vượt 30 (thoát GAP)** | Control **tồn tại và chạy** — vd H4 chặn được 1 câu injection kinh điển (rc=2). |
| **Vượt 60 (Good)** | Control **có bài bản**: có positive + negative test, có audit/log, không chỉ happy-path. Vd H6 vừa `COST_SPIKE_DETECTED` (có spike) vừa `COST_SPIKE_NONE` (không spike). |
| **Vượt 80 (Strong)** | Control **chống được tấn công đối kháng thật + fail-closed + đo được**: vd H4 recall model ≥ 0.8 **và > regex**; H5 sửa 1 ký tự → HASH_MISMATCH; H2 tool sai schema bị chặn + tool treo bị timeout. |
**D4. Muốn tuyên bố "Level 4 thật" cần gì (chốt)?**
**Cả 7 harness đều > 30 (không GAP) VÀ trung bình > 80.** Không được có 1 harness dưới 30 dù các harness khác cao — vì "harness thấp nhất quyết định trần".
**D5. Muốn lên Level 5 cần gì thêm so với L4?**
Ngoài L4: **mọi harness > 70** + điều phối **Multi-Agent phức tạp** + tầng tri thức/bộ nhớ dài hạn + quản trị thích ứng + red-teaming chủ động (MITRE ATLAS) + KPI kinh doanh (không còn chỉ hiệu quả tự động hoá).
---
## PHẦN E — TỪNG HARNESS: NGƯỠNG "STRONG" ĐÒI HỎI GÌ
**E1. H1 Context — Strong (>80) cần:** sub-agent lấy được đường dẫn artifact từ context (không hardcode/đoán), context cập nhật sau mỗi step, có làm sạch khi stale.
**E2. H2 Tool — Strong cần:** tool có schema (input/output/error), registry (không hardcode URL/credential), **idempotency key** cho tool ghi, rate-limit + retry, **audit log mỗi tool call**. Chốt: chạy 2 lần vẫn safe.
**E3. H3 Evaluation — Strong cần:** golden dataset **trước** implement, LLM-as-judge tiêu chí rõ, **gate cứng REJECTED dừng pipeline**, auto-retry với fix agent, regression trước deploy, feedback từ production quay lại spec.
**E4. H4 Security — Strong cần:** scan prompt-injection input, **không hardcode credential**, chặn PII/secret vào log, **sandbox/timeout tool**, jailbreak detection, **semantic recall ≥ 0.8 và > regex**.
**E5. H5 Governance — Strong cần:** approval workflow trước action rủi ro cao, **audit log BẤT BIẾN** (không ai xoá được, kể cả admin), risk registry, policy engine (agent tự check quyền), báo cáo compliance. Chốt: trả lời được *"ai làm gì, lúc nào, được ai duyệt"*.
**E6. H6 AgentOps — Strong cần:** đo **cost/task** (token/thời gian/tiền), track hallucination/error per step, **alert khi step tốn bất thường**, drift detection, dashboard throughput/latency. Chốt: *"step tốn 3× token có ai biết không?"* → CÓ.
**E7. H7 Orchestration — Strong cần:** DAG rõ (biết phụ thuộc), parallel cho step độc lập, **BACK-TO-PLAN/retry** khi gate fail, giới hạn retry (chống loop), **fallback model**, **transaction rollback** giữa pipeline.
---
## PHẦN F — L0–L5 UỶ QUYỀN AI (khác với 5 cấp CASAN)
**F1. 6 mức uỷ quyền:**
| Mức | Tên | Ý nghĩa | Ví dụ |
|---|---|---|---|
| L0 | Observe | quan sát/tóm tắt/phân loại, không đổi hệ thống | tóm tắt họp, phân loại ticket |
| L1 | Draft | AI nháp, người duyệt 100% | nháp email/code |
| L2 | Recommend | AI đề xuất, người quyết | đề xuất giá, chiến lược test |
| L3 | Execute bounded | thực thi rủi ro thấp, giới hạn rõ | tạo test case, cập nhật tài liệu |
| L4 | Operate workflow | vận hành luồng có hàng rào + audit | hỗ trợ KH tuyến 1, phân loại sự cố |
| L5 | Restricted autonomy | tự chủ cao vùng governance nghiêm ngặt | giám sát gian lận, bảo trì phần mềm tự chủ |
**F2. Nguyên tắc thiết kế uỷ quyền:** AI càng gần quyết định kinh doanh / càng gọi tool ghi / càng xử lý dữ liệu nhạy cảm → **quản trị càng mạnh** (định danh, RBAC, phê duyệt, hoàn tác, DLP). Tự chủ AI **không phải quyền tuyệt đối** — là quyền được thiết kế, đo lường và **thu hồi được**.
**F3. Câu hỏi bắt buộc trước khi đưa agent vào production:** AI được giao mục tiêu gì / ranh giới ở đâu / đọc-ghi hệ thống nào / bước nào tự quyết bước nào người duyệt / ai duyệt / sai thì hoàn tác thế nào / có kill switch không / đã kiểm thử đối kháng (MITRE ATLAS) chưa? **Thiếu các câu này = doanh nghiệp bị AI quản lý, không phải quản lý AI.**
---
## PHẦN G — 6 TIÊU CHUẨN DỮ LIỆU (bắt buộc từ Level 3)
**G1. 6 tiêu chuẩn:** **Đúng** (phản ánh thực tế) · **Đủ** (đủ trường/phạm vi/thời gian) · **Sạch** (không trùng/rác, 1 thực thể 1 ID) · **Sống** (cập nhật thời gian thực) · **Thống nhất** (1 nguồn sự thật) · **Dùng chung** (chia sẻ giữa đơn vị).
**G2. Ngưỡng:** muốn đạt **Level 3 trở lên → phải đạt ĐỦ 6 tiêu chuẩn**. Không có dữ liệu sẵn sàng thì không thể chuyển đổi AI cấp doanh nghiệp.
---
## PHẦN H — STACK BẢO MẬT THEO CẤP (áp dụng tích luỹ)
| Cấp | Bắt buộc kích hoạt |
|---|---|
| **L1** | NIST AI RMF (Govern khởi đầu); biết OWASP LLM Top 10 (tham khảo đào tạo) |
| **L2** | NIST Govern+Map; OWASP LLM01 (injection)/LLM02 (insecure output)/LLM06 (rò rỉ) cho Copilot |
| **L3** | NIST đủ 4 chức năng (Govern/Map/Measure/Manage); OWASP LLM Top 10 toàn diện; ISO 42001 readiness |
| **L4** | **OWASP Agentic Top 10 baseline bắt buộc**; **CSA MAESTRO 7 lớp threat model bắt buộc**; ISO 42001 chứng nhận; NIST Manage liên tục |
| **L5** | **MITRE ATLAS** red-teaming chủ động; EU AI Act; quản trị thích ứng đa khu vực pháp lý |
**H1. Cross-layer attack chain là gì (điểm MAESTRO nhấn mạnh)?** Chuỗi tấn công vượt nhiều lớp: injection L1 → lạm dụng tool L3 → rò rỉ data L2 → hành động sai L4. Framework theo từng lớp riêng lẻ **bỏ sót**; MAESTRO **bắt buộc nhận diện** cho mọi agent từ L4.
---
## PHẦN I — HUMAN-LED, VAI TRÒ, THƯƠNG MẠI
**I1. Vai trò mới cốt lõi?** Kỹ sư Harness (3 bậc: Operator/Engineer/Architect × Level 1/2/3), Kỹ sư Context, Tư vấn ngành AIX, Kiến trúc sư trưởng AIX. Vai trò bổ trợ: Kỹ sư kiểm định, Kỹ sư AgentOps, Trưởng quản trị AI.
**I2. Copilot vs Autopilot?** Copilot **bán công cụ** (tối ưu, dễ bị thay khi model tốt lên). Autopilot **bán công việc** (vận hành workflow có kết quả → hào sâu bền hơn nhờ vòng lặp dữ liệu + harness tích luỹ).
**I3. Vì sao harness là "tài sản giữ lại"?** Model có thể thành hàng hoá phổ biến; **harness (điều phối, kiểm định, bảo mật, AgentOps) là IP** khách hàng giữ được — đây là lớp khác biệt nhất trong "AI tự chủ 4 lớp".
---
## PHẦN J — TÌNH HUỐNG (áp dụng ngưỡng)
**J1. Một pipeline có H1=90, H3=88, H7=85 nhưng H4=20. CASAN Level?** **Không phải Level 4** — H4 là GAP (<30). Theo công thức: có ≥1 GAP → trần bị kéo xuống. Phải đưa H4 vượt 30 trước, rồi cả 7 >30 + trung bình >80 mới là L4 thật.
**J2. Khách hàng L1–2 muốn triển khai "dịch vụ tự vận hành" (agent làm trọn quy trình) ngay?** Không nên — cần **tối thiểu Level 3** về dữ liệu/quản trị/luồng/kiểm định. Nhảy thẳng L4, agent dễ gây sự cố production.
**J3. Đội khoe "đã triển khai AI" vì dùng Copilot nhiều?** Đó là **ảo giác Level 2**. Năng suất Copilot sẽ bão hoà nếu không lên L3 (chuẩn hoá + quản trị). Copilot ≠ chuyển đổi mô hình vận hành.
**J4. Muốn nâng 1 harness từ 60 (Good) lên 80+ (Strong) làm gì?** Thêm **test đối kháng** (dựng lại đúng cuộc tấn công) + **fail-closed** + **đo được** (định lượng). Vd H4: từ "chặn câu đã biết" → "recall model ≥0.8 trên corpus paraphrase mới".
**J5. Giám khảo hỏi "cấp 5 khác cấp 4 chỗ nào ngắn gọn?"** L4 = **tự động hoá luồng công việc** trên nền hệ thống cũ. L5 = **kiến trúc lại doanh nghiệp quanh AI** như hệ điều hành; KPI là đổi mới mô hình kinh doanh, không chỉ hiệu quả.
---
## PHẦN K — CHECKLIST NGƯỠNG (in 1 trang)
- [ ] Thuộc thang: 0–30 GAP · 31–60 Partial · 61–80 Good · 81–100 Strong.
- [ ] Thuộc công thức Level (Average + số GAP).
- [ ] **Level 4 = 7 harness đều >30 + trung bình >80.**
- [ ] **Level 5 = L4 + mọi harness >70 + Multi-Agent + KPI kinh doanh.**
- [ ] 6 tiêu chuẩn dữ liệu bắt buộc từ **Level 3**.
- [ ] OWASP Agentic + MAESTRO bắt buộc từ **Level 4**; MITRE ATLAS từ **Level 5**.
- [ ] L0–L5 uỷ quyền: càng gần quyết định/tool ghi/dữ liệu nhạy cảm → quản trị càng mạnh.
- [ ] "Điểm = chứng minh được, không khai báo" + "harness thấp nhất quyết định trần".
---
_Nguồn định nghĩa khung: `FPT_CASAN_Full.md` (5 cấp, 4 lớp tư duy, L0–L5, 6 tiêu chuẩn dữ liệu, stack bảo mật) + `casan_harness_assessment.md` (thang điểm harness + công thức Level). Các con số ở đây là **ngưỡng khung chuẩn**, không phải số đo của một dự án cụ thể._