SDD Framework

Giới thiệu SDD Framework

Kỷ luật kỹ nghệ cho kỷ nguyên AI

AI là một chiếc máy khuếch đại: nó nhân năng suất của đội ngũ có hệ thống kiểm soát, và khuếch đại sự hỗn loạn của đội ngũ thiếu nó. SDD Framework chính là hệ thống kiểm soát đó — cưỡng chế bằng máy, kiểm toán được, chạy trên coding agent mạnh nhất hiện có.

Đặt lịch demo 90 phút

Trên chính repo của bạn. Không cần chuẩn bị gì.

“Một đặc tả không được cưỡng chế thực thi thì chỉ là một lời gợi ý.”

Công cụ khác sinh ra đặc tả rồi hy vọng AI tuân theo. SDD cưỡng chế chúng: gate chặn CI, hook chặn ở tầng công cụ, nhật ký quyết định chuỗi hash.

  • 90%

    lập trình viên đang dùng AI trong công việc

    DORA 2025

  • 66%

    nói “gần đúng nhưng không đúng hẳn” là nỗi bực bội số 1

    Stack Overflow 2025

  • 45%

    code do AI sinh ra chứa lỗ hổng bảo mật

    Veracode 2025

  • 95%

    pilot GenAI doanh nghiệp không ra kết quả P&L đo được

    MIT NANDA 2025

Nỗi đau thật sự khi dùng AI phát triển phần mềm

Không phải cảm nhận — đây là dữ liệu 2024–2025 từ các nghiên cứu quy mô lớn nhất trong ngành.

  • –19%

    Ảo giác năng suất

    Thử nghiệm đối chứng ngẫu nhiên trên các maintainer kỳ cựu với repo 1 triệu+ dòng code: AI khiến họ chậm hơn 19% — trong khi chính họ tin rằng mình nhanh hơn 20%. 30% cuối của mỗi tác vụ (trường hợp biên, bảo mật, production) vẫn khó y như trước.

    METR RCT 2025 · Addy Osmani 2024

  • ×8

    Chất lượng code xuống cấp có hệ thống

    Trên 211 triệu dòng code thay đổi: khối code trùng lặp tăng 8 lần trong 2024, copy-paste lần đầu vượt refactoring, churn gần gấp đôi. Đó là khoản nợ bảo trì doanh nghiệp sẽ trả trong 3–5 năm tới.

    GitClear 2025

  • 45%

    Mặc định không an toàn

    45% code AI sinh ra mang lỗ hổng (Java: 72%) — và mô hình mới hơn không hề an toàn hơn. Tệ hơn: 19,7% package mà LLM gợi ý không hề tồn tại, nuôi lớp tấn công chuỗi cung ứng “slopsquatting”.

    Veracode 2025 · USENIX Security 2025

  • –7,2%

    Nhanh hơn, nhưng kém ổn định hơn

    DORA 2024 đo mỗi mức tăng áp dụng AI đi kèm –7,2% độ ổn định bàn giao; báo cáo 2025 cho thấy sự bất ổn vẫn còn nguyên. AI chỉ sinh lợi ở nơi đã có hệ thống kiểm soát — test, truy vết, phản hồi nhanh.

    DORA 2024 / 2025

  • 95%

    Pilot không bao giờ chạm tới P&L

    MIT khảo sát 300+ sáng kiến GenAI doanh nghiệp: 95% không có tác động tài chính đo được. Nguyên nhân gốc được nêu tên không phải chất lượng mô hình — mà là tích hợp sai vào quy trình. Gartner dự báo ≥30% bị bỏ sau PoC.

    MIT NANDA 2025 · Gartner

  • DB×0

    Khi không có hàng rào bảo vệ

    Tháng 7/2025: trong một phiên vibe-coding được tường thuật rộng rãi, một AI agent xoá cơ sở dữ liệu production ngay trong thời gian code freeze, rồi tự tạo ~4.000 bản ghi giả để che dấu vết. Mọi biện pháp vá sau sự cố đều là thứ một pipeline có gate cưỡng chế từ trước.

    Fortune · The Register · AI Incident DB #1152

SDD Framework: hệ điều hành kỷ luật

Bộ phương pháp luận đóng gói thành công cụ trên Claude Code: biến một yêu cầu mơ hồ thành phần mềm hoạt động, truy vết đầy đủ, đạt chuẩn kiểm toán, qua 6 phase có kỷ luật. Thiết kế cho doanh nghiệp, ngành chịu quản lý nghiêm ngặt, ERP/fintech. Bản địa tiếng Việt trong toàn bộ vòng đời.

SPECIFY → PLAN → TASKS → IMPLEMENT → VERIFY → REVIEW → (REPORT)

Mỗi phase kết thúc tại một gate chất lượng cứng. Gate trượt không bao giờ im lặng — nó nhảy thẳng đến báo cáo mà con người luôn nhìn thấy.

Bốn điều khoản xương sống trong Hiến chương 8 điều

  • 01

    Đặc tả là nguồn chân lý duy nhất

    Code lệch spec thì spec thắng. Spec sai thì sửa spec trước, rồi mới sửa code kèm regression test.

  • 02

    Truy vết là bất khả nhượng

    Mọi yêu cầu truy vết spec → task → code → test → commit, kiểm chứng bằng máy, không bằng lời hứa.

  • 03

    TDD là bắt buộc

    Test phải FAIL trước; hành vi sửa test cho pass bị hook chặn.

  • 04

    Gate trượt phải kêu to

    Không có gì bị bỏ qua âm thầm. Mọi thất bại tạo một hồ sơ tường minh.

Mỗi nỗi đau, một cơ chế trả lời

Hãy đọc cột bên phải như danh sách những rủi ro đội của bạn thôi phải tự gánh — không dòng nào là lời hứa trong prompt; mỗi dòng là một cơ chế bật lên được từ ngày đầu.

  • “Gần đúng nhưng không đúng hẳn”

    Yêu cầu chuẩn EARS + Given/When/Then với tiêu chí nghiệm thu đánh số; gate buộc mỗi kịch bản có ít nhất một test trích dẫn. “Gần đúng” không qua nổi gate.

  • AI sửa test cho “xanh”

    20 hook cưỡng chế nối qua hooks.json ở tầng công cụ: chặn sửa test để pass, chặn viết code trước khi có failing test, chặn commit khi gate đỏ (bật qua cấu hình). Chặn cơ học, không phải lời dặn trong prompt.

  • 45% code AI có lỗ hổng

    Bộ gate bảo mật đầy đủ — secrets đã commit, mẫu CWE, SSRF, CVE trong dependency, injection, PII — cộng lăng kính review OWASP và sinh SBOM, ngay trong pipeline.

  • Không ai kiểm toán được quyết định của AI

    Mọi quyết định tự hành được phân loại rủi ro và ghi append-only vào nhật ký chuỗi hash (chuẩn IETF AAT); ký HMAC-SHA256 bằng khoá vận hành viên giữ — chống giả mạo thật sự.

  • Sự cố kiểu Replit

    Phân quyền bằng cấu trúc: reviewer không có quyền ghi (cưỡng chế bằng allowlist công cụ), worktree có write-lock, quyết định CRITICAL phải qua critic độc lập.

  • 95% pilot chết ở khâu tích hợp

    SDD chính là quy trình — 6 phase, gate, vai trò, audit — không phải một chatbot gắn thêm. DORA nói AI khuếch đại hệ thống kiểm soát của bạn; SDD là hệ thống đó, cài đặt sẵn.

Xem nó chạy

Chính website này được build bằng pipeline SDD. Đoạn replay dưới đây rút gọn phiên chạy gần nhất: mọi con số đối chiếu được với QUALITY_REPORT.md đã commit, đến tận dòng marker cuối.

/pipeline

IMPLEMENT · 4 task, TDD trước: test fail có trước code — RED thật, rồi mới GREEN

✓ APPROVED · vòng review theo từng task

VERIFY · toàn bộ suite 349/349 xanh · truy vết FR → code → test · niêm phong evidence

✓ PASS · cổng verify

REVIEW · reviewer độc lập, không quyền ghi · critical 0 · major 0 · minor 0

✓ PASS · cổng review

REPORT · khối số liệu trong QUALITY_REPORT.md sinh bằng máy từ evidence đã niêm phong

%%SDD_GATE gate=report verdict=PASS must_fr_blocked=0

Số liệu từ QUALITY_REPORT.md của dự án — phiên pipeline 01484855, verdict PASS; dòng %%SDD_GATE đã lược bớt các trường kỹ thuật (head, session, evidence).

Buổi demo 90 phút chạy một phiên đúng như thế này trên chính repo của bạn.

33 kỹ năng phủ toàn bộ vòng đời

Ba tầng, kiểm chứng bằng máy: 12 kỹ năng core cho con đường hằng ngày, 18 advanced cho vòng đời và vận hành, 3 tích hợp enterprise — cộng 15 agent chuyên trách và chế độ tự hành không bao giờ dừng giữa pipeline để hỏi. Bạn không mua một công cụ: bạn nhận về một quy trình hoàn chỉnh đã đóng gói, đội ngũ hiện tại cài lên và chạy được ngay.

Core

12

Con đường hằng ngày — sáu phase, các bộ điều phối và vòng sửa lỗi.

  • /specify

    Trích xuất yêu cầu từ tài liệu nghiệp vụ thành SRS có cấu trúc, kiểm chứng được

  • /plan

    Thiết kế kiến trúc từ spec — module, mô hình dữ liệu, ADR

  • /tasks

    Bẻ spec + thiết kế thành DAG task nhóm theo milestone

  • /implement

    Implement một task theo TDD, kèm marker truy vết

  • /verify

    Gate kiểm chứng: test + truy vết + nghiệm thu + lint → PASS/WARN/FAIL

  • /review

    Review có cấu trúc so với spec: tuân thủ, OWASP, hiệu năng, boundaries

  • /pipeline

    Chạy phase 4→7 trọn gói; gate trượt nhảy thẳng về báo cáo

  • /autopilot

    Từ thư mục tài liệu yêu cầu đến phần mềm đã kiểm chứng — đầu-cuối

  • /bugfix

    Quy trình sửa lỗi TDD: regression test fail trước, sửa source, không bao giờ sửa test

  • /change

    Cửa ngõ cho mọi thay đổi: phân loại, khảo sát ảnh hưởng, định tuyến, dừng ở DAG task

  • /security-scan

    Quét bảo mật đầy đủ: secrets, mẫu CWE, SSRF, CVE dependency, injection, PII + lăng kính OWASP

  • /sdd-help

    Thẻ hướng dẫn tất định cho từng kỹ năng — không LLM, không mạng

Advanced

18

Vòng đời và vận hành: onboarding brownfield, quản trị thay đổi, cách ly, quan sát được.

  • /brief

    Khám phá theo vai BA: biến ý tưởng thô thành project brief

  • /clarify

    Vòng làm rõ có giới hạn trên taxonomy ~11 nhóm yêu cầu

  • /validate-specs

    Kiểm định chất lượng SRS và tính nhất quán liên tài liệu

  • /sdd-init

    Khởi tạo một lần: cấu hình scope + thư mục audit quyết định

  • /sdd-adopt

    Đưa codebase có sẵn lên chuẩn SDD ở bất kỳ độ chín nào, theo từng khoảng trống

  • /srs-from-source

    Dịch ngược SRS chuẩn IEEE 29148 từ code có sẵn (~12 stack)

  • /sdd-doctor

    Khám sức khoẻ tất định + tự sửa chữa cài đặt

  • /sdd-metrics

    KPI vận hành: tỷ lệ pass gate, khối lượng và cơ cấu rủi ro quyết định, tỷ lệ đảo ngược

  • /delta

    Đề xuất thay đổi mức-yêu-cầu — máy kiểm chứng, có phiên bản, quét đảo ngược

  • /architecture-change

    Thay đổi xuyên service: blast radius, spec trước code, theo thứ tự phụ thuộc

  • /subagent-implement

    Mỗi task một subagent mới, cách ly context, kèm vòng review riêng

  • /resume

    Nối lại pipeline gián đoạn từ checkpoint cuối; đảo ngược quyết định bằng --adjust

  • /worktree

    Worktree git cách ly để các phiên chạy song song không giẫm nhau

  • /finish-branch

    Đóng vòng đời nhánh: verify, merge/PR, dọn dẹp có kiểm chứng nguồn gốc

  • /trace-check

    Quét nhanh độ phủ FR → code → test kèm báo cáo tham chiếu mồ côi

  • /generate-guardrails

    Biên dịch quy tắc BOUNDARIES thành chặn quyền ở tầng công cụ

  • /ui-testgen

    Sinh test Playwright E2E bền vững từ tiêu chí nghiệm thu UI

  • /champion-mode

    Chế độ mentor: onboarding SDD cá nhân hoá cho thành viên mới

Enterprise

3

Tích hợp và tuân thủ (tầng experimental — bảo chứng kiểm toán bằng code là chuỗi hash).

  • /sync-jira

    Đồng bộ hai chiều yêu cầu/task SDD với Jira issue

  • /publish-confluence

    Xuất bản spec lên Confluence thành tri thức có phiên bản, tìm kiếm được

  • /audit-report

    Bundle báo cáo cho kiểm toán viên từ artifact SDD; hỗ trợ đầu ra tiếng Việt

  • Tự hành có hồ sơ

    Tại mọi điểm lẽ ra phải hỏi, agent quyết định qua chuỗi thẩm quyền 7 bước, phân loại rủi ro, ghi vào chuỗi hash. Quyết định CRITICAL phải qua critic độc lập; vận hành viên rà soát sau và đảo ngược được bất kỳ quyết định nào. Giao thư mục yêu cầu buổi tối; nhận về phần mềm đã implement, verify, review kèm đầy đủ “vì sao” của từng quyết định.

  • Ba vòng review độc lập

    Task → milestone → project, nhiều lăng kính mỗi vòng (tuân thủ spec → chất lượng code → adversarial). Reviewer về mặt cấu trúc không thể ghi code, và các lăng kính bổ sung (blind-hunter, drift-sentinel, UI-taste) chỉ chặn khi reviewer chính xác nhận độc lập — quy tắc hai chìa khoá.

  • Brownfield: cả codebase di sản của bạn

    /sdd-adopt đưa codebase đang tồn tại lên chuẩn SDD ở bất kỳ độ chín nào, theo từng khoảng trống. /srs-from-source dịch ngược SRS chuẩn IEEE 29148 từ repo 1.000+ file — công thức riêng cho .NET, Java, Python, JS/TS, Go, Rust, PHP, Ruby, Kotlin. Chưa đối thủ nào có năng lực này.

  • Quản trị thay đổi — câu trả lời cho “Waterfall?”

    /change phân loại và định tuyến mọi thay đổi được mô tả; /delta quản lý đề xuất mức-yêu-cầu có máy kiểm chứng; /architecture-change tính bán kính ảnh hưởng xuyên service và cập nhật spec trước code, theo thứ tự phụ thuộc. Thiết kế cho thay đổi liên tục, không phải tài liệu một-lần.

So với các công cụ nổi tiếng nhất

Thị trường đang bán hai thứ: tốc độ không quản trị (Cursor, Copilot, Devin, Codex) hoặc phương pháp luận không cưỡng chế (Spec Kit, Kiro, BMAD, Superpowers). SDD là lớp thứ ba mà công ty phần mềm nghiêm túc thật sự cần.

Năng lựcSDD FrameworkGitHub Spec KitAWS KiroBMAD-MethodSuperpowersCursor / CopilotDevin / Codex
Đặc tả có cấu trúc (EARS/GWT)✔ + gate độ sâu✔ template✔ EARS✔ PRD/story✘ tài liệu thiết kế, không phải SRS
Cưỡng chế đặc tả bằng máy (gate exit-code chặn CI)✔ 98 gate script✘ AI tự kiểm✘ agent tự chấm✘ advisory✘ dẫn dắt bằng skill
Truy vết FR → code → test, máy kiểm chứng✔ + commit trailer✘ không có RTMmột phần, module tuỳ chọn
TDD cưỡng chế bằng hook (chặn sửa test)✔ test-tamper · write-TDD · gate-stop✘ “Tests are OPTIONAL”✘ hook tự động hoá, không chặnchỉ trong module TEAskill TDD, không cưỡng chế bằng hook
Review độc lập nhiều vòng, reviewer không quyền ghi✔ 3 vòng, 15 agentpersona promptreview subagent 2 tầngreview PR một lượttự review, không độc lập
Nhật ký quyết định chuỗi hash, ký HMAC✔ IETF AATchỉ log truy cập
Tự hành có kiểm soát: critic độc lập + đảo ngược đượcsubagent điều phối, không auditagent mode, không audittự hành, không quản trị
Brownfield: dịch ngược SRS từ code có sẵn✔ IEEE 29148, ~12 stack✘ thiên greenfield✘ theo featuremột phần (tài liệu hoá dự án)✘ thiên greenfieldwiki tự động, không phải SRS
Quản trị thay đổi (delta spec, blast radius đa service)sửa tay tài liệu
Security scan + SBOM + guardrails sinh tự độngquét credential cơ bảntuỳ sản phẩm đi kèm
Nền tảng báo cáo kiểm toán / tuân thủ✔ nền tảng hash-chain
Quy trình & tài liệu tiếng Việt bản địa✔ toàn vòng đời

Spec Kit xuất xưởng template ghi “Tests are OPTIONAL” và Constitution Check là AI tự kiểm. Kiro để agent tự chấm hoàn thành task, không có coverage gate. Ma trận truy vết của BMAD nằm trong module tuỳ chọn với phê duyệt advisory. Superpowers là đối thủ gần nhất — bộ phương pháp luận gồm các skill ghép được trên Claude Code, có quy trình TDD thực thụ và review subagent hai tầng — nhưng các skill chỉ dẫn dắt bằng prompt, không chặn ở tầng công cụ, và không kèm ma trận truy vết, nhật ký kiểm toán, bộ bảo mật hay vòng đời tiếng Việt. SOC 2 của Copilot Enterprise là tuân thủ ở cấp nhà cung cấp — không phải báo cáo kiểm toán cho quy trình phát triển của chính bạn. Nguồn và thời điểm: xem tài liệu tham chiếu đầy đủ.

Bài toán kinh tế của kỷ luật

Lợi ích đã chứng minh — khi AI được dùng đúng

  • 55%

    hoàn thành tác vụ nhanh hơn trong thử nghiệm đối chứng của GitHub

    GitHub RCT

  • +84%

    build thành công nhiều hơn trong nghiên cứu doanh nghiệp GitHub × Accenture

    GitHub × Accenture 2024

  • 35–45%

    sinh code nhanh hơn (nhưng <10% với tác vụ phức tạp — lợi ích dồn về nơi có cấu trúc)

    McKinsey 2023

  • 59%

    báo cáo chất lượng code tốt hơn — với điều kiện có hệ thống kiểm soát mạnh

    DORA 2025

Những khoản chảy máu âm thầm SDD chặn lại

Với một đội 20 kỹ sư dùng AI không quản trị, các dòng chi phí ẩn mà dữ liệu ngành chỉ ra — và cơ chế đóng từng dòng:

  • Rework code “gần đúng”

    Gate AC-coverage: mỗi kịch bản nghiệm thu phải có test trích dẫn trước khi qua phase.

  • Sự cố bảo mật từ code AI

    Bộ gate bảo mật + lăng kính OWASP chạy trong pipeline, không phải mỗi quý một lần.

  • Nợ bảo trì từ trùng lặp

    Kiến trúc thiết kế ở Phase 2 kèm ADR; ba vòng review soi chất lượng và tuân thủ.

  • Sự cố production do agent gây ra

    Hook chặn ở tầng công cụ, worktree cách ly có write-lock, critic độc lập cho quyết định CRITICAL.

  • Pilot chết sau PoC

    SDD là quy trình tích hợp sẵn — đúng “learning gap” mà MIT chỉ ra.

  • Tri thức hệ thống rời đi theo người

    SRS, DESIGN, ADR và audit log là sản phẩm phụ tự động của mỗi lần build.

Một phép tính minh hoạ để bạn tự thay số: 20 kỹ sư, chi phí bình quân 25 triệu đồng/người/tháng. Nếu chỉ 15% quỹ thời gian mất vào rework code AI “gần đúng” — thấp hơn nhiều mức khảo sát gợi ý — đó là 75 triệu đồng mỗi tháng, 900 triệu đồng mỗi năm, cho riêng một dòng lãng phí. Kỷ luật quy trình rẻ hơn nhiều so với cái giá của việc thiếu nó.

Vì sao tin được: SDD tự xây bằng chính SDD

Chúng tôi không đề nghị bạn tin vào slide. Các con số dưới đây đo trực tiếp từ repo của framework (14/7/2026):

  • 98

    gate script kiểm chứng bằng máy

    specs-framework/scripts/

  • 20

    hook cưỡng chế ở tầng công cụ

    hooks/hooks.json

  • 15

    agent reviewer/critic chuyên trách

    agents/

  • 33

    kỹ năng gọi được, 3 tầng

    skills/*/SKILL.md

  • 7.386

    hàm test của chính engine

    CI: Python 3.10–3.12

  • 14/14

    lỗi cài chủ đích bị bắt — 0 lọt lưới, 0 báo động giả

    evals/RESULTS.md

  • 81/81

    FR truy vết spec↔code↔test trong bản dogfood (100%)

    meta-sdd/QUALITY_REPORT.md

  • 190

    script Python vận hành engine tất định — máy móc, không phải prompt

    specs-framework/scripts/

Một chi tiết chúng tôi cố tình giữ lại: framework tự công bố giới hạn của mình — gate truy vết kiểm tra trích dẫn (tính đúng hành vi là việc của các vòng review), tích hợp enterprise đang experimental, số liệu eval mẫu nhỏ có ghi chú. Với ngành chịu kiểm toán, một nhà cung cấp biết chính xác ranh giới công cụ của mình đáng tin hơn một nhà cung cấp hứa mọi thứ.

Mô hình chuyển giao

Bộ công cụ private, chuyển giao trực tiếp. Hạ tầng tối giản: Claude Code + Python 3.10+ — gate chạy stdlib thuần ngay tại chỗ — ngoài chính Claude Code, không dịch vụ bên thứ ba nào chạm vào mã nguồn của bạn.

  1. Tuần 1 — Pilot

    Một dự án, mới hoặc brownfield. Đội ngũ chứng kiến pipeline và gate vận hành trên code của chính mình.

  2. Tuần 2–4 — Chuẩn hoá

    Cấu hình khẩu vị rủi ro (rigor profile, sàn review lenses, ký HMAC), onboarding đội ngũ bằng champion-mode.

  3. Từ tháng thứ 2 — Mở rộng

    Nhân bản sang các dự án khác; theo dõi tỷ lệ pass gate và cơ cấu quyết định bằng /sdd-metrics; tích hợp Jira/Confluence theo nhu cầu.

Xem SDD vận hành trên chính codebase của bạn

Một buổi demo 90 phút trên chính repo của bạn: /srs-from-source trên một hệ thống di sản, hoặc /autopilot trên một yêu cầu thật. Kỷ luật là thứ phải nhìn thấy vận hành — không phải nghe kể.

Đặt lịch demo

90 phút · trên repo của bạn · không cần chuẩn bị trước

Số liệu ngành: DORA 2024/2025, Stack Overflow Developer Survey 2025, METR 2025, GitClear 2025, Veracode 2025, USENIX Security 2025, MIT Project NANDA 2025, Gartner, GitHub/Accenture, McKinsey 2023. Số liệu framework đo từ repo SDD-Framework ngày 14/7/2026. Các con số biến động nhanh (sao GitHub, giá) tính tại thời điểm đó.

Đăng ký tư vấn

Để lại thông tin, chúng tôi sẽ liên hệ để tư vấn cách áp dụng SDD cho đội của bạn.