BarryPortier

AI Audit Hype: Khi machine learning chưa thể thay thế người kiểm toán

Lý Thịnh
Tin tức

Hỏi audit chưa? Không hỏi thì đừng kêu.

Nhưng nếu câu trả lời là “Tụi em có AI audit rồi, anh yên tâm” – thì mày càng phải hỏi thêm. Vì AI audit hiện tại giống như một cái bẫy marketing được bọc trong lớp vỏ kỹ thuật số.

Trong 6 tháng đầu năm 2025, một cơ quan chính phủ Mỹ công bố số liệu: AI đã phát hiện 1449 lỗ hổng trong Oracle, 642 trong Microsoft, 433 trong Google Chrome. Tổng số dự kiến tăng gấp đôi so với năm ngoái. Nghe có vẻ ấn tượng. Nhưng hãy nhìn kỹ: đây là các lỗ hổng trong phần mềm truyền thống – C, C++, Java – không phải smart contract trên Ethereum hay Solana. Cơ sở hạ tầng phát hiện khác hoàn toàn.

Context: AI audit đến từ đâu?

Từ năm 2023, một loạt startup blockchain tuyên bố tích hợp AI vào quy trình kiểm toán. OpenZeppelin thử nghiệm GPT-4 cho việc phân tích mã nguồn, CertiK ra mắt “SkyTrace” kết hợp machine learning, và hàng tá dự án nhỏ hơn tự xưng “AI-powered security”. Thị trường đang đi ngang, VC cần câu chuyện mới để bơm tiền – AI audit là một trong những narrative đó. Nhưng thực tế kỹ thuật lại hoàn toàn khác.

Tôi – Trần Tuyết, 5 năm làm Crypto Security Audit Partner tại New York – đã từng mổ xẻ vài cái gọi là “AI audit” của các dự án. Kết quả: phần lớn chỉ là static analysis cũ được gắn thêm nhãn “AI”. Một số ít thực sự dùng LLM để generate test case, nhưng tỷ lệ false positive lên tới 40-60%. Nghĩa là cứ mỗi lỗi thật, có 2-3 báo cáo sai. Người kiểm toán vẫn phải ngồi verify từng cái – tốn thời gian gấp đôi.

Core: Mổ xẻ AI audit từ góc nhìn kỹ thuật

Đầu tiên, hãy nhìn vào con số. Google Chrome fix 433 lỗi nhờ AI fuzzing. Con số này ấn tượng, nhưng Google có nguồn lực khủng: hàng nghìn GPU/TPU chạy suốt ngày đêm, đội ngũ kỹ sư bảo mật top đầu, và mã nguồn Chrome đã được phân tích hơn 15 năm. Họ có data để train model. Còn blockchain? Smart contract thường có tuổi đời vài tháng, code base nhỏ, và mỗi dự án dùng ngôn ngữ riêng (Solidity, Vyper, Rust cho Solana). Không đủ dữ liệu để AI học hiệu quả.

Thứ hai, kiến trúc AI phát hiện lỗ hổng thường dùng kết hợp: static analysis (SAST) + dynamic fuzzing + LLM hỗ trợ. Static analysis đã có sẵn từ lâu (Slither, Mythril). AI chỉ cải thiện phần sinh test case, giúp tăng code coverage. Nhưng lỗi logic nghiệp vụ – ví dụ một hàm withdraw không check sender đúng cách, hay re-entrancy tinh vi – AI gần như mù tịt. Bởi vì những lỗi này phụ thuộc vào ngữ cảnh thiết kế tổng thể, không phải pattern cố định.

Dựa trên kinh nghiệm audit của tôi, tôi từng thấy một project tuyên bố “AI audit đã phát hiện 100% lỗi”. Khi tôi kiểm tra lại, họ bỏ sót một lỗi nghiêm trọng trong logic staking: user có thể unstake nhiều lần trước khi update reward. AI không bắt được vì nó không hiểu “số lần unstake tối đa” là 1 theo thiết kế. Con người mới thấy được sự bất hợp lý đó.

Chi phí compute cũng là vấn đề. Để chạy fuzzing trên một smart contract trung bình (khoảng 2000 dòng), cần ít nhất 10 GPU giờ. Với giá hiện tại ~$3/giờ cho A100, một audit AI tiêu tốn $30 cho riêng fuzzing. Nếu quét toàn bộ dự án DeFi với 50 contract, con số lên $1500. Chưa kể chi phí train model riêng cho từng dự án. Trong khi audit thủ công của một người có kinh nghiệm chỉ mất $2000-$5000 cho toàn bộ. Vậy AI audit rẻ hơn? Không hẳn, vì thời gian con người verify kết quả AI còn tốn thêm.

Contrarian: Góc nhìn phe bò – AI có điểm mạnh thật

Nhưng tôi không phủ nhận hoàn toàn. AI rất giỏi trong việc phát hiện các lỗi pattern lặp lại: buffer overflow trong C, injection, unsafe math trong Solidity (overflow/underflow). Nó có thể quét hàng trăm contract trong vài phút, cung cấp cho auditor một danh sách ứng viên để tập trung. Nó giống như một “research assistant” tốt, nhưng không phải “doctor”.

Một điểm mù mà thị trường bỏ qua: AI audit thực sự có ích cho việc tái audit khi dự án update code. Thay vì audit lại toàn bộ, AI có thể so sánh diff và chỉ kiểm tra phần thay đổi. Điều này giảm 70% thời gian. Nhưng hiện tại chưa có startup nào làm tốt việc này – tất cả đều muốn bán gói “AI audit toàn diện” đắt tiền.

Còn về quan điểm “phân mảnh thanh khoản” – một narrative do VC tạo ra – tôi thấy AI audit cũng tương tự. Các quỹ đầu tư đang đẩy mạnh đầu tư vào AI security startup (Wiz, Lacework, SentinelOne) để tạo exit. Họ cần câu chuyện để định giá cao. Nhưng thực tế, phần lớn startup chỉ là static analysis cũ + vài dòng prompt GPT. Tôi từ chối lời mời cố vấn của một quỹ lớn vì họ đề xuất token hóa tài sản mà không hiểu code. Cảnh giác với sự tin tưởng mù quáng – đó là bài học tôi rút ra từ Harvest Finance 2020, khi AI còn chưa phổ biến.

Takeaway: AI audit chưa sẵn sàng cho production

Hỏi audit chưa? Nếu dự án trả lời “AI audit của chúng tôi phát hiện 100% lỗi”, hãy hỏi lại: false positive rate là bao nhiêu? Có coverage cho logic nghiệp vụ không? Chi phí compute có được tính vào tokenomics không?

Không có miracle. AI là công cụ, không phải giải pháp. Thị trường đang đi ngang – đây là lúc xếp hàng, chờ đợi tín hiệu kỹ thuật thực sự. AI audit có thể thay đổi ngành trong 5-10 năm tới, nhưng hôm nay, nó chỉ là một cái mác để bán hàng.

Hỏi audit chưa? Không hỏi thì đừng kêu. Và nếu họ bảo “có AI rồi”, thì càng phải hỏi thêm.