Tôi nhận được một câu hỏi từ một nhà đầu tư trong cộng đồng DeFi Bắc Ninh: "Chị Linh ơi, nếu mấy cái benchmark AI như MMLU, HumanEval đã bão hòa hết rồi, thì mấy dự án blockchain tuyên bố dùng AI để audit smart contract có đáng tin không?"

Câu hỏi này chạm vào một nút thắt mà tôi đã theo dõi suốt sáu tháng qua. Tháng 3 năm nay, Scott Wu – CEO của Cognition Labs, công ty đứng sau De vin – công bố trên Crypto Briefing rằng "các mô hình đã bão hòa trong mọi bài kiểm tra tiêu chuẩn" và ngành đang chuyển sang các phương pháp đánh giá độc quyền tập trung vào hiệu quả thực tế. Nói nôm na: bảng điểm công khai không còn phân biệt được ai giỏi nữa, mỗi công ty tự chế bài kiểm tra riêng để khoe thành tích.
Nghe quen không? Trong blockchain, chúng ta cũng từng chứng kiến cơn sốt TPS — mỗi layer-1 đều công bố hàng nghìn giao dịch mỗi giây trong môi trường thử nghiệm, nhưng khi mainnet chạy thật thì chỉ đạt vài trăm. Benchmark giống như điểm GPA: nếu ai cũng đạt 4.0 thì nó chẳng còn ý nghĩa gì. Dữ liệu on-chain cho thấy hiện tượng tương tự: 82% dự án DeFi trên Ethereum từng quảng cáo "đã qua audit bởi công ty hàng đầu" nhưng thực tế audit chỉ dừng ở mức phát hiện lỗi cú pháp, chưa từng mô phỏng tấn công flash loan phức hợp. Bằng chứng là trong năm 2023, 47% vụ hack DeFi xảy ra trên các hợp đồng đã được audit bởi ít nhất một đơn vị uy tín.

Chúng ta cần một thước đo mới – không phải TPS, không phải điểm audit, mà là "real-world resistance rate" – tỷ lệ sống sót trước các cuộc tấn công mô phỏng trong môi trường sandbox. Tôi gợi ý theo dõi chỉ số này: số lần contract bị khai thác thành công chia cho số lần kẻ tấn công thử. Theo dữ liệu từ Dune Analytics, các contract có tỷ lệ này >95% thường thuộc về những team thực hiện stress test hơn 500 lần trên testnet.
Có một góc phản trực giác: chính sự bão hòa của benchmark lại tạo ra cơ hội cho các nền tảng blockchain chuyên về xác thực phi tập trung. Nếu benchmark AI tập trung đã chết, hãy nhìn vào hướng ngược lại: dùng smart contract để tạo ra một hệ thống đánh giá mở, nơi mọi người đều có thể gửi test case và nhận phần thưởng nếu phát hiện sai sót của mô hình. Mô hình này giống như Immunefi cho AI, nhưng với on-chain verification. Một vài đội đã thử nghiệm, ví dụ như giao thức EigenLayer cho phép restake ETH để làm "validator đánh giá" và kiếm phí từ các công ty AI.

Takeaway cho tuần tới: Đừng mua vào bất kỳ dự án blockchain+AI nào chỉ dựa trên benchmark tuyên bố. Hãy yêu cầu họ public ba dữ liệu thô: (1) tất cả các lần fail trên testnet, (2) mã nguồn của bộ test riêng, (3) danh sách 50 địa chỉ ví ngẫu nhiên đã tương tác với hệ thống thật. Nếu họ từ chối, có lẽ họ cũng đang "bão hòa" giống Scott Wu nói – nhưng theo nghĩa tiêu cực.