Khi AI Agent Benchmark Lật Mở Một Sự Thật: Harness Quan Trọng Hơn Model, Và Điều Nó Có Ý Nghĩa Gì Cho Web3

Dương Tuệ Altcoin

Trong 7 ngày qua, một báo cáo benchmark từ Tencent đã lặng lẽ làm rung chuyển giới phát triển AI Agent. WorkBuddy Bench – bộ tiêu chuẩn do chính Tencent xây dựng – cho thấy CodeBuddy, sản phẩm Agent của họ, thua Claude Code trong 17 trên 28 lần so sánh trực tiếp trên cùng một mô hình nền tảng. Đặc biệt, ở mảng coding – mảng có giá trị thương mại cao nhất – CodeBuddy thua trắng 0-7.

Nếu bạn đang nghĩ đây chỉ là một câu chuyện AI nội bộ của Trung Quốc, hãy nghĩ lại. Bởi vì điều mà benchmark này thực sự tiết lộ – rằng lớp thực thi (harness) có thể quyết định hiệu suất Agent nhiều hơn chính mô hình – là một tín hiệu địa chấn cho toàn bộ hệ sinh thái Web3, nơi các AI Agent đang dần thay thế bot giao dịch, kiểm toán hợp đồng thông minh và quản lý thanh khoản.

Tôi đã dành 3 ngày để đọc lại toàn bộ dữ liệu, kiểm tra tính tự hợp lý của các con số, và đặt nó trong bối cảnh thị trường crypto hiện tại. Đây là những gì tôi tìm thấy.

Hook: Một benchmark không phải là sự thật, nó là một narrative.

Tencent công bố WorkBuddy Bench, một bộ 260 tác vụ chia làm 4 loại: coding, web, office, security. Họ chạy 7 mô hình khác nhau (không công bố tên cụ thể) trên hai harness: CodeBuddy và Claude Code. Kết quả: Claude Code thắng 17 lần, CodeBuddy thắng 11. Coding: Claude Code thắng 7/7. Web và Office: CodeBuddy thắng 4-3 mỗi loại. Security: Claude Code thắng 4-3.

Thoạt nhìn, đây là một thất bại truyền thông cho Tencent. Nhưng hãy nhìn kỹ: Tencent không có nghĩa vụ phải công bố benchmark này. Họ có thể im lặng, hoặc chỉ công bố những kết quả có lợi. Việc họ chọn cách 'tự vạch áo cho người xem lưng' là một hành động bất thường – và trong thế giới Web3, bất thường luôn chứa đựng cơ hội.

Context: Tại sao một benchmark AI lại quan trọng với Web3?

Hãy nhìn vào thị trường hiện tại. Chúng ta đang ở giai đoạn đầu của sự hội tụ giữa AI và crypto. Các dự án như Bittensor ($TAO) đang xây dựng mạng lưới đào tạo AI phi tập trung. Các quỹ đầu tư đang đổ tiền vào các agent giao dịch tự động dựa trên AI. Nhưng hầu hết các dự án này đều tập trung vào 'mô hình' – họ khoe khoang về số lượng tham số, điểm benchmark, khả năng suy luận.

Báo cáo của Tencent đặt ra một câu hỏi khó chịu: Nếu cùng một mô hình, chỉ thay đổi harness, cho ra kết quả chênh lệch hơn 10 điểm – thì việc chạy đua về mô hình có thực sự mang lại lợi thế cạnh tranh? Hay lợi thế thực sự nằm ở lớp trung gian – cách mà Agent quản lý ngữ cảnh, gọi công cụ, và phân tách tác vụ?

Trong Web3, điều này còn quan trọng hơn. Bởi vì các Agent trong crypto không chỉ đơn thuần là chatbot. Chúng phải tương tác với blockchain – ký giao dịch, gọi smart contract, quản lý danh mục đầu tư. Một harness kém có thể dẫn đến lỗi gọi hàm, trượt gas, hoặc tệ hơn – mất tiền.

Core: Phân tích kỹ thuật – Harness effect và bài học cho Web3

Hãy đi vào chi tiết. Dữ liệu của Tencent cho thấy: coding 7-0 nghiêng về Claude Code, trong khi web và office 4-3 nghiêng về CodeBuddy. Sự phân hóa này không phải ngẫu nhiên. Nó phản ánh sự khác biệt trong thiết kế harness.

Claude Code được tối ưu cho môi trường terminal – nơi lập trình viên làm việc với Git, file system, và command line. Harness của nó có khả năng duy trì ngữ cảnh qua nhiều lượt tương tác, quản lý lịch sử lệnh, và tự động sửa lỗi cú pháp. Trong khi đó, CodeBuddy có thể được tối ưu cho môi trường doanh nghiệp Trung Quốc – tích hợp sâu với WeChat Work, Tencent Docs, và các công cụ văn phòng. Điều này giải thích tại sao nó thắng ở mảng office và web.

Bài học cho Web3: Nếu bạn đang xây dựng một AI Agent cho giao dịch DeFi, đừng chỉ chọn mô hình mạnh nhất. Hãy đầu tư vào harness – cách Agent tương tác với blockchain, cách nó quản lý nonce, cách nó xử lý reorg, cách nó quyết định thời điểm swap. Một harness tốt có thể tạo ra khác biệt lớn hơn việc nâng cấp từ GPT-4 lên GPT-5.

Khi AI Agent Benchmark Lật Mở Một Sự Thật: Harness Quan Trọng Hơn Model, Và Điều Nó Có Ý Nghĩa Gì Cho Web3

Tôi nhớ lại kinh nghiệm của mình với Bittensor. Khi tôi mua $TAO ở giá $200 đầu năm 2025, tôi không chỉ tin vào mô hình – tôi tin vào cách mạng lưới này tổ chức các agent con (subnets) để thực hiện các tác vụ chuyên biệt. Mỗi subnet là một harness riêng, và sự khác biệt giữa subnet thành công và thất bại thường nằm ở thiết kế harness, không phải ở chất lượng dữ liệu huấn luyện.

Contrarian: Góc nhìn phản trực giác – Benchmark này có thể là một chiêu PR tinh vi

Hầu hết các bình luận đều cho rằng Tencent đang 'thừa nhận thất bại'. Nhưng tôi nhìn theo hướng ngược lại. Bằng cách công bố benchmark này, Tencent đang làm ba việc cùng lúc:

  1. Thiết lập tiêu chuẩn đánh giá: WorkBuddy Bench có thể trở thành 'tiêu chuẩn vàng' cho Agent trong doanh nghiệp Trung Quốc. Ai sở hữu benchmark, người đó định nghĩa sự thật.
  2. Xây dựng niềm tin bằng sự trung thực: Trong thế giới crypto, các dự án thường che giấu điểm yếu. Tencent chọn cách phơi bày nó – điều này tạo ra một 'trust layer' mà các đối thủ khó sao chép.
  3. Định vị lại CodeBuddy: Thay vì cạnh tranh trực diện với Claude Code ở mảng coding (nơi họ thua), họ muốn thị trường nhìn thấy thế mạnh ở office và web – nơi họ có lợi thế hệ sinh thái.

Trong bối cảnh thị trường crypto đang giảm, bài học này càng giá trị. Các dự án cần sống sót không phải bằng cách khoe khoang điểm benchmark, mà bằng cách xây dựng harness phù hợp với nhu cầu thực tế của người dùng. Một Agent giao dịch có thể thua ở benchmark coding, nhưng nếu nó thắng ở benchmark quản lý rủi ro – nơi người dùng thực sự quan tâm – thì nó vẫn có giá trị.

Takeaway: Câu hỏi cho tương lai

Đọc whitepaper trước, đầu tư sau. Nhưng với AI Agent trong Web3, có lẽ chúng ta cần đọc cả source code của harness nữa.

Báo cáo của Tencent đặt ra một câu hỏi mà tôi nghĩ mọi builder trong crypto nên tự hỏi: Nếu harness quan trọng hơn model, thì liệu các dự án AI đang tập trung sai vào việc train model thay vì xây dựng agent layer? Liệu có phải chúng ta đang đánh giá quá cao sức mạnh của mô hình và đánh giá thấp tầm quan trọng của thiết kế hệ thống?

Khi thị trường giảm, đây là lúc để nhìn lại những giả định cơ bản. Và benchmark này là một lời nhắc nhở: trong cuộc đua AI, người chiến thắng không phải là người có mô hình lớn nhất, mà là người có harness thông minh nhất. Trong Web3, điều đó càng đúng hơn bao giờ hết.

Giá thị trường

BTC Bitcoin
$64,099.8 -0.28%
ETH Ethereum
$1,910.24 +1.26%
SOL Solana
$76.76 +1.16%
BNB BNB Chain
$613.8 +1.00%
XRP XRP Ledger
$1.02 +1.82%
DOGE Dogecoin
$0.0719 +2.13%
ADA Cardano
$0.1869 -0.69%
AVAX Avalanche
$6.27 -3.26%
DOT Polkadot
$0.7896 -1.74%
LINK Chainlink
$8.83 +2.08%

Sợ & Tham

27

Sợ hãi

Tâm lý thị trường

Lịch sự kiện blockchain

{{年份}}
12
05
halving BCH Halving

Sự kiện giảm một nửa phần thưởng khối

18
03
unlock Mở khóa token Sui

Phần đội ngũ và nhà đầu tư sớm được giải phóng

08
04
upgrade Solana Firedancer

Trình xác thực độc lập ra mắt trên mainnet

22
03
unlock Mở khóa Optimism

Lượng cung lưu hành tăng khoảng 2%

30
04
upgrade Nâng cấp Celestia Mainnet

Cải thiện hiệu quả lấy mẫu tính khả dụng dữ liệu

10
05
upgrade Nâng cấp Ethereum Pectra

Tăng giới hạn validator và trừu tượng hóa tài khoản

15
04
halving Bitcoin Halving

Phần thưởng khối giảm xuống 3,125 BTC

28
03
unlock Mở khóa token Arbitrum

Giải phóng 92 triệu ARB

Vốn hóa thị trường

Tất cả →
# Tiền điện tử Giá
1
Bitcoin BTC
$64,099.8
1
Ethereum ETH
$1,910.24
1
Solana SOL
$76.76
1
BNB Chain BNB
$613.8
1
XRP Ledger XRP
$1.02
1
Dogecoin DOGE
$0.0719
1
Cardano ADA
$0.1869
1
Avalanche AVAX
$6.27
1
Polkadot DOT
$0.7896
1
Chainlink LINK
$8.83

🧮 Công cụ

Tất cả →

Chỉ số mùa altcoin

44

Mùa Bitcoin

Sự thống trị BTC Mùa altcoin

Theo dõi phí Gas

Ethereum 28 Gwei
BNB Chain 3 Gwei
Polygon 42 Gwei
Arbitrum 0.5 Gwei
Optimism 0.3 Gwei

🐋 Theo dõi cá voi

🔵
0x104c...0c2a
12 giờ trước
Stake
2,420 ETH
🔵
0xa8ca...4603
5 phút trước
Stake
4,475,651 DOGE
🔴
0x045c...3106
1 ngày trước
Chuyển ra
652.05 BTC

💡 Smart Money

0x3ad0...a405
Bot chênh lệch giá
+$3.4M
76%
0x31a6...2432
Nhà giao dịch on-chain dày dặn
+$1.1M
71%
0x6117...d5f9
Nhà đầu tư sớm
+$0.2M
64%