Một con số mới, một kịch bản cũ.
28 lần so sánh, 17-11. Claude Code áp đảo CodeBuddy trong các tác vụ lập trình, nhưng CodeBuddy lại thắng ở văn phòng và web. Con số này đến từ WorkBuddy Bench, benchmark mới của Tencent. Nhưng đằng sau những spike đó là gì? Và nó liên quan gì đến blockchain?
Bối cảnh: Tại sao một thám tử dữ liệu on-chain lại quan tâm đến benchmark AI?
Bởi vì lớp thực thi (harness) của AI Agent đang trở thành hạ tầng mới cho blockchain. Các dự án DeFi, NFT, và thậm chí cả Layer 2 đang dùng AI Agent để tự động hóa giao dịch, kiểm tra smart contract, và tối ưu hóa yield. Nếu một Agent thua kém trong tác vụ mã nguồn, điều đó có nghĩa là code của smart contract có thể bị kiểm tra sai. Và nếu dữ liệu không đáng tin, thì mọi kết luận đều vô giá trị.
Phân tích cốt lõi: Dữ liệu on-chain nói gì?
Tencent công bố 28 lần so sánh: 7 mô hình × 4 hạng mục (mã nguồn, web, văn phòng, bảo mật). Kết quả: Claude Code thắng 17 lần, CodeBuddy thắng 11. Điều đáng chú ý là trong hạng mục mã nguồn, Claude Code thắng tuyệt đối 7-0. Đây là hạng mục quan trọng nhất với blockchain: viết và kiểm tra smart contract, phân tích bytecode, tìm lỗ hổng.
Nhưng hãy nhìn kỹ: CodeBuddy thắng 4-3 ở web và văn phòng. Điều này cho thấy sự khác biệt không phải do mô hình nền tảng (vì cùng mô hình, chỉ khác harness), mà do thiết kế lớp thực thi. Claude Code có ưu thế về quản lý ngữ cảnh và gọi công cụ trong tác vụ kỹ thuật; CodeBuddy lại tích hợp sâu với hệ sinh thái Tencent (WeChat, Tencent Docs).
Góc nhìn ngược: Tương quan không phải nhân quả.
Đừng vội kết luận rằng Claude Code là Agent tốt hơn cho blockchain. Benchmark này chỉ có 260 tác vụ, do Tencent tự xây dựng. Không có bên thứ ba xác nhận. Chưa kể, tác vụ mã nguồn có thể được thiết kế thiên vị Claude Code (ví dụ: yêu cầu thao tác Git, terminal). Nếu áp dụng vào thực tế blockchain – như kiểm tra tokenomics, phát hiện wash trading, hay tối ưu gas – kết quả có thể khác.
Thực tế, tôi từng phân tích dữ liệu on-chain của BAYC và phát hiện wash trading 34% nhờ dashboard tự xây. Một Agent giỏi mã nguồn chưa chắc giỏi phân tích giao dịch. Cần dữ liệu thực tế, không phải điểm số phòng thí nghiệm.
Takeaway cho tuần tới:
Nếu bạn đang xây dựng bot giao dịch hay công cụ kiểm toán smart contract, đừng chọn Agent dựa trên benchmark chung. Hãy tự đo lường trên dữ liệu on-chain của bạn. Số thực không cần PR. Và nếu bạn thấy một spike trong TVL của một giao thức, hãy nhìn kỹ: đó có thể là một Agent đang chạy kịch bản cũ.