Anthropic Model 2 vs Mythos 5: Góc nhìn từ một kỹ sư blockchain về cuộc đua benchmark

Hoàng Vĩnh Thợ đào

Tuần trước, Crypto Briefing đăng tin: Anthropic Model 2 vượt Mythos 5. Một câu ngắn, không benchmark, không third-party verification. Tôi đọc xong chỉ có một phản xạ: đây giống hệt một whitepaper ICO 2017 – hứa hẹn lớn, proof bằng 0.

Tôi là Phan Hà, 42 tuổi, core protocol developer ở Tokyo. Từng audit contract Status.im năm 2017, phát hiện lỗi reentrancy trong SNT. Từng tự build tool phân tích tĩnh cho DeFi năm 2020. Kinh nghiệm dạy tôi một điều: bất kỳ tuyên bố "vượt trội" nào cũng cần được verify bằng code và dữ liệu mở.

Anthropic Model 2 vs Mythos 5: Góc nhìn từ một kỹ sư blockchain về cuộc đua benchmark

Context: Câu chuyện benchmark không có gì mới

Crypto Briefing đưa tin: Model 2 (Anthropic) vượt Mythos 5 (đối thủ không tên). Không nói benchmark nào, không nói margin bao nhiêu, không nói điều kiện test. Đây là dạng tin "chiến thắng" mà tôi gọi là "narrative-driven". Trong crypto, chúng ta đã thấy hàng trăm lần: một dự án L2 tuyên bố TPS cao hơn Ethereum, nhưng bỏ qua decentralization và security. Ở đây cũng vậy – "vượt" có thể chỉ là một benchmark được chọn lọc.

Nhưng có một điểm thú vị: tin này xuất hiện trên Crypto Briefing, không phải TechCrunch. Điều đó nói lên rằng câu chuyện AI đang được kéo vào không gian crypto – nơi mà các nhà đầu tư quen với việc đánh giá dự án qua metrics hơn là qua code. Và đó là mảnh đất màu mỡ cho PR.

Core: Phân tích kỹ thuật – cần gì để tin một tuyên bố vượt trội?

Từ góc nhìn của một người từng viết smart contract và audit, tôi sẽ liệt kê những gì cần có để một tuyên bố "vượt" đáng tin:

  1. Benchmark mở, có thể tái tạo. Giống như Uniswap V2 công bố code và test case cho phép bất kỳ ai chạy lại. Nếu Anthropic không publish benchmark script, thì đó là một red flag.
  1. Third-party audit độc lập. Trong crypto, chúng ta audit contract trước khi deploy. Với AI model, cần có independent evaluation từ các tổ chức như LMSYS Chatbot Arena, Stanford HAI, hoặc Artificial Analysis. Một bài báo từ Crypto Briefing không đủ.
  1. Dimension cụ thể. "Vượt" về tổng thể hay chỉ một kỹ năng? Code? Reasoning? Multimodal? Agent? Nếu chỉ vượt 1-2 điểm phần trăm trên một benchmark, thì không có gì đáng nói. Từng có audit mà tôi phát hiện lỗi chỉ trong một function, nhưng toàn bộ contract vẫn chạy. Đó là sự khác biệt giữa "vượt" và "vượt thực sự".

Tôi nhìn vào lịch sử của Anthropic: Claude 2 → Claude 3 → Claude 3.5 → Claude 3.7/4. Mỗi bước đều là module-level optimization, không phải architecture-level breakthrough. Vậy "Model 2 vượt Mythos 5" có thể là kết quả của việc tăng scale (nhiều GPU hơn, dữ liệu hơn) chứ không phải innovation. Điều này giống như việc một L2 tăng TPS bằng cách tập trung hóa sequencer – kỹ thuật khả thi, nhưng đánh đổi decentralization.

Contrarian: Góc nhìn phản trực giác – tin vượt trội này có thể là tín hiệu xấu cho crypto

Nếu Model 2 thực sự vượt, và Anthropic là công ty độc quyền (closed-source), thì điều đó củng cố sự tập trung hóa AI. Trong crypto, chúng ta chống tập trung hóa. Một AI model mạnh nhất thuộc về một công ty sẽ đe dọa các dự án decentralized AI như Bittensor, Render Network, hay Akash Network. Các dự án này dựa vào giả định rằng không có một model nào thống trị. Nếu có, thì token của họ sẽ mất utility.

Anthropic Model 2 vs Mythos 5: Góc nhìn từ một kỹ sư blockchain về cuộc đua benchmark

Hơn nữa, bài báo đề cập đến "AI misalignment concerns". Từ kinh nghiệm audit của tôi, khi một sản phẩm vội vã ra mắt để cạnh tranh, security thường bị hy sinh. Tôi đã thấy điều đó trong DeFi: nhiều dự án launch pool với TVL cao, nhưng contract có lỗi reentrancy. AI cũng vậy – nếu Anthropic chạy đua benchmark, họ có thể cắt bỏ safety layers. Điều này tạo rủi ro cho bất kỳ ứng dụng crypto nào tích hợp AI model đó.

Takeaway: Dự báo cho 6-12 tháng tới

Tôi sẽ không vội tin vào tuyên bố này. Tôi sẽ chờ xem Anthropic có publish model card và benchmark chi tiết không. Nếu có, tôi sẽ tự chạy lại test trên môi trường sandbox. Nếu không, thì đây chỉ là một câu chuyện PR để kêu gọi vốn.

Câu hỏi thực sự cho cộng đồng crypto: Liệu chúng ta có muốn một AI model mạnh nhất nằm trong tay một công ty, hay nên đầu tư vào decentralized alternatives? Tôi nghiêng về phương án sau. Bởi vì trong 5 năm qua, tôi học được rằng: trustless verification luôn tốt hơn trust. Và một tuyên bố không có code không đáng để tin.