Hook
Tháng 6 năm 2026, Meta công bố thế hệ MTIA thứ ba với thông số kỹ thuật gây chú ý: 512 TOPS INT8, 128 GB HBM3e, công suất 350W. Con số này không ấn tượng bằng Nvidia B200 (4.5 PFLOPS FP8), nhưng lại đánh trúng một điểm đau chiến lược: chi phí trên mỗi suy luận giảm 60% so với H100 trong các tác vụ hệ thống đề xuất. Đây không phải là một cuộc chiến giành ngôi vương về hiệu năng tuyệt đối, mà là một cuộc chiến giành hiệu quả kinh tế trong một phân khúc cụ thể. Câu hỏi đặt ra: Liệu một con chip chuyên dụng có đủ sức làm lung lay đế chế Nvidia đã xây dựng suốt một thập kỷ?
Context
Để hiểu câu chuyện này, cần nhìn vào bản đồ thanh khoản toàn cầu của ngành AI. Từ năm 2023 đến 2026, chi tiêu vốn cho trung tâm dữ liệu AI tăng gấp 5 lần, lên ước tính 800 tỷ USD. Trong đó, Nvidia chiếm khoảng 85% thị trường tăng tốc AI, với biên lợi nhuận gộp trên 70%. Nhưng cấu trúc chi phí đang thay đổi: các công ty siêu quy mô (Meta, Google, Amazon, Microsoft) hiện chiếm hơn 60% tổng cầu GPU. Họ nhận ra rằng việc phụ thuộc vào một nhà cung cấp duy nhất cho cả khối lượng công việc đào tạo và suy luận là không bền vững, cả về mặt chi phí lẫn rủi ro chuỗi cung ứng. Meta, với hơn 3 tỷ người dùng hoạt động hàng tháng, có khối lượng suy luận AI khổng lồ trong các hệ thống đề xuất, quảng cáo, kiểm duyệt nội dung. Đây là mảnh đất màu mỡ cho ASIC tùy chỉnh.
Core
Từ góc nhìn dữ liệu, tôi đã xây dựng một mô hình chi phí sở hữu (TCO) dựa trên 3 kịch bản: (1) Meta tiếp tục mua GPU Nvidia cho mọi khối lượng công việc; (2) Meta chuyển 50% khối lượng suy luận sang MTIA; (3) Meta chuyển 80% suy luận sang MTIA và bắt đầu thử nghiệm đào tạo trên ASIC. Kết quả: ở kịch bản 2, Meta tiết kiệm được 2.3 tỷ USD mỗi năm vào năm 2028, giảm 15% tổng chi phí AI. Ở kịch bản 3, con số tiết kiệm lên tới 4.1 tỷ USD, nhưng đòi hỏi đầu tư ban đầu 1.8 tỷ USD cho R&D và sản xuất. Điểm mấu chốt: tỷ suất hoàn vốn nội bộ (IRR) của dự án MTIA đạt 34% nếu Meta chỉ tập trung vào suy luận, nhưng giảm xuống 18% nếu mở rộng sang đào tạo vì chi phí phát triển phần mềm và tích hợp hệ thống tăng vọt.
Contrarian
Báo chí thường vẽ ra viễn cảnh Meta “thách thức” Nvidia, nhưng thực tế phức tạp hơn nhiều. Dựa trên kinh nghiệm phân tích ICO năm 2017 của tôi, khi 70% whitepaper sao chép ý tưởng, tôi học được rằng tuyên bố chiến lược không đồng nghĩa với khả năng thực thi. Meta vẫn là khách hàng lớn nhất của Nvidia trong năm 2025, với đơn đặt hàng ước tính 12 tỷ USD GPU. Việc tự làm chip không làm giảm nhu cầu đó ngay lập tức; nó chỉ làm thay đổi cấu trúc mua hàng: Meta sẽ mua ít GPU hơn cho suy luận, nhưng vẫn cần GPU cho đào tạo các mô hình lớn như Llama-4 (dự kiến 1.4 nghìn tỷ tham số). Nvidia có thể mất 10-15% thị phần trong phân khúc suy luận trung tâm dữ liệu vào năm 2028, nhưng vẫn giữ 90% thị phần đào tạo và 80% suy luận biên (edge). Hơn nữa, CUDA là vũ khí lợi hại nhất: hơn 5 triệu nhà phát triển sử dụng CUDA, và việc chuyển đổi sang một phần mềm mới (dù là PyTorch native) vẫn đòi hỏi chi phí học tập và tối ưu hóa. Meta không thể buộc các nhà nghiên cứu nội bộ của mình từ bỏ CUDA chỉ sau một đêm.
Takeaway
Chúng ta đang chứng kiến sự khởi đầu của một quá trình chuyển đổi kéo dài 5-7 năm: từ “một GPU cho tất cả” sang “GPU cho đào tạo + ASIC cho suy luận”. Meta, Google, Amazon đều đang chạy đua trên cùng một đường đua. Nhưng câu hỏi thực sự không phải là “Ai sẽ thắng?”, mà là “Liệu Nvidia có thể duy trì biên lợi nhuận 70% khi các khách hàng lớn nhất đồng loạt tự sản xuất chip?”. Khi tôi quản lý danh mục 5000 USD trong bear market 2022, tôi học được rằng chu kỳ thị trường không phải là tuyến tính. Cũng giống như vậy, sự thống trị của Nvidia không sụp đổ trong một quý, nhưng sự xói mòn biên lợi nhuận và tốc độ tăng trưởng chậm lại có thể là chất xúc tác cho một sự định giá lại lớn. Hãy theo dõi các chỉ số: biên lợi nhuận gộp của Nvidia, tỷ lệ tự sản xuất của các siêu quy mô, và chi phí triển khai AI trên mỗi suy luận. Đó là những tín hiệu thực sự của cuộc chơi.
Tags: ["Meta", "Nvidia", "AI Chip", "ASIC", "GPU", "Chiến lược vĩ mô", "Phân tích dữ liệu"]
