Một bug có thể đánh sập cả tòa tháp. Và lần này, bug không nằm trong code, mà nằm trong chính sách xuất khẩu.
Bạn đã xem báo cáo tài chính của NVIDIA quý gần nhất chưa? Tôi thấy một con số lạ: doanh thu từ Trung Quốc tăng vọt dù lệnh cấm vẫn còn hiệu lực. Lý do? H200 – phiên bản ‘cắt giảm’ hợp pháp đầu tiên được Mỹ cho phép xuất sang Trung Quốc. Nhưng đây không phải là câu chuyện về một con chip mạnh mẽ hơn. Đây là câu chuyện về cách một tập đoàn biến lệnh trừng phạt thành lợi thế cạnh tranh.
Đọc code trước, mơ giàu sau. Hãy cùng tôi mổ xẻ logic đằng sau quyết định này.
Context: Cơ chế của lệnh trừng phạt và ‘cửa hẹp’ cho H200
Từ tháng 10/2022, BIS (Cục Công nghiệp và An ninh – Mỹ) siết chặt xuất khẩu chip AI sang Trung Quốc dựa trên hai chỉ số: TPP (Total Processing Performance) và PD (Performance Density). Mục tiêu: ngăn Trung Quốc tiếp cận sức mạnh tính toán cần thiết để huấn luyện các mô hình AI quy mô lớn. NVIDIA lập tức phát hành A800 và H800 – những phiên bản giảm băng thông NVLink để nằm dưới ngưỡng cho phép.
Đến tháng 10/2023, Mỹ siết lại: hạ ngưỡng TPP xuống thấp hơn, khiến H800 cũng bị cấm. NVIDIA mất thị trường 5,7 tỷ USD/năm (theo ước tính của tôi từ dữ liệu bán hàng trước lệnh cấm). Nhưng chỉ vài tháng sau, H200 xuất hiện – một bản nâng cấp nhẹ về bộ nhớ HBM3e, nhưng bị khóa băng thông NVLink và giảm xung nhịp compute để đáp ứng chuẩn mới.
Core: Phân tích kỹ thuật – H200 là ‘con ngựa thành Troy’ của NVIDIA
Trong các audit tôi từng làm cho các quỹ đầu tư tài sản kỹ thuật số, tôi luôn thấy một sự thật phũ phàng: kẻ tấn công thông minh nhất không khai thác lỗi trong hàm tính phí, mà khai thác lỗi trong giả định của nạn nhân. Ở đây, giả định của BIS là: giới hạn TPP và PD sẽ chặn đứng khả năng huấn luyện AI siêu lớn của Trung Quốc. Nhưng họ quên mất một thứ: kiến trúc hệ thống.
Rug pull? Tôi đã thấy từ xa. H200 không chỉ là một con chip. Nó là một phần trong hệ sinh thái NVIDIA: CUDA, cuDNN, TensorRT, và đặc biệt là NVLink. Một cụm H200 dù bị khóa băng thông NVLink (chỉ 800 GB/s thay vì 900 GB/s như H100), nhưng nếu kết nối qua mạng InfiniBand 400 Gbps, tổng băng thông inter-node vẫn đủ để huấn luyện mô hình 70B tham số. Điều mà BIS không lường trước: Trung Quốc sẽ tập trung vào tối ưu phần mềm – dùng thêm pipeline parallelism và tensor parallelism để bù đắp hạn chế phần cứng.
Hơn nữa, HBM3e với băng thông 4.8 TB/s giúp inference (suy luận) nhanh hơn 1.5 lần so với H100. Trong khi huấn luyện bị chậm lại do hạn chế compute, inference lại vượt trội. Đây là điểm mù: thị trường Trung Quốc hiện tại đang bùng nổ ứng dụng AI (chatbot, recommendation engine), và H200 chính là thứ họ cần để triển khai hàng loạt.
Contrarian: Góc nhìn ngược – H200 có thể là ‘cái bẫy’ cho chính NVIDIA?
Hãy nhìn từ lăng kính đối thủ. Khi tôi audit dự án DeFi năm 2020, tôi nhận ra: đôi khi kẻ thắng không phải người chạy nhanh nhất, mà là người hiểu rõ điểm yếu của đối thủ nhất. NVIDIA bán H200 cho Trung Quốc với giá cao hơn A800 (khoảng 30.000 USD/card). Nhưng điều gì xảy ra nếu Trung Quốc dùng số chip này để phát triển phần mềm tối ưu cho kiến trúc NVIDIA, sau đó copy ngược cho các đối thủ nội địa như Huawei?
Tôi từng thấy điều này trong lĩnh vực Ethereum Layer 2: Optimism mở mã fraud proof, Arbitrum nhanh chóng áp dụng ngược. Ở đây, H200 mang đến cho Trung Quốc cơ hội ‘tháo dỡ’ ngược kiến trúc CUDA và xây dựng phần mềm tương thích. Họ đã có PaddlePaddle và MindSpore – hai framework AI nội địa. Với H200 trong tay, họ có thể tinh chỉnh chúng để đạt hiệu suất tương đương CUDA trên phần cứng nội địa. Đây là con dao hai lưỡi: NVIDIA kiếm tiền ngắn hạn, nhưng mất lợi thế dài hạn về phần mềm.
Takeaway: Dự báo lỗ hổng và câu hỏi cho nhà đầu tư
Một bug có thể đánh sập cả tòa tháp. Lần này, tòa tháp là thị trường AI Trung Quốc, và bug là giả định của BIS rằng họ kiểm soát được dòng chảy kiến thức. Tôi dự đoán: trong vòng 12-18 tháng tới, Trung Quốc sẽ tung ra một chip AI nội địa có thể cạnh tranh với H200 ở khả năng inference, nhờ vào việc ‘ngược dòng’ kiến trúc từ H200. Khi đó, NVIDIA sẽ mất thị phần dù đang bán hàng tốt ngay bây giờ.
Nhà đầu tư crypto cần hỏi: Nếu AI của Trung Quốc tự chủ được, thì các dự án token hóa compute (io.net, Akash) có bị ảnh hưởng không? Tôi nghĩ câu trả lời là có – nguồn cung GPU giá rẻ từ Trung Quốc có thể làm giảm lợi nhuận cho các nền tảng này. Hãy nhìn vào code thay vì roadmap.