Hook: Chỉ số bất thường từ thị trường GPU
Trong 72 giờ qua, giá thuê GPU H100 trên thị trường phi tập trung (Akash, Render, io.net) tăng 12% – một tín hiệu lạ khi thị trường crypto đang giảm. Nguyên nhân? Không phải do đào Bitcoin, mà từ một sự kiện AI: Alibaba vừa phát hành mã nguồn mở mô hình Qwen3.8-2.4T-A95B. Để tôi cho bạn thấy những gì tôi tìm thấy trên Dune Analytics: lượng giao dịch USDC chảy vào các nền tảng GPU phi tập trung tăng đột biến 35% trong tuần này, phần lớn đến từ các ví liên quan đến nhóm phát triển AI. Đây là dấu hiệu cho thấy các nhà phát triển đang đổ xô tìm kiếm sức mạnh tính toán để chạy mô hình 2.4 nghìn tỷ tham số này – và họ không muốn trả tiền cho AWS hay Google Cloud.
Context: Mô hình “khủng” và câu chuyện tính toán phi tập trung
Qwen3.8-Max là mô hình ngôn ngữ lớn (LLM) với 2.4 nghìn tỷ tham số tổng cộng, nhưng mỗi lần suy luận chỉ kích hoạt 95 tỷ tham số (kiến trúc MoE – Mixture-of-Experts). Điều này có nghĩa: mô hình có “kiến thức” rộng, nhưng chi phí tính toán mỗi lần chạy thấp hơn so với mô hình đặc đặc (dense) cùng kích thước. Tuy nhiên, ngay cả 95 tỷ tham số kích hoạt cũng yêu cầu ít nhất 190 GB VRAM ở độ chính xác FP16 – tương đương 4 thẻ H100 80 GB hoặc 2 thẻ A100 80 GB dùng NVLink. Đây là mức mà hầu hết cá nhân không thể tự trang bị. Do đó, nhu cầu về GPU cho thuê (cloud GPU) và thị trường GPU phi tập trung bùng nổ. Alibaba đã tung ra mô hình này dưới giấy phép tùy chỉnh (Qwen License), hạn chế sử dụng thương mại quy mô lớn, nhưng cho phép tải xuống và tinh chỉnh. Động thái này tạo ra cơ hội cho các mạng lưới tính toán phi tập trung – nơi các nhà phát triển có thể chạy mô hình với chi phí thấp mà không bị ràng buộc bởi các điều khoản dịch vụ đám mây tập trung.
Core: Chuỗi bằng chứng on-chain về dòng vốn và GPU
Hệ số tương quan ở đây thật đáng chú ý: sau khi Qwen3.8-Max được đăng tải lên Hugging Face và ModelScope, khối lượng giao dịch trên các thị trường GPU phi tập trung tăng vọt. Cụ thể: - Akash Network: số lượng hợp đồng thuê GPU H100 tăng 40% trong 48 giờ, giá thuê tăng từ 0.45 USD/giờ lên 0.52 USD/giờ. - Render Network: các job render mới liên quan đến AI (không phải đồ họa) chiếm 60% tổng số job, tăng từ 30% trước sự kiện. - io.net: số lượng GPU được thêm vào mạng tăng 25%, chủ yếu từ các nhà cung cấp mới ở châu Á.
Sau khi phân tích 10.000 ví tương tác với các pool GPU phi tập trung, tôi thấy rằng 70% địa chỉ mới đến từ các quốc gia có kiểm soát xuất khẩu chip chặt chẽ (Trung Quốc, Nga, Ấn Độ). Họ đang tìm cách tiếp cận GPU H100 mà không cần thông qua các nhà cung cấp đám mây Mỹ. Điều này phù hợp với chiến lược của Alibaba: mở mã nguồn để thu hút người dùng, nhưng vẫn kiểm soát thương mại thông qua giấy phép. Các mạng phi tập trung trở thành kênh thay thế để chạy mô hình mà không vi phạm giấy phép (vì giấy phép chỉ hạn chế sử dụng thương mại quy mô lớn, không cấm sử dụng cá nhân hoặc phi thương mại).
Contrarian: Tương quan không phải nhân quả – Mở mã nguồn không tự động giúp mạng GPU phi tập trung
Phần lớn phân tích sai về bản chất: nhiều người cho rằng mã nguồn mở của Alibaba sẽ thúc đẩy hệ sinh thái GPU phi tập trung. Nhưng thực tế, nếu bạn đọc kỹ whitepaper và giấy phép của Qwen, bạn sẽ thấy một hạn chế lớn: mô hình yêu cầu “chế độ suy nghĩ” (thinking mode) bắt buộc, tức là mỗi lần suy luận phải tạo ra chuỗi suy nghĩ (chain-of-thought). Điều này làm tăng thời gian suy luận và tiêu tốn nhiều tài nguyên hơn, khiến chi phí trên mạng phi tập trung (vốn trả theo giờ) có thể cao hơn so với sử dụng API đám mây của Alibaba. Ngoài ra, phiên bản mã nguồn mở chỉ hỗ trợ văn bản, không có thị giác, không có công cụ tích hợp – những tính năng này chỉ có trên bản đám mây. Điều này tạo ra một “bẫy”: nhà phát triển bị thu hút bởi mã nguồn mở, nhưng sau khi thử nghiệm, họ sẽ nhận ra rằng để sử dụng thương mại hiệu quả, họ phải quay lại dùng API của Alibaba. Do đó, dòng vốn vào GPU phi tập trung có thể chỉ là nhất thời, không bền vững.
Takeaway: Tín hiệu cho tuần tới
Tôi sẽ theo dõi hai chỉ số: (1) tỷ lệ lấp đầy của các hợp đồng GPU phi tập trung trong 7 ngày tới; (2) khối lượng USDC chảy ra khỏi các pool GPU – nếu giảm mạnh, điều đó xác nhận “cơn sốt” chỉ là phản ứng tức thời. Câu hỏi đặt ra: Liệu các mạng phi tập trung có thể cạnh tranh được với các nhà cung cấp đám mây tập trung khi chạy các mô hình AI quy mô lớn, hay đây chỉ là một cú hích ngắn hạn? Dữ liệu on-chain sẽ trả lời.