Hook: Tháng 7/2025, SemiAnalysis công bố báo cáo phân tích kiến trúc Kimi K3 – mô hình ngôn ngữ với 2.8 nghìn tỷ tham số, 896 chuyên gia MoE, và một kỹ thuật gọi là KDA (Keyboard-Dependent Attention) giúp giảm băng thông truyền KV cache tới 10 lần. Nhưng điều khiến giới đầu tư crypto chú ý không phải là benchmark, mà là một con số khác: mỗi lần forward inference yêu cầu 1.5 TB băng thông HBM và hơn 120 lần phân phối token trên mạng All-to-All. Khi các nhà phân tích AI bàn về Jevons Paradox, tôi thấy một tín hiệu trùng hợp kỳ lạ với câu chuyện của blockchain: càng hiệu quả, càng khát tài nguyên.

Context: Trong thế giới crypto, chúng ta đã quen với nghịch lý: Layer2 giúp giảm phí giao dịch nhưng tổng dung lượng mạng Ethereum vẫn tăng; sharding hứa hẹn mở rộng nhưng nhu cầu blob storage lại vượt quá cung. Bây giờ, một mô hình AI ngoài ngành cũng kể cùng một câu chuyện. Kimi K3 – sản phẩm của Moonshot AI – được thiết kế để tối ưu việc truyền dữ liệu giữa các GPU thông qua KDA. Tuy nhiên, với 896 chuyên gia trải rộng trên hàng nghìn GPU thông qua cơ chế WideEP, lượng traffic phát sinh từ việc phân phối token và hợp nhất kết quả lại tăng vọt. SemiAnalysis ước tính rằng mức tiết kiệm từ KDA nhỏ hơn nhiều so với mức mở rộng nhu cầu mạng do mô hình lớn hơn gây ra. Điều này giống hệt với việc Ethereum chuyển sang Proof-of-Stake tiết kiệm năng lượng, nhưng tổng lượng giao dịch trên L2 lại đẩy nhu cầu blob lên cao.

Core: Những con số TVL thực sự đại diện cho… đây là một phép ẩn dụ. Trong DeFi, TVL thường bị hiểu sai là "giá trị khóa
