Tuần trước, trong một buổi meetup nhỏ ở Lisbon, tôi nghe một người bạn từng làm tại một quỹ đầu tư crypto nói: "Linear attention sẽ giết chết GPU. Cuối cùng thì AI phi tập trung cũng có cơ hội." Tôi chỉ cười. Bởi vì vài ngày trước, tôi đã đọc báo cáo của SemiAnalysis về K3 – mô hình ngôn ngữ 2.8 nghìn tỷ tham số của Moonshot AI. Và mọi thứ hoàn toàn ngược lại.
K3 không phải là một dự án blockchain. Nó là một mô hình AI tập trung, thậm chí còn tập trung hơn cả GPT-4 nếu xét về quy mô phần cứng cần thiết. Nhưng bài học từ nó lại vô cùng quan trọng cho cộng đồng crypto, đặc biệt là những ai đang đặt cược vào DePIN (Mạng lưới cơ sở hạ tầng vật lý phi tập trung) hay các giao thức tính toán phân tán. Câu chuyện về K3 là một minh chứng hoàn hảo cho nghịch lý Jevons: hiệu quả cao hơn không làm giảm tiêu thụ tài nguyên, mà ngược lại, kích thích nhu cầu tăng lên. Và đối với ngành công nghiệp phần cứng, điều đó có nghĩa là GPU, HBM, và băng thông cao vẫn sẽ là mặt hàng khan hiếm trong nhiều năm tới.
Hook: Một mô hình "rẻ hơn" lại đòi hỏi nhiều chip hơn
Hãy tưởng tượng: K3 được quảng cáo là sử dụng cơ chế linear attention, một cải tiến kiến trúc hứa hẹn giảm độ phức tạp tính toán từ O(n²) xuống O(n). Trong lý thuyết, điều này có nghĩa là suy luận (inference) sẽ nhanh hơn và rẻ hơn. Vậy mà SemiAnalysis tiết lộ rằng để triển khai K3, bạn cần ít nhất 64 chip GPU trong một cụm scale-up domain (như NVIDIA GB300 NVL72). Tại sao? Bởi vì trọng số mô hình nặng hơn 1.5TB HBM, và KV cache vẫn phải được offload xuống CPU DDR5 và NVMe. Linear attention không loại bỏ nhu cầu về bộ nhớ; nó chỉ chuyển gánh nặng từ tính toán sang băng thông bộ nhớ. Kết quả: bạn cần nhiều GPU hơn, không ít hơn.
Context: Khi hiệu quả trở thành con dao hai lưỡi
Đây là lúc nghịch lý Jevons xuất hiện. William Stanley Jevons, một nhà kinh tế học thế kỷ 19, đã chỉ ra rằng khi động cơ hơi nước trở nên hiệu quả hơn, lượng than tiêu thụ không giảm mà tăng lên, vì chi phí vận hành thấp hơn khuyến khích sử dụng nhiều hơn. Tương tự, linear attention làm cho chi phí suy luận giảm, nhưng điều đó lại kích thích nhu cầu ứng dụng – như chatbot không giới hạn ngữ cảnh, tạo nội dung tự động, và tác nhân AI phức tạp – khiến tổng nhu cầu tính toán tăng vọt.
Trong ngành crypto, chúng ta đã thấy hiệu ứng này với các giải pháp mở rộng quy mô. Layer 2 làm giảm phí giao dịch, nhưng tổng số giao dịch trên Ethereum lại tăng, và doanh thu từ phí của L1 vẫn tăng trưởng. Tương tự, K3 chứng minh rằng dù có kiến trúc hiệu quả hơn, nhu cầu về GPU và HBM sẽ không giảm. Ngược lại, các công ty như NVIDIA, SK Hynix và Micron sẽ hưởng lợi từ xu hướng này.
Core: Dữ liệu từ K3 – Tín hiệu cho DePIN và đầu tư crypto
Từ góc nhìn kỹ thuật, K3 là một MoE (Mixture of Experts) khổng lồ với 2.8 nghìn tỷ tham số. Dù không có benchmark chính thức, nhưng chỉ riêng quy mô đã nói lên nhiều điều. Để huấn luyện mô hình này, ước tính cần hơn 50.000 GPU H100 trong 100 ngày, tiêu tốn hơn 100 triệu USD. Điều này có nghĩa là gì cho blockchain?
Thứ nhất, câu chuyện "AI sẽ phi tập trung hóa" đang bị thổi phồng. Các giao thức DePIN như Akash, Render hay IO.NET hứa hẹn cung cấp sức mạnh tính toán giá rẻ từ các GPU rải rác. Nhưng nếu một mô hình như K3 cần 64 chip trong một domain duy nhất với băng thông NVLink khổng lồ, thì việc chạy nó trên mạng lưới phi tập trung với độ trễ cao và băng thông thấp là bất khả thi. DePIN chỉ phù hợp với các tác vụ nhỏ, không phải suy luận mô hình nghìn tỷ tham số.
Thứ hai, nhu cầu phần cứng tăng mạnh có lợi cho các token liên quan đến GPU và bộ nhớ. Tuy nhiên, thị trường hiện tại (bear market) đang trừng phạt những dự án không có doanh thu thực. Các dự án DePIN với tokenomics yếu sẽ chết trước khi nhu cầu thực sự bùng nổ. Tôi đã thấy điều này vào năm 2022: nhiều giao thức lending cho vay với TVL cao nhưng không có lợi nhuận cơ bản đã sụp đổ. DePIN cũng vậy – chỉ có những ai có real yield từ phí tính toán mới tồn tại.
Thứ ba, K3 đặt ra một câu hỏi cho các nhà đầu tư crypto: liệu chúng ta có nên mua cổ phiếu NVIDIA thay vì token DePIN? Nếu bạn tin vào nghịch lý Jevons, NVIDIA là lựa chọn rõ ràng. Nhưng trong thế giới crypto, bạn có thể tìm kiếm các dự án đang xây dựng hạ tầng cho AI tập trung – chẳng hạn như các nhà cung cấp dịch vụ đặt cược GPU (GPU-as-a-Service) trên blockchain. Tuy nhiên, hãy cẩn thận với những dự án không có khách hàng thực tế.
Contrarian: Tại sao linear attention không phải là tin xấu cho GPU?
Nhiều người trong cộng đồng crypto cho rằng linear attention sẽ làm giảm nhu cầu GPU, từ đó mở đường cho các mạng lưới tính toán phi tập trung với phần cứng yếu hơn. Điều này sai về mặt kỹ thuật. Linear attention giảm tính toán, nhưng làm tăng băng thông bộ nhớ. GPU hiện đại (H100, B200) có băng thông HBM cực cao (3.35 TB/s). Các GPU cũ hơn hoặc chip AI chuyên dụng (TPU) không thể đáp ứng. Vì vậy, nhu cầu GPU cao cấp vẫn tăng.
Hơn nữa, KV cache offload xuống DDR5 và NVMe tạo ra cơ hội cho các giải pháp lưu trữ tốc độ cao. Trong lĩnh vực crypto, các dự án như Filecoin (lưu trữ phi tập trung) có thể hưởng lợi nếu họ chứng minh được băng thông thấp hơn không phải là vấn đề. Nhưng thực tế, độ trễ và băng thông của mạng lưới phi tập trung vẫn là rào cản lớn.
Takeaway: Bài học cho giai đoạn bear market
K3 cho thấy rằng AI và blockchain có thể giao nhau, nhưng không phải theo cách mà nhiều người tưởng. Trong thị trường giảm hiện tại, ưu tiên số một là sống sót. Đừng mua những token DePIN chỉ dựa trên narrative "AI phi tập trung". Hãy nhìn vào dữ liệu: những giao thức nào thực sự có doanh thu từ phí? Những dự án nào có khả năng thu hút khách hàng enterprise? Nếu không, họ sẽ chết trước khi K3 kịp làm tăng nhu cầu.
Tôi vẫn nhớ lần đầu tiên tham gia Uniswap vào tháng 6/2020, cảm giác đó như một cuộc cách mạng. Nhưng tôi cũng nhớ những dự án DeFi chỉ là fork mà không có TVL thực sự đã biến mất nhanh thế nào. DePIN hôm nay cũng vậy: cơ hội nằm ở những dự án có nền tảng vững chắc, không phải ở những câu chuyện đầu cơ. Và K3, dù là một mô hình AI tập trung, đã cho chúng ta một góc nhìn sắc sảo về tương lai: phần cứng vẫn là vua, và nghịch lý Jevons sẽ tiếp tục thống trị. Hãy chuẩn bị cho điều đó.