Hook: Con số bất thường
Hơn 80% dữ liệu đào tạo cho các mô hình ngôn ngữ lớn (LLM) đến từ việc thu thập trái phép trên web công cộng. Một con số mà tôi, với 14 năm theo dõi thị trường crypto, thấy quen thuộc đến đáng sợ. Giống như năm 2017, khi tôi phân tích dữ liệu on-chain của 50 ICO và phát hiện 70% trong số đó có dòng tiền từ các địa chỉ giả mạo. Lúc đó, thị trường quá sốt, không ai quan tâm. Bây giờ, với AI, lịch sử đang lặp lại. Nhưng lần này, có một tín hiệu mới: Patreon, nền tảng sáng tạo nội dung hàng đầu, vừa kích hoạt Crawl Control của Cloudflare để chặn bot AI. Và quan trọng hơn, họ đang nói về một mô hình thanh toán dựa trên stablecoin cho mỗi lần thu thập dữ liệu.
Context: Bối cảnh giao thức & thông tin cần thiết
Patreon là nơi hàng ngàn nhà sáng tạo kiếm sống từ nội dung độc quyền. Cloudflare là CDN (Content Delivery Network) lớn nhất thế giới, kiểm soát một phần đáng kể lưu lượng web toàn cầu. Sự kết hợp này tạo ra một liên minh: Cloudflare cung cấp lớp bảo vệ kỹ thuật (Crawl Control – phát hiện và chặn bot AI dựa trên phân tích lưu lượng), còn Patreon cung cấp nhu cầu thực tế từ phía người sáng tạo. Nhưng điểm mấu chốt là ý tưởng “stablecoin-driven per-crawl payment” – trả phí bằng stablecoin mỗi khi AI bot truy cập dữ liệu. Đây không chỉ là một bản nâng cấp của robots.txt. Đây là sự thay đổi mô hình kinh tế: biến dữ liệu từ “miễn phí” thành “tài sản có thể lập trình và định giá”. Trong bối cảnh thị trường crypto đang đi ngang – tích lũy, các tín hiệu kiểu này thường bị bỏ qua. Nhưng với tôi, đây là dấu hiệu của một sự xếp hàng chiến lược: những người chơi lớn đang đặt cược vào tương lai mà AI phải trả tiền cho dữ liệu.
Core: Chuỗi bằng chứng on-chain và phân tích kỹ thuật
Để đánh giá tính khả thi của mô hình này, tôi sẽ đi theo phương pháp “Data Detective”: đặt giả thuyết, kiểm tra bằng dữ liệu, chỉ ra ngoại lệ. Giả thuyết: “Nếu mô hình thanh toán per-crawl bằng stablecoin trở nên phổ biến, sẽ có một lượng lớn giao dịch vi mô (micro-transaction) trên các blockchain hỗ trợ stablecoin như Ethereum, Solana, hay Polygon.”
Trước hết, hãy nhìn vào dữ liệu on-chain hiện tại. Theo The Block, tổng khối lượng giao dịch stablecoin trên Ethereum trong tháng 6/2024 đạt 500 tỷ USD. Con số này tăng 30% so với cùng kỳ năm ngoái, nhưng phần lớn đến từ các giao dịch lớn (whales, sàn giao dịch). Giao dịch vi mô (dưới 10 USD) chỉ chiếm chưa đến 2% về giá trị, mặc dù chiếm hơn 40% về số lượng. Điều này cho thấy cơ sở hạ tầng hiện tại chưa được tối ưu cho hàng tỷ giao dịch nhỏ mỗi ngày. Tuy nhiên, các giải pháp Layer 2 như Optimism, Arbitrum, và đặc biệt là ZK-rollups (zkSync, StarkNet) đang giảm phí xuống dưới 0.01 USD mỗi giao dịch. Đây là điều kiện cần để per-crawl payment khả thi về mặt chi phí.

Tiếp theo, hãy xem xét dữ liệu từ Cloudflare. Họ báo cáo rằng Crawl Control đã chặn hơn 1 tỷ yêu cầu từ bot AI trong quý 1/2024. Một con số khổng lồ, nhưng đây chỉ là phần nổi của tảng băng. Vấn đề là bot AI ngày càng tinh vi: chúng có thể giả mạo user-agent, sử dụng proxy, hoặc thậm chí học cách vượt qua Captcha. Do đó, việc chỉ dựa vào Crawl Control là chưa đủ. Mô hình “trả phí mỗi lần đọc” cần một cơ chế đo lường chính xác và không thể gian lận. Ở đây, blockchain có lợi thế: mỗi lần truy cập dữ liệu có thể được ghi lại trên một sổ cái phân tán, và việc thanh toán bằng smart contract đảm bảo tính tự động, minh bạch.
Tôi đã thử mô phỏng một kịch bản: Giả sử một mô hình AI như GPT-5 cần 10 tỷ token dữ liệu để huấn luyện. Với mức giá 0.001 USD cho mỗi 1000 token (tương đương giá API hiện tại của các mô hình nhỏ), tổng chi phí sẽ là 10 triệu USD. Nếu tất cả dữ liệu này đều phải trả phí per-crawl, thì đó sẽ là một thị trường trị giá hàng tỷ USD mỗi năm. Nhưng thực tế, hầu hết dữ liệu vẫn miễn phí, và các công ty AI sẽ tìm cách né tránh. Tôi nhớ lại năm 2021, khi phân tích metadata của 10.000 Bored Ape Yacht Club, tôi phát hiện 30% bộ sưu tập có điểm tương đồng bất thường. Nhóm của tôi đã tránh được một bẫy scam nhờ dữ liệu on-chain. Tương tự, ở đây, chúng ta cần dữ liệu on-chain để phát hiện bot AI giả mạo. Một hướng đi là sử dụng các giao thức xác thực danh tính (proof-of-personhood) hoặc bằng chứng tham gia (proof-of-attendance) để xác minh rằng một yêu cầu đến từ một thực thể trả phí hợp lệ.
Một bằng chứng khác: Dữ liệu từ Dune Analytics cho thấy tổng phí gas cho các giao dịch stablecoin trên Ethereum đã tăng 15% trong tháng qua, một phần do sự gia tăng của các ứng dụng thanh toán vi mô. Tuy nhiên, đây chỉ là tương quan, chưa phải nhân quả. Tôi nhấn mạnh: dữ liệu hiện tại chưa đủ để kết luận rằng per-crawl payment sẽ thành công. Nhưng nó cho thấy hạ tầng đang dần sẵn sàng.
Contrarian: Góc nhìn phản trực giác
Điều nghịch lý là mô hình “trả phí mỗi lần AI đọc” có thể không giúp ích gì cho các nhà sáng tạo nhỏ. Hãy tưởng tượng: một blogger cá nhân có 1000 bài viết. Nếu mỗi lần AI đọc bài viết, anh ta nhận được 0.001 USD, thì để kiếm được 1000 USD, cần 1 triệu lượt đọc từ AI. Con số này khó đạt được trừ khi nội dung của anh ta có giá trị huấn luyện cực cao. Trên thực tế, mô hình này có lợi nhất cho các tổ chức lớn như New York Times, Reuters, hoặc Patreon – nơi có khối lượng nội dung khổng lồ. Còn với cá nhân, chi phí giao dịch (phí gas, phí xử lý) có thể cao hơn khoản thu. Đây là một điểm mù mà nhiều người ủng hộ mô hình này bỏ qua.
Hơn nữa, đây là trò chơi “mèo vờn chuột”. AI companies có động lực mạnh mẽ để phát triển các kỹ thuật thu thập dữ liệu tinh vi hơn, như sử dụng browser tự động, hoặc thậm chí thuê người đọc thủ công để lấy dữ liệu. Và nếu luật pháp không ủng hộ (ví dụ: tòa án tuyên bố việc đọc dữ liệu công khai để huấn luyện là “fair use”), thì mô hình này sẽ sụp đổ. Từ kinh nghiệm xây dựng bot arbitrage Uniswap năm 2020, tôi biết rằng khi có tiền lớn, sẽ luôn có cách để bypass.
Một yếu tố khác: sự tập trung. Cloudflare đang trở thành trung tâm quyền lực mới. Nếu họ kiểm soát cả việc chặn và thanh toán, họ có thể áp đặt các điều khoản độc quyền. Điều này đi ngược lại tinh thần phi tập trung của crypto. Liệu chúng ta có đang thay thế sự kiểm soát của Big Tech bằng sự kiểm soát của một Big Tech khác? Đây là câu hỏi mà tôi, với tư cách một “Data Detective” từng nghi ngờ mọi mẫu dữ liệu, không thể bỏ qua.
Takeaway: Tín hiệu cho tuần tới
Trong 6-12 tháng tới, hãy theo dõi ba tín hiệu: (1) Có bao nhiêu nền tảng nội dung lớn (Medium, Substack) kích hoạt cơ chế tương tự; (2) Liệu OpenAI hay Google có công bố thỏa thuận cấp phép dữ liệu với một CDN lớn nào không; (3) Khối lượng giao dịch stablecoin trên các Layer 2 có tăng đột biến do micro-transaction không. Nếu cả ba xảy ra, thì “per-crawl payment” sẽ không còn là ý tưởng viển vông. Còn bây giờ, hãy giữ thái độ hoài nghi có hệ thống – giống như tôi đã làm với ICO năm 2017. Bởi vì trong thị trường crypto, những gì nghe có vẻ quá hoàn hảo thường là bẫy.