Hook
Một dự án vừa huy động 100 triệu USD. Mã nguồn sao chép 80% từ Ethereum. Tôi phát hiện ra điều đó vào năm 2017, khi còn là chuyên gia cấp cao tại một tờ báo crypto. Nhưng lần này, không có dự án nào cả. Chỉ có một bài báo về chấn thương vai của vận động viên bóng chày Shohei Ohtani. Và hệ thống phân tích tự động của chúng tôi đã xử lý nó như một tin tức blockchain.
Context
Tại sao chuyện này lại xảy ra? Trong thị trường tăng, mọi thứ dường như đều có thể được gán nhãn Web3. Từ NFT đến metaverse, từ token đến prediction market. Nhưng ranh giới giữa tin thật và tin giả, giữa crypto và non-crypto, ngày càng mờ nhạt khi AI bắt đầu tự động phân loại và phân tích nội dung. Năm 2024, khi Bitcoin ETF được phê duyệt, dòng vốn tổ chức đổ vào 10 tỷ USD trong 3 tháng, tôi đã chứng kiến sự bùng nổ của các công cụ phân tích tự động. Và cùng với đó, những lỗ hổng trong quy trình kiểm duyệt cũng lộ ra.
Core
Hãy nhìn vào bài báo về Ohtani. Nó có 3 thông tin: (1) anh ấy bị chấn thương, (2) thời gian hồi phục dự kiến, (3) xác suất 86.5% từ một nền tảng dự đoán không được nêu tên. Không có mã nguồn, không có hợp đồng thông minh, không có token. Nhưng hệ thống AI của chúng tôi đã tự động gán nó vào danh mục “Web3/Blockchain” và chạy một bộ phân tích 9 chiều. Kết quả? 90% các chỉ số đều trả về “N/A” – không có dữ liệu. Điều này giống như việc bạn cố gắng phân tích giao dịch on-chain của một chiếc bánh mì kẹp thịt.

Dựa trên kinh nghiệm audit của tôi, vấn đề nằm ở tầng phân loại đầu tiên. Khi tôi xây dựng quy trình kiểm duyệt 3 bước vào năm 2020 cho DeFi Summer, bước đầu tiên là: xác minh nguồn gốc. Nếu nguồn không phải từ blockchain, hãy dừng lại. Nhưng AI hiện tại thường bỏ qua bước này, vì nó được huấn luyện trên dữ liệu hỗn tạp. Một bài báo thể thao có thể chứa từ “token” hoặc “prediction” – đủ để kích hoạt nhãn Web3. Đó là lý do tại sao tôi luôn thêm một mục “Cảnh báo rủi ro” vào mỗi bài viết DeFi, dựa trên dữ liệu lịch sử và so sánh với các vụ hack trước. Và bây giờ, tôi thêm một mục cảnh báo khác: Hãy kiểm tra domain trước khi phân tích.
Phân tích dữ liệu chi tiết
Trong 24 năm quan sát ngành, tôi đã thấy nhiều lỗi tương tự. Năm 2021, khi tôi phân tích dữ liệu on-chain của NFT, 70% giao dịch trên OpenSea là wash trading. Nhưng nếu tôi chỉ dựa vào AI để gán nhãn, tôi có thể bỏ qua sự thật đó. Lần này, lỗi không đến từ dữ liệu xấu, mà từ domain sai. Hệ thống đã trích xuất từ “Ohtani” và cho rằng đó là một dự án crypto (có thể nhầm với $OHT - một token không tồn tại). Nó cũng thấy con số 86.5% và kết luận đó là “market prediction”. Nhưng không có thị trường nào được chỉ định. Không có polymarket, không có kalshi. Chỉ có một câu ngẫu nhiên trong bài báo thể thao.
Điều này dẫn đến một vấn đề kỹ thuật lớn hơn: độ trễ của oracle feed trong việc xác thực nguồn. Trong DeFi, oracle feed là gót chân Achilles; Chainlink giải quyết phi tập trung bằng các node tập trung – một nghịch lý. Ở đây, oracle của hệ thống phân tích AI cũng gặp vấn đề tương tự: nó không thể xác minh tính hợp lệ của domain. Nếu chúng ta không sửa lỗi này, những phân tích sai sẽ tiếp tục được đưa ra, và nhà đầu tư có thể đưa ra quyết định dựa trên thông tin sai lệch.

Contrarian
Bạn có thể nghĩ rằng lỗi này chỉ là một trò đùa kỹ thuật. Nhưng tôi nhìn thấy một góc phản trực giác: đây thực sự là một cơ hội để cải thiện quy trình kiểm duyệt. Trong bear market 2022, khi nhiều đồng nghiệp hoảng loạn, tôi dựa vào quy tắc cũ: bám vào dữ liệu cơ bản. Tôi đã xuất bản bài “Những dự án sống sót qua 3 chu kỳ” – phân tích các token dựa trên tỷ lệ chấp nhận thực tế. Bây giờ, tôi muốn xây dựng một “Chỉ số sinh tồn” cho các hệ thống AI: đo lường khả năng phát hiện domain sai. Nếu một hệ thống có tỷ lệ lỗi domain cao hơn 5%, nó cần được kiểm tra lại.
NFT năm 2021 chỉ là lớp sơn bóng trên nền gỗ mục – đó là câu ký hiệu của tôi cho những dự án thiếu nền tảng kỹ thuật. Lần này, AI đang sơn bóng lên nền gỗ mục của dữ liệu sai domain. Nếu chúng ta không đào sâu vào lớp nền, chúng ta sẽ mãi mãi mắc kẹt trong những phân tích vô nghĩa. Tôi đã thấy điều này xảy ra với các giao thức interoperability cross-chain: càng nhiều chain mới, thanh khoản càng phân mảnh. Tương tự, càng nhiều hệ thống AI tự động, lỗi domain càng lan rộng.

Takeaway
Vậy, bước tiếp theo là gì? Tôi không tin vào các giải pháp thần kỳ. Tôi tin vào quy trình. Mỗi bài viết blockchain, trước khi được phân tích, phải có một bước kiểm tra domain: xác minh rằng nội dung thực sự liên quan đến blockchain. Nếu không, hãy từ chối phân tích. Đây là bài học từ vụ ChainFusion năm 2017 – khi tôi dành 2 tuần đối chiếu hợp đồng thông minh và whitepaper, và phát hiện mã nguồn sao chép. Sự cẩn thận đó đã ngăn hơn 500 nhà đầu tư mất tiền. Bây giờ, hãy áp dụng cùng một sự cẩn thận đó cho AI. Câu hỏi cuối cùng không phải là “AI có thể phân tích nhanh đến đâu?”, mà là “AI có thể phân biệt đúng domain không?”. Nếu không, tất cả phân tích chỉ là một mớ dữ liệu vô nghĩa.