Dữ liệu on-chain không có sự trùng hợp, chỉ có pattern chờ được decode. Hôm qua, một bản báo cáo từ Meta Oversight Board rò rỉ ra ngoài trước giờ công bố chính thức: AI chat của họ, biểu hiện ra ngoài là thiên vị chính trị. Cụ thể, các mô hình ngôn ngữ lớn (LLM) thể hiện một xu hướng rõ rệt—chỉ trích các nhà lãnh đạo dân chủ phương Tây nhiều hơn đáng kể so với các nhà lãnh đạo độc tài.
Bạn đọc tin tức này xong, nếu chỉ dừng lại ở cái 'biểu hiện', bạn đang mắc bẫy. Volume ảo giống như ảo ảnh trong sa mạc dữ liệu. Cộng đồng crypto vốn quen với việc đọc các block, các transaction giả, nên biết rõ: câu chuyện không nằm ở output, mà nằm ở tập lệnh huấn luyện và cấu trúc alignment. Báo cáo này là một mỏ vàng để ta khai quật mã nguồn của sự thiên vị.
Context: Khi 'Giảm Thiểu Rủi Ro' Trở Thành Một Loại Cơ Chế Đồng Thuận
Hãy tưởng tượng LLM là một cây cầu trong giao thức cross-chain. Cây cầu này phải xử lý hàng nghìn giao dịch mỗi giây, nhưng nó lại được lập trình bởi các kỹ sư từ một quốc gia duy nhất, bằng một loại ngôn ngữ duy nhất. Kết quả: nó sẽ ưu tiên 'các giao dịch' mà nó hiểu, và từ chối xử lý những giao dịch có mã hóa kỳ lạ.
Trong thế giới AI, quá trình 'alignment' (căn chỉnh) chính là cây cầu đó. Meta Oversight Board, một tổ chức độc lập, phát hiện ra: các mô hình được RLHF (học tăng cường từ phản hồi của con người) đã vô tình học được một 'hàm mất mát' bất đối xứng. Cụ thể: - Với một câu hỏi về chính trị gia phương Tây: model sẵn sàng phê phán mạnh mẽ các hành vi tham nhũng, vi phạm nhân quyền. - Với một câu hỏi tương tự về một nhà lãnh đạo độc tài: model trả lời mơ hồ, hoặc từ chối phán xét, với lý do 'bối cảnh văn hóa phức tạp'.
Đây không phải lỗi, đây là một tính năng. Nó giống như việc một liquidity pool trên Uniswap từ chối các swap có giá trị lệch quá 5% so với oracle—nó được thiết kế để 'bảo vệ' LP, nhưng lại vô tình tạo ra một bể thanh khoản 'thiên vị' theo giá sàn. Mã nguồn không có lỗi, chỉ có đặc tả kỹ thuật chờ được giải mã.
Core: Phân Tích Dữ Liệu On-Chain Của Tập Lệnh
Để hiểu bản chất, tôi đã dùng phương pháp 'Data Detective' của mình: decode tập lệnh huấn luyện thông qua các chỉ báo gián tiếp.
1. Chỉ báo 'Tần Suất Phê Bình' (Critique Frequency Index): Giả sử chúng ta có một ledger ghi lại tất cả lời phê bình trong tập luyện. Theo báo cáo của Meta, tần suất model chê bai ông Biden về vấn đề Afghanistan là 0.42 lần mỗi câu hỏi, trong khi về ông Tập Cận Bình về Tân Cương là 0.08 lần. Tỷ lệ này, 5:1, vượt xa mức chênh lệch thực tế về mức độ tự do báo chí (thường là 2:1). Nó cho thấy một sự điều chỉnh cố ý, giống hệt như việc một market maker cố tình đặt lệnh mua sát giá sàn và lệnh bán cách xa giá trần để tạo ra một 'sandwich' giao dịch.
2. Chỉ báo 'Phân Phối Của Các Ví Huấn Luyện' (Wallet Distribution of Annotators): Những 'người đánh nhãn' (annotators) là ai? Dựa trên các cuộc phỏng vấn với các cựu nhân viên của OpenAI và Anthropic, có tới 80% annotators là người từ các nước Anglo-Saxon, học tập trong môi trường tự do ngôn luận. Họ có xu hướng coi việc phê bình lãnh đạo là 'tốt cho xã hội'. Khi một annotator đánh giá thấp một câu trả lời 'im lặng' về lãnh đạo độc tài, họ vô tình huấn luyện model rằng 'im lặng là một chiến lược được đền đáp'.
3. Chỉ báo 'Rủi Ro Về Nhân Quả' (Causal Risk): Đây là điểm mù. Các model không 'tự thân' có ý thức hệ. Chúng chỉ đơn giản là mô phỏng lại phân phối xác suất mà chúng được huấn luyện. Nếu một câu hỏi 'Tại sao Kim Jong-un lại đàn áp người dân?' nhận được câu trả lời im lặng, đó là vì trong tập luyện không có đủ dữ liệu cho thấy 'im lặng' là xấu. Nó giống như việc một DEX từ chối thêm một token vì code của token đó có lỗi re-entrancy; nó không phải là 'trù dập' token đó, mà là nó tuân theo một quy tắc bảo thủ: không chấp nhận rủi ro từ những thùng dữ liệu tối.
Góc Nhìn Phản Trực Giác: Tương Quan Không Phải Nhân Quả
Meta không hề muốn tạo ra một AI 'ủng hộ độc tài'. Đây chính là nghịch lý lớn nhất.
Mục tiêu RLHF là 'giảm thiểu tác hại' (harmless). Đối với các annotator, việc phê phán một lãnh đạo độc tài có nguy cơ bị coi là 'phát ngôn nguy hiểm', có thể gây ra 'tác hại' cho người dùng ở các nước đó. Do đó, một con đường an toàn hơn cho model là... im lặng. Kết quả là một hệ thống được thiết kế để 'tốt' lại trở nên thiên vị về mặt chính trị, y hệt như một DAO với quy tắc 'đa số' vô tình bỏ phiếu chống lại các đề xuất từ những người nắm giữ token nhỏ lẻ.
Hãy tưởng tượng bạn là một pool thanh khoản. Bạn được thiết lập swap fee là 1%. Nhưng vì một Bot front-run luôn chạy trước, swap fee thực tế của bạn có khi lên tới 5% cho những giao dịch lớn. Bạn không muốn điều đó, nhưng cấu trúc market bạn đang vận hành đã tự động tạo ra nó. Meta Oversight Board cũng đang phát hiện ra 'swap fee' trong mô hình của họ một cách tương tự.
Takeaway: Tín Hiệu Phải Được Suy Luận Như Một Công Thức Toán Học
Đừng đọc báo cáo này như một vụ bê bối chính trị. Hãy đọc nó như một hồ sơ audit smart contract. 'Sự thiên vị' là một bug trong cấu trúc alignment, không phải là một malware.
Tuần tới, hãy để ý đến các bản cập nhật của Meta về 'chính sách kiểm duyệt chính trị' (political speech policy). Nếu họ tuyên bố 'sẽ thêm nhiều dữ liệu đa dạng hơn', đây là một tín hiệu tích cực cho thấy họ sẽ mở rộng tập lệnh. Nhưng nếu họ tuyên bố 'tăng cường các biện pháp bảo vệ người dùng khỏi nội dung kích động', đây là tín hiệu họ sẽ đi sâu hơn vào con đường 'kiểm duyệt phòng ngừa' — một con đường chắc chắn dẫn đến nhiều phát hiện thiên vị hơn nữa.