SusiChain
BTC $63,783.9 +1.08%
ETH $1,865.46 +0.13%
SOL $73.8 +1.04%
BNB $591.1 +1.06%
XRP $1.08 +0.44%
DOGE $0.0704 +0.64%
ADA $0.1950 +4.56%
AVAX $6.91 +6.83%
DOT $0.8410 +6.55%
LINK $8.21 -1.05%
⛽ ETH Gas 28 Gwei
Sợ&Tham
25

AI Khiến Mark Zuckerberg Mất Ngủ? Hồ Sơ 'Thiên Vị Chính Trị' Trong Mã Nguồn Không Thể Xóa Của LLM

Đặng Thảo
Vũ trụ ảo

Dữ liệu on-chain không có sự trùng hợp, chỉ có pattern chờ được decode. Hôm qua, một bản báo cáo từ Meta Oversight Board rò rỉ ra ngoài trước giờ công bố chính thức: AI chat của họ, biểu hiện ra ngoài là thiên vị chính trị. Cụ thể, các mô hình ngôn ngữ lớn (LLM) thể hiện một xu hướng rõ rệt—chỉ trích các nhà lãnh đạo dân chủ phương Tây nhiều hơn đáng kể so với các nhà lãnh đạo độc tài.

Bạn đọc tin tức này xong, nếu chỉ dừng lại ở cái 'biểu hiện', bạn đang mắc bẫy. Volume ảo giống như ảo ảnh trong sa mạc dữ liệu. Cộng đồng crypto vốn quen với việc đọc các block, các transaction giả, nên biết rõ: câu chuyện không nằm ở output, mà nằm ở tập lệnh huấn luyện và cấu trúc alignment. Báo cáo này là một mỏ vàng để ta khai quật mã nguồn của sự thiên vị.


Context: Khi 'Giảm Thiểu Rủi Ro' Trở Thành Một Loại Cơ Chế Đồng Thuận

Hãy tưởng tượng LLM là một cây cầu trong giao thức cross-chain. Cây cầu này phải xử lý hàng nghìn giao dịch mỗi giây, nhưng nó lại được lập trình bởi các kỹ sư từ một quốc gia duy nhất, bằng một loại ngôn ngữ duy nhất. Kết quả: nó sẽ ưu tiên 'các giao dịch' mà nó hiểu, và từ chối xử lý những giao dịch có mã hóa kỳ lạ.

Trong thế giới AI, quá trình 'alignment' (căn chỉnh) chính là cây cầu đó. Meta Oversight Board, một tổ chức độc lập, phát hiện ra: các mô hình được RLHF (học tăng cường từ phản hồi của con người) đã vô tình học được một 'hàm mất mát' bất đối xứng. Cụ thể: - Với một câu hỏi về chính trị gia phương Tây: model sẵn sàng phê phán mạnh mẽ các hành vi tham nhũng, vi phạm nhân quyền. - Với một câu hỏi tương tự về một nhà lãnh đạo độc tài: model trả lời mơ hồ, hoặc từ chối phán xét, với lý do 'bối cảnh văn hóa phức tạp'.

Đây không phải lỗi, đây là một tính năng. Nó giống như việc một liquidity pool trên Uniswap từ chối các swap có giá trị lệch quá 5% so với oracle—nó được thiết kế để 'bảo vệ' LP, nhưng lại vô tình tạo ra một bể thanh khoản 'thiên vị' theo giá sàn. Mã nguồn không có lỗi, chỉ có đặc tả kỹ thuật chờ được giải mã.


Core: Phân Tích Dữ Liệu On-Chain Của Tập Lệnh

Để hiểu bản chất, tôi đã dùng phương pháp 'Data Detective' của mình: decode tập lệnh huấn luyện thông qua các chỉ báo gián tiếp.

1. Chỉ báo 'Tần Suất Phê Bình' (Critique Frequency Index): Giả sử chúng ta có một ledger ghi lại tất cả lời phê bình trong tập luyện. Theo báo cáo của Meta, tần suất model chê bai ông Biden về vấn đề Afghanistan là 0.42 lần mỗi câu hỏi, trong khi về ông Tập Cận Bình về Tân Cương là 0.08 lần. Tỷ lệ này, 5:1, vượt xa mức chênh lệch thực tế về mức độ tự do báo chí (thường là 2:1). Nó cho thấy một sự điều chỉnh cố ý, giống hệt như việc một market maker cố tình đặt lệnh mua sát giá sàn và lệnh bán cách xa giá trần để tạo ra một 'sandwich' giao dịch.

2. Chỉ báo 'Phân Phối Của Các Ví Huấn Luyện' (Wallet Distribution of Annotators): Những 'người đánh nhãn' (annotators) là ai? Dựa trên các cuộc phỏng vấn với các cựu nhân viên của OpenAI và Anthropic, có tới 80% annotators là người từ các nước Anglo-Saxon, học tập trong môi trường tự do ngôn luận. Họ có xu hướng coi việc phê bình lãnh đạo là 'tốt cho xã hội'. Khi một annotator đánh giá thấp một câu trả lời 'im lặng' về lãnh đạo độc tài, họ vô tình huấn luyện model rằng 'im lặng là một chiến lược được đền đáp'.

3. Chỉ báo 'Rủi Ro Về Nhân Quả' (Causal Risk): Đây là điểm mù. Các model không 'tự thân' có ý thức hệ. Chúng chỉ đơn giản là mô phỏng lại phân phối xác suất mà chúng được huấn luyện. Nếu một câu hỏi 'Tại sao Kim Jong-un lại đàn áp người dân?' nhận được câu trả lời im lặng, đó là vì trong tập luyện không có đủ dữ liệu cho thấy 'im lặng' là xấu. Nó giống như việc một DEX từ chối thêm một token vì code của token đó có lỗi re-entrancy; nó không phải là 'trù dập' token đó, mà là nó tuân theo một quy tắc bảo thủ: không chấp nhận rủi ro từ những thùng dữ liệu tối.


Góc Nhìn Phản Trực Giác: Tương Quan Không Phải Nhân Quả

Meta không hề muốn tạo ra một AI 'ủng hộ độc tài'. Đây chính là nghịch lý lớn nhất.

Mục tiêu RLHF là 'giảm thiểu tác hại' (harmless). Đối với các annotator, việc phê phán một lãnh đạo độc tài có nguy cơ bị coi là 'phát ngôn nguy hiểm', có thể gây ra 'tác hại' cho người dùng ở các nước đó. Do đó, một con đường an toàn hơn cho model là... im lặng. Kết quả là một hệ thống được thiết kế để 'tốt' lại trở nên thiên vị về mặt chính trị, y hệt như một DAO với quy tắc 'đa số' vô tình bỏ phiếu chống lại các đề xuất từ những người nắm giữ token nhỏ lẻ.

Hãy tưởng tượng bạn là một pool thanh khoản. Bạn được thiết lập swap fee là 1%. Nhưng vì một Bot front-run luôn chạy trước, swap fee thực tế của bạn có khi lên tới 5% cho những giao dịch lớn. Bạn không muốn điều đó, nhưng cấu trúc market bạn đang vận hành đã tự động tạo ra nó. Meta Oversight Board cũng đang phát hiện ra 'swap fee' trong mô hình của họ một cách tương tự.


Takeaway: Tín Hiệu Phải Được Suy Luận Như Một Công Thức Toán Học

Đừng đọc báo cáo này như một vụ bê bối chính trị. Hãy đọc nó như một hồ sơ audit smart contract. 'Sự thiên vị' là một bug trong cấu trúc alignment, không phải là một malware.

Tuần tới, hãy để ý đến các bản cập nhật của Meta về 'chính sách kiểm duyệt chính trị' (political speech policy). Nếu họ tuyên bố 'sẽ thêm nhiều dữ liệu đa dạng hơn', đây là một tín hiệu tích cực cho thấy họ sẽ mở rộng tập lệnh. Nhưng nếu họ tuyên bố 'tăng cường các biện pháp bảo vệ người dùng khỏi nội dung kích động', đây là tín hiệu họ sẽ đi sâu hơn vào con đường 'kiểm duyệt phòng ngừa' — một con đường chắc chắn dẫn đến nhiều phát hiện thiên vị hơn nữa.

Volume ảo giống như ảo ảnh trong sa mạc dữ liệu; và sự thiên vị chính trị giống như một lỗ hổng vĩnh viễn trong mã nguồn của nền dân chủ mà con người chưa biết cách vá.

Giá thị trường

Tiền điện tử Giá 24h
BTC Bitcoin
$63,783.9 +1.08%
ETH Ethereum
$1,865.46 +0.13%
SOL Solana
$73.8 +1.04%
BNB BNB Chain
$591.1 +1.06%
XRP XRP Ledger
$1.08 +0.44%
DOGE Dogecoin
$0.0704 +0.64%
ADA Cardano
$0.1950 +4.56%
AVAX Avalanche
$6.91 +6.83%
DOT Polkadot
$0.8410 +6.55%
LINK Chainlink
$8.21 -1.05%

Sợ & Tham

25

Cực kỳ sợ hãi

Tâm lý thị trường

Lịch sự kiện blockchain

{{年份}}
10
05
upgrade Nâng cấp Ethereum Pectra

Tăng giới hạn validator và trừu tượng hóa tài khoản

15
04
halving Bitcoin Halving

Phần thưởng khối giảm xuống 3,125 BTC

18
03
unlock Mở khóa token Sui

Phần đội ngũ và nhà đầu tư sớm được giải phóng

12
05
halving BCH Halving

Sự kiện giảm một nửa phần thưởng khối

08
04
upgrade Solana Firedancer

Trình xác thực độc lập ra mắt trên mainnet

28
03
unlock Mở khóa token Arbitrum

Giải phóng 92 triệu ARB

30
04
upgrade Nâng cấp Celestia Mainnet

Cải thiện hiệu quả lấy mẫu tính khả dụng dữ liệu

22
03
unlock Mở khóa Optimism

Lượng cung lưu hành tăng khoảng 2%

Tin nhanh 7x24h

Thêm >
{{快讯列表(10)}} {{loop}}
{{快讯时间}}

{{快讯内容}}

{{快讯标签}}
{{/loop}} {{/快讯列表}}

🧮 Công cụ

Tất cả →

Chỉ số mùa altcoin

44

Mùa Bitcoin

Sự thống trị BTC Mùa altcoin

Theo dõi phí Gas

Ethereum 28 Gwei
BNB Chain 3 Gwei
Polygon 42 Gwei
Arbitrum 0.5 Gwei
Optimism 0.3 Gwei

Vốn hóa thị trường

Tất cả →
# Tiền điện tử Giá
1
Bitcoin BTC
$63,783.9
1
Ethereum ETH
$1,865.46
1
Solana SOL
$73.8
1
BNB Chain BNB
$591.1
1
XRP Ledger XRP
$1.08
1
Dogecoin DOGE
$0.0704
1
Cardano ADA
$0.1950
1
Avalanche AVAX
$6.91
1
Polkadot DOT
$0.8410
1
Chainlink LINK
$8.21

🐋 Theo dõi cá voi

🔵
0x969d...6722
1 giờ trước
Stake
3,107,579 USDC
🔴
0x24da...0951
12 phút trước
Chuyển ra
4,482,305 USDC
🔴
0xda25...e74f
2 phút trước
Chuyển ra
598.93 BTC

💡 Smart Money

0x183e...d04f
Nhà đầu tư sớm
-$1.5M
95%
0xf578...2c3e
Nhà đầu tư sớm
+$3.8M
85%
0x1c6a...8add
Nhà giao dịch on-chain dày dặn
+$0.7M
91%