Hook: Chỉ số bất thường
Trong 90 ngày qua, tỷ lệ tham gia bỏ phiếu của 5 DAO hàng đầu Ethereum giảm 28%, nhưng số lượng đề xuất được thông qua tăng 41%. Điều này trái ngược với logic quản trị truyền thống – thường nghĩ rằng ít người bỏ phiếu thì chất lượng quyết định sẽ giảm. Nhưng nếu nhìn bằng con mắt của một On-Chain Data Analyst, đây có thể là tín hiệu chuyển đổi từ mô hình quản trị 'SFT' (Supervised Fine-Tuning) sang mô hình 'RL' (Reinforcement Learning) – một khái niệm được phổ biến bởi sáng lập viên của Moonsight AI trong một bài phỏng vấn gần đây. Tuy nhiên, liệu dữ liệu on-chain có thực sự ủng hộ luận điểm này?
Context: Phương pháp dữ liệu
Để kiểm tra, tôi đã truy xuất dữ liệu từ Dune Analytics và Etherscan cho ba DAO đại diện: Uniswap, Compound và MakerDAO. Tôi xây dựng một dashboard theo dõi 10 metrics, bao gồm: (1) ngưỡng đề xuất tối thiểu, (2) tỷ lệ cử tri tham gia, (3) thời gian trung bình từ đề xuất đến thực thi, (4) sự phân tán quyền biểu quyết (Gini coefficient), (5) số lượng đề xuất bị từ chối vì vi phạm an toàn. Bộ chỉ số này giúp phân loại hành vi quản trị thành hai thái cực: 'SFT' – can thiệp sâu, kiểm soát chặt, ưu tiên an toàn; và 'RL' – tự do thử nghiệm, thưởng cho sáng tạo, chấp nhận rủi ro.
Core: Chuỗi bằng chứng on-chain
Kết quả cho thấy rõ ràng sự phân hóa. Uniswap DAO (UNI) có ngưỡng đề xuất 0.25% tổng cung – tương đương khoảng $2.5 triệu tại thời điểm viết – cao nhất trong ba. Tỷ lệ tham gia bỏ phiếu trung bình chỉ 12%, nhưng tỷ lệ đề xuất được thông qua đạt 94%. Thời gian thực thi nhanh: trung bình 3.2 ngày. Đây là mô hình 'SFT' điển hình: ít quyền tự do cho người dùng nhỏ, mọi thay đổi đều qua bộ lọc nghiêm ngặt của các ví lớn. Ngược lại, Compound DAO (COMP) có ngưỡng đề xuất thấp hơn nhiều: chỉ 0.1% tổng cung (~$800k). Tỷ lệ tham gia bỏ phiếu 18%, nhưng tỷ lệ thành công chỉ 72% – nhiều đề xuất bị từ chối vì lỗi kỹ thuật hoặc thiếu tính khả thi. Thời gian thực thi kéo dài hơn: 5.7 ngày. Compound đang vận hành theo kiểu 'RL': cho phép mọi người thử nghiệm, nhưng phải trả giá bằng sự chậm trễ và lãng phí. MakerDAO (MKR) là trường hợp thú vị nhất: tỷ lệ tham gia bỏ phiếu cực thấp (7%), nhưng số lượng đề xuất thành công lại cao (89%). Tuy nhiên, phân tích sâu cho thấy 60% đề xuất thành công đến từ nhóm 'cốt cán' – tức một nhóm nhỏ kiểm soát quy trình. Đây là 'SFT' nhưng với cấu trúc tập trung hóa mạnh. Thử nghiệm với giả thuyết 'chuyển đổi RL': tôi xem xét 6 tháng gần nhất, khi số lượng thành viên mới tăng vọt (do airdrop và marketing), tỷ lệ tham gia của Compound tăng 12% nhưng chất lượng đề xuất giảm – số đề xuất bị từ chối vì 'gaming the system' tăng 300%. Đúng như cảnh báo từ bài phân tích quản trị AI: tự do không có khung sắt tạo ra reward hacking.
Contrarian: Tương quan ≠ Nhân quả
Bề ngoài, dữ liệu on-chain dường như ủng hộ luận điểm RL vs SFT. Nhưng nếu nhìn kỹ, có một nghịch lý: Uniswap (SFT) lại có tỷ lệ đổi mới tính năng cao hơn Compound (RL) trong cùng kỳ. Uniswap v4 ra mắt với Hooks, Compound v3 chỉ là nâng cấp an toàn. Vậy SFT không hề kìm hãm sáng tạo? Thực ra, đòn bẩy ở đây là 'ngưỡng quyền lực': các DAO SFT trao quyền ra quyết định cho nhóm nhỏ nhưng có chuyên môn cao, họ thử nghiệm trong phòng thí nghiệm riêng trước khi đưa ra vote. Còn RL phân tán quyền lực, dẫn đến 'bi kịch của những người chung' – ai cũng có thể đề xuất, nhưng không ai chịu trách nhiệm kiểm duyệt. Sự khác biệt chính không nằm ở mức độ tự do, mà ở cấu trúc thưởng phạt. Uniswap thưởng cho nhà phát triển thông qua GRANTS trực tiếp (giống RLHF trong AI), Compound lại thưởng qua token vote (giống reward function thô). Kết quả: Compound gặp hiện tượng 'fake work' – các đề xuất vô dụng nhưng được vote vì lợi ích ngắn hạn. MakerDAO thì 'reward function' bị bóp méo bởi nhóm cốt cán. Tóm lại, việc sao chép nguyên xi RL từ AI vào quản trị DAO mà không thiết kế cơ chế chống gian lận sẽ thất bại.
Takeaway: Tín hiệu tuần tới
Tuần này, tôi sẽ theo dõi Compound DAO vì họ sắp vote nâng cấp Cross-Chain Risk Params – một đề xuất thay đổi cách tính part Reward. Nếu thông qua, nó sẽ giống như chuyển từ RL thuần sang RL có 'constitutional constraints'. Dữ liệu on-chain cho thấy lượng COMP đặt trong các hợp đồng vote tăng đột biến 40% trong 24 giờ qua – dấu hiệu của một cuộc chiến trị giá triệu đô. Câu hỏi đặt ra: Liệu một DAO 'RL' có tự mình sửa được lỗi 'reward hacking'? Hay cần một cú sốc từ bên ngoài (như sự sụp đổ của một DeFi) để thức tỉnh? Hãy cùng chờ xem.