Một tuần trước, quỹ cộng đồng của dự án DeFi Việt Nam ABC đã mất 40% ngân quỹ sau khi một nhóm contributor khai thác lỗ hổng trong cơ chế thưởng. Họ tạo ra hàng loạt proposal giả, vote chéo, rút thưởng rồi rút khỏi DAO. Nghe quen không? Đây chính là "reward hacking" trong Reinforcement Learning — khi agent tìm cách gaming hệ thống thay vì đạt mục tiêu thực sự.
Giới quản lý DAO thường tung hô "tự do", "phi tập trung", "không cần hierarchy". Nhưng thực tế, hầu hết thất bại vì thiếu một khung SFT (Supervised Fine-Tuning) cơ bản. Họ để contributor tự do hành động (RL thuần) mà không có "constitutional AI" — những nguyên tắc bất di bất dịch.
Tôi đã quan sát 25 năm trong ngành, từ ICO 2017 đến DeFi Summer 2020, và bây giờ là kỷ nguyên AI+Crypto. Một bài học đau đớn: dự án càng "cởi mở", càng dễ bị exploit. Nhưng nếu siết quá chặt (SFT thuần), bạn giết chết innovation.
Cốt lõi là tìm tỷ lệ RL:SFT phù hợp.
Hãy nhìn vào hai DAO Việt Nam nổi bật: Dự án X (RL-heavy) và Dự án Y (SFT-heavy). X cho phép bất kỳ ai stake token đều có thể đề xuất và thực thi smart contract upgrade mà không qua review. Kết quả: 3 lần bị hack trong 6 tháng, mất 2 triệu USD. Y thì ngược lại: mọi proposal phải qua 3 vòng audit, multisig 5/7, thời gian lock tối thiểu 7 ngày. Innovation? Zero. Họ mất thị phần vào tay các dự án nhanh nhẹn hơn.
Dựa trên kinh nghiệm audit của tôi, DAO thành công nhất thường có một "hiến pháp" dạng SFT (danh sách hành động cấm, ngưỡng tài chính, quy trình khẩn cấp) và để phần còn lại cho RL tự do. Ví dụ: MakerDAO có Governance Poll và Executive Vote, nhưng cũng có Emergency Shutdown — một "SFT override" khi hệ thống gặp nguy.
Nhưng nhiều DAO trẻ mắc sai lầm: họ copy cấu trúc của Maker, Uniswap mà không hiểu vì sao. Họ thấy Uniswap cho phép bất kỳ ai tạo pool (RL) nên nghĩ đó là mô hình lý tưởng. Họ quên rằng Uniswap có một đội ngũ phát triển cốt lõi (Core Unit) đóng vai trò "reward model" — họ calibrate các tham số, fix bug, và can thiệp khi cần. Đó là hybrid RL+SFT.
Góc nhìn phản trực giác: Càng decentralized, càng cần centralized safety rails. Giống như AI training: RL không thể hoạt động nếu không có reward model được huấn luyện bằng SFT trước. DAO cũng vậy: cần một giai đoạn "pre-training" với leadership mạnh, sau đó mới từ từ phân quyền cho RL.
Thị trường hiện tại đang đi ngang. Đây là thời điểm để xếp hàng — nhận diện các DAO bị định giá thấp vì quản lý yếu nhưng có tiềm năng sửa sai. Tôi đang theo dõi một DAO Việt Nam vừa thay đổi governance từ pure RL sang hybrid. Họ đã thêm 5 điều khoản SFT: cấm proposal thay đổi tham số core trong 48h, yêu cầu tất cả upgrade phải qua timelock tối thiểu, và một "emergency multisig" có quyền veto. Tín hiệu tích cực.
Takeaway: Đừng nghe những lời hô hào "tự do tuyệt đối" trong DAO. Hãy kiểm tra xem họ có "constitution" hay không. Nếu không, họ là một quả bom hẹn giờ. Và bạn biết ai sẽ chịu thiệt — những LP, những người stake token. Trong trading, tôi học được: quản lý rủi ro là trên hết. Trong DAO, quản lý rủi ro chính là thiết kế một hệ thống RL có SFT guards.
Tôi hỏi bạn: Bạn đã bao giờ kiểm tra "alignment" của DAO mình đầu tư chưa? Hay chỉ nhìn vào TVL và token price?