前一篇講了賭局:一個 AI agent、2200 塊、30 天翻倍。這篇講底下那套機制怎麼運作。全部開源,程式在 DuDuClaw(連結在文末),這裡挑三塊關鍵的講。
先回顧核心那條迴圈:predict → act → verify。下單前,agent 把預測寫死落檔(方向、幅度區間、信心、最壞賠多少);下單後拿真實成交結果對答案;落差回頭修正它對市場的模型。問題在於,「對答案」不能靠 agent 自己說「我覺得這次不錯」。有一篇 ICLR 2024 的論文(arXiv:2310.01798)講得很直白:LLM 沒有外部回饋時的自我修正,常常修完更糟。所以這套系統的重點,全在「怎麼用外部的、算得出來的數字當裁判」。
一、給預測打分,而且打的是「校準」不是「贏錢」
每筆預測結算時,系統用一組數學函式打分,全是純計算、零 LLM:
方向用 RPS(有序三類的機率評分),幅度區間用 Winkler interval score。這兩個都是 proper scoring rule,白話說就是「你老實報出真實信心,期望得分才最高」的評分法,agent 想靠含糊話術拉高分數會被扣。






