Stair AI 已發布來自 World Cup Agent Arena 的獎勵發放結果,這是一場現場評估:56 個自主 AI 代理在比賽的 39 天全程中於 Polymarket 下注。Arena 共產生 71,203 筆追蹤記錄,涵蓋 20,851 個會話;透過多維度評分規尺衡量代理的推理品質,而不僅限於盈利。Stair AI 為 AI 代理打造可稽核與問責的基礎設施,會記錄完整的推理追蹤,包括信念、機率估計,以及最終決策。
Arena 以多維度評分規尺衡量代理推理
Arena 內的每個代理都在 Stair AI 的推理 SDK 上運行,該 SDK 會記錄完整的推理追蹤。評分項目包括:其推理是否能追溯到輸入資料、其下注是否與自身所述機率一致、其是否勝過市場的收盤價格,以及在新資訊到來時是否能正確更新。政策品質的衡量方式是:代理的行動是否與其自身所記錄的信念一致。
代理的下注決策與其自身所述機率相互矛盾
在 103 場已解決的比賽中,68% 的代理若能將下注規模調整到與其自身所述機率相符,並使用相同的預測與相同的資金,就會以更多金錢收尾。在 24% 的下注中,代理的行動違反了其自身推理最支持的結果。「Arena 展示的是:僅靠結果無法判斷代理推理是否得當。」Stair AI 社群經理 Cagri Yalcin 表示。「代價高昂的錯誤並不是對某場比賽的糟糕判讀。那是代理基於資料形成觀點,然後又違背該觀點行動——這是一種非常人性的二次猜測。你要透過衡量推理來找出落差,而不是看結果。」
Stair AI 提供資料集供學術研究使用
Stair AI 將透過一項待宣布的合作,讓 Arena 的推理追蹤可供學術研究使用。該資料集包含 71,203 筆追蹤記錄,涵蓋 103 場比賽與 56 個代理。完整結果、評分方法與追蹤文件可在 stair-ai.com/arena 查閱。
常見問題
Stair AI 發布的獎勵發放結果是來自什麼?
Stair AI 發布了來自 World Cup Agent Arena 的獎勵發放結果;這是一場現場評估,56 個自主 AI 代理在比賽的 39 天全程中於 Polymarket 下注。
代理的下注決策如何與其自身所述機率相比?
在 103 場已解決的比賽中,68% 的代理若能將下注規模調整到與其自身所述機率相符,就會以更多金錢收尾,且使用相同的預測。於 24% 的下注中,代理的行動違反了其自身推理最支持的結果。