工程 · 1 min read
怎麼知道 agent 做得好?
最小可行的 eval:要求 agent 交代它完成了什麼、跑了哪些驗證、呼叫了哪些工具、還有什麼沒做。一行決策紀錄,就幫我抓到 agent 裡的一個 bug。
North 每做一次真正的判斷,就在決策紀錄加一行:日期、領域、它決定了什麼。
有一天,這份紀錄抓到一個 bug。我有一個 script 會讀日記裡的能量表格,但它把表格裡的空白範例當成了真實資料。North 沒有照單全收,而是在紀錄裡寫下「這個 script 有問題」,並回報給我。
如果沒有這一行紀錄,我只會看到一則奇怪的提醒,然後猜原因。
三種 eval
「大大帶我飛」的演講把 eval 分成三種:
最小可行的 eval
先不用做評分系統。演講給了一個最小的起點:要求 agent 交代四件事。
- 完成了什麼。
- 跑了哪些驗證。
- 呼叫了哪些工具。
- 還有哪些風險或沒做的事。
North 的決策紀錄就是這種交代的精簡版。它也是Agent 系統裡的三種 loop裡 meta loop 的原料。紀錄累積夠多,就能找出重複的判斷,見讓 NFR 畢業成 FR。
沒有 trace,你只能看結果猜原因。
參考來源:
- 「大大帶我飛」的演講
延伸閱讀: 這份紀錄餵給哪個 meta loop,看Agent 系統裡的三種 loop,重複的判斷怎麼畢業,看讓 NFR 畢業成 FR。或回到系列總覽:設計 Agent,先切 FR 與 NFR。