Skip to content
所有文章 ‹ Part 07 of 08 · 設計 Agent 與 Agent Loop:先切 FR 與 NFR
工程 · 1 min read

怎麼知道 agent 做得好?

最小可行的 eval:要求 agent 交代它完成了什麼、跑了哪些驗證、呼叫了哪些工具、還有什麼沒做。一行決策紀錄,就幫我抓到 agent 裡的一個 bug。

North 每做一次真正的判斷,就在決策紀錄加一行:日期、領域、它決定了什麼。

有一天,這份紀錄抓到一個 bug。我有一個 script 會讀日記裡的能量表格,但它把表格裡的空白範例當成了真實資料。North 沒有照單全收,而是在紀錄裡寫下「這個 script 有問題」,並回報給我。

如果沒有這一行紀錄,我只會看到一則奇怪的提醒,然後猜原因。

三種 eval

「大大帶我飛」的演講把 eval 分成三種:

Outcome Eval結果有沒有完成任務?答案對嗎?測試過了嗎?使用者接受嗎?→ golden tasks / tests Process Eval過程安全、合理嗎?工具選得對嗎?違反權限嗎?重試失控嗎?→ trace review Cost/Risk Eval值得這些成本嗎?token、延遲、敏感資料、人工審批放哪→ 預算 / 規則
每種 eval 問的問題不同,要用的工具也不同。

最小可行的 eval

先不用做評分系統。演講給了一個最小的起點:要求 agent 交代四件事。

  1. 完成了什麼。
  2. 跑了哪些驗證。
  3. 呼叫了哪些工具。
  4. 還有哪些風險或沒做的事。

North 的決策紀錄就是這種交代的精簡版。它也是Agent 系統裡的三種 loop裡 meta loop 的原料。紀錄累積夠多,就能找出重複的判斷,見讓 NFR 畢業成 FR。

沒有 trace,你只能看結果猜原因。


參考來源:

  • 「大大帶我飛」的演講

延伸閱讀: 這份紀錄餵給哪個 meta loop,看Agent 系統裡的三種 loop,重複的判斷怎麼畢業,看讓 NFR 畢業成 FR。或回到系列總覽:設計 Agent,先切 FR 與 NFR。

// connect

Be brave | Be wise | Be grateful

21 BreakinCode

// elsewhere
LinkedInMedium (lang: en)Youtube
wh:~$William Hung· © 2026 Taipei · GMT+8 · ● Available for collaboration
↑↓ 移動 ↵ 開啟 esc 關閉