工程 · 2 min read
讓 NFR 畢業成 FR:樸素版的 self-improving agent
Self-improving 不一定是 agent 自己改自己。記下每次判斷、每月找出重複,把重複三次的判斷寫成 script,並由人核准。Agent 越跑越固定,才是真的變好。
North 連續幾次都自己擋掉過期的待辦快照。有一次,它在決策紀錄裡多寫了一句:「FR 候選:快照日期不是今天時,host 不要送這些資料。」
它在告訴我:這個判斷不必每天再交給它做。
演講裡的版本
「大大帶我飛」的演講介紹了 self-improving agent。它引用 OpenAI 的文章,重點是把 production 裡的失敗,轉成可歸因、可評估、可交給 agent 改善的工程任務:
我的樸素版
我沒有做改善用的 agent。我用的是更簡單的方法:
- 關鍵是「重複」。只出現一次的判斷,留給 LLM。重複三次的,就是規則。
- Agent 可以提議,但不自己改規格。改規格要經過人。
- 決策紀錄來自怎麼知道 agent 做得好?。這整個流程,就是Agent 系統裡的三種 loop裡的 meta loop。
為什麼這樣就算變好
Self-improving 不一定是 agent 自己改自己。把重複出現的判斷寫成 script,agent 的判斷路徑就少一條。它會更便宜,出錯時也更好找原因。
這是Agent 設計就是 FR 與 NFR 的切分的後半段。先切 FR 與 NFR,再讓 NFR 一條一條畢業。過期快照那條規則,就是從Context:這一步要讓 agent 看什麼、不看什麼那次判斷畢業的。
Agent 越跑越固定,才是真的變好。
參考來源:
- 「大大帶我飛」的演講
- OpenAI,Building self-improving tax agents with Codex,2026
延伸閱讀: 切分從哪裡開始,看Agent 設計就是 FR 與 NFR 的切分,過期快照的判斷從哪裡來,看Context:這一步要讓 agent 看什麼、不看什麼。或回到系列總覽:設計 Agent,先切 FR 與 NFR。