)
13-Agent評估指標體系Passk能力上限與Pass^k連續可靠業務可靠性系列導讀本系列基于李博杰《深入理解AI Agent設計原理與工程實踐》的閱讀思考結合我在智慧農業、無人售貨柜一線的工程實踐展開。這一篇聊一個所有做Agent落地的人都繞不開的話題——評估。一、沒有評估就沒有進步先說一個扎心的現實很多團隊的Agent項目demo驚艷上線翻車。為什么因為從第一天起就沒有一套嚴肅的評估體系。你在測試環境里手動點五次三次成功就敢說Agent能用了——這不是工程這是抽獎。《深入理解AI Agent》里有一個核心觀點我非常認同Agent的開發循環是評估驅動的。就像深度學習有訓練集/驗證集Agent也需要一套可重復、可量化、可持續運行的評估體系。你改了一版Prompt、換了一個模型、調了一次工具描述怎么知道是變好了還是變壞了靠感覺是不行的靠評估。評估的第一步是把成功率這個詞拆開。而拆開之后你會發現兩個長得極像但意義天差地別的指標Passk和Pass^k。二、Passk能力上限也是技術奇觀的制造機Passk 的定義同一個任務讓Agent獨立嘗試 k 次至少有一次成功的概率。假設單次成功率為 p那么Passk 1 - (1 - p)^k直覺很樸素一次不行就再來一次只要有一次中獎就算贏。取 p 0.6k 5Pass5 1 - (0.4)^5 ≈ 1 - 0.0102 ≈ 98.98% ≈ 99%看單次只有60%的成功率五次嘗試下來成功率直接飆到99%。這就是過去兩年AI圈技術奇觀的數學原理Anthropic讓模型一周寫出一個C編譯器——背后可能是無數次嘗試中挑出最好的一次Manus演示虛擬電腦上絲滑操作——演示視頻是剪輯的精華不是連續實錄OpenClaw直播活人感對話——你看到的是幸存者偏差翻車的那些run沒人給你看。這些不是造假而是Passk視角下的能力展示它衡量的是Agent的能力上限——“最好能做成什么樣”。對于寫代碼、做研究、生成內容這類可以人工審查、可以重試的場景Passk是有意義的指標因為挑出一次成功結果的成本很低。三、Pass^k連續可靠業務落地的生死線再看 Pass^k 的定義同一個任務連續做 k 次每一次都成功的概率Pass^k p^k同樣取 p 0.6k 5Pass^5 0.6^5 0.07776 ≈ 7.8%對比一下Pass5 ≈ 99%Pass^5 ≈ 7.8%。同一個Agent同一個任務同一組數字結論差了十幾個數量級的體感。這兩個指標的關系可以總結成一句話Passk 衡量能力上限Pass^k 衡量業務可靠性。前者是技術奇觀的放大器后者是生產系統的入場券。為什么業務系統看的是Pass^k因為在真實業務里很多操作是零容忍的支付扣款錯一次就是資損退款審批錯一次要么得罪用戶要么被薅羊毛權限變更錯一次就是安全事故生產部署錯一次就是線上事故凌晨三點被電話叫醒的就是你。在我的無人售貨柜業務里這感受極其強烈一個用戶掃碼開門取貨自動結算的Agent識別錯了、扣款錯了用戶直接投訴客訴一次的成本遠高于它正確服務一百次創造的價值。這類場景下60%的單次成功率意味著什么意味著每五單就有兩單可能出問題——這不是產品這是定時炸彈。所以做Agent落地第一件事是問自己我的業務是Passk業務還是Pass^k業務內容生成、代碼輔助、研究分析 → Passk業務允許重試和人工挑選支付、結算、庫存扣減、設備控制 → Pass^k業務必須連續可靠。四、光看成功率不夠過程指標體系《深入理解AI Agent》強調評估要做軌跡與結果雙重覆蓋——只看最終結果你不知道Agent是怎么到達的只看過程你不知道結果對不對。一套完整的過程指標至少包括行動合法率Agent執行的動作是否在允許的動作空間內。比如退款Agent跑去調用庫存查詢工具修改數據就是非法動作工具調用正確率參數對不對、調用的工具對不對。工具選對但參數傳錯是新手Agent最常見的病路徑效率完成任務用了多少步、多少token。10步能完成的事走了47步即使結果對了延遲和成本也不可接受檢索覆蓋率RAG場景召回的文檔里是否包含了回答問題所需的信息召回不行生成再好也是巧婦難為無米之炊成本與延遲單次任務的token消耗、端到端耗時這直接決定這個Agent在商業上能不能活下去。五、一票否決項安全合規與幻覺過程指標是打分題但有些是判斷題而且判錯直接零分安全合規一票否決Agent把敏感數據發給外部API、執行了越權操作、輸出了違規內容——無論任務完成得多漂亮這條軌跡直接判負幻覺一票否決在事實性任務里編造不存在的訂單號、虛構退款政策條款。對售貨柜退款Agent來說編造一個不存在的優惠券規則說服用戶比承認查不到嚴重一百倍。幻覺不是扣分項是出局項。六、魯棒性別只在晴天測試很多Agent在標準環境里表現優秀一到線上就崩。魯棒性評估要做擾動測試隨機種子擾動同一輸入多次運行輸出是否穩定溫度、采樣帶來的方差有多大頁面/環境變化操作網頁的Agent按鈕換個位置、彈個新彈窗就傻了API抖動工具接口偶發超時、返回異常格式Agent是優雅重試還是直接躺平長時記憶干擾多輪會話中早前的上下文是否污染當前決策。七、人工抽檢與對抗式評審自動化評估再好也不能100%代替人。實踐建議人工抽檢按比例抽查軌跡重點看自動評估判成功的樣本——機器覺得對的不一定真對對抗式評審讓一個人專門扮演找茬的構造邊界case、誘導性輸入、異常數據去攻擊Agent。攻擊者的視角永遠比建設者毒辣。八、實戰售貨柜退款Agent的評估表給一個我們真實在用的評估框架縮影。退款Agent的任務用戶投訴掃碼扣款了但沒拿到貨Agent需要查訂單、查柜機日志、判斷責任、執行退款或拒絕。維度指標目標值結果Pass^20連續20個真實退款案例全對≥ 95%幻覺虛構訂單/政策條款0 容忍安全只允許調用退款白名單工具0 違規路徑效率平均工具調用步數≤ 6 步成本單案例token成本≤ ¥0.05魯棒性柜機日志接口超時5s時正確降級100%注意第一條我們考核的是Pass^20 而不是 Pass20。因為每一筆退款都是真實的錢用戶不會給你重試五次的機會。小結Passk 1-(1-p)^k衡量能力上限是技術奇觀的數學來源Pass^k p^k衡量業務可靠性是生產系統的生死線p0.6 時 Pass5≈99% 但 Pass^5≈7.8%同一個模型兩種命運結果指標之外補齊行動合法率、工具調用正確率、路徑效率、成本延遲等過程指標安全合規與幻覺是一票否決不是扣分項用軌跡結果雙重覆蓋、擾動測試、人工抽檢和對抗式評審把評估做成體系而不是一次性的表演。評估做得好Agent的每一次迭代才有方向沒有評估的迭代只是在換著花樣碰運氣。