
如何驗證 AI 技能好不好用一套評估系統完整實戰指南【免費下載鏈接】skillsPublic repository for Agent Skills項目地址: https://gitcode.com/GitHub_Trending/skills3/skills你剛寫完一組 MCP 工具讓大模型去調用看起來能跑——但到底能答對多少這不能靠感覺。skills 倉庫里的 mcp-builder 模塊內置了 AI 技能評估能力它把一批測試題交給模型讓模型用你的工具作答再逐題對照標準答案輸出一份量化報告。從出題到讀結果下面走一遍完整流程。先把話說清楚這套評估器在哪它藏在倉庫的skills/mcp-builder/目錄下核心就是一個腳本skills/mcp-builder/scripts/evaluation.py。工作方式一句話概括連上你的 MCP 服務列出全部工具逐題喂入問題跑完模型的完整調用循環記錄每題的答案、耗時和工具調用次數。連接方式支持 STDIO、SSE、HTTP 三種本地進程和遠程部署的服務都能測。同目錄下的example_evaluation.xml是一個現成的測試文件樣例照著寫即可。 三步跑通評估第一步裝依賴。只有兩個包anthropic SDK 和 mcp都在skills/mcp-builder/scripts/requirements.txt里。pip install -r skills/mcp-builder/scripts/requirements.txt第二步準備測試文件。格式是 XML根節點evaluation每個qa_pair里放一個question和一個answer答案就是標準答案原文。第三步執行。本地 STDIO 服務最典型python skills/mcp-builder/scripts/evaluation.py \ -t stdio -c python -a my_server.py my_eval.xml其中-t指定連接方式-c是啟動服務的命令-a是傳給服務的參數。如果服務部署在遠端把-t換成 sse 或 http改傳 URL并可以附帶自定義請求頭做鑒權。測試集怎么出題10 道能驗真的題配套的出題指南在skills/mcp-builder/reference/evaluation.md核心要求四條建議一次出 10 道題只讀且無害答題只靠查詢不修改任何數據。這樣評估可以反復跑結果可比。相互獨立題目之間無依賴調換順序不影響答案方便單獨復測。答案可精確核對單個數字、ID 或一段確定文本。比如本金 1 萬、月息復利 3 年最終金額保留兩位小數答案就是一個數字對就是對。答案穩定不隨時間變化。別用當前有幾條未讀消息這種題下次跑結果就飄了。另外兩點決定這套測試是否有含金量。一是題目要多跳一道題逼著模型連續調用多個工具才能湊出答案單步查詢測不出工具配合的問題。二是避免在題面里寫工具字段名用同義詞或口語化表述——真實用戶往往不知道你的字段叫channel_id只說那個頻道。 報告里的四個關鍵指標怎么讀跑完后會生成一份 Markdown 報告用-o參數可以存成文件。頂部是四個匯總值準確率答對的題數除以總題數。注意判分是字符串精確比對所以出題時必須在題面里寫死輸出格式保留幾位小數、只要數字等否則 11614.72 和 $11,614.72 會被判錯。平均任務耗時從提問到出答案的總時長。個別題目明顯偏慢時翻到該題的工具調用明細看是哪個工具拖了后腿。平均工具調用次數偏少可能說明模型跳步偏多則大概率是工具描述不清晰模型在反復試錯。每題的 Summary 與 Feedback這是模型被要求寫下的復盤Feedback 部分常直接點名某個工具命名含糊、參數沒文檔、報錯看不懂。整份報告里它最有價值往往直接就是改進清單。模型解不出的題會返回 NOT_FOUND 計為失敗失敗案例同樣值得細看。發現瓶頸、改進、復測的循環評估的價值不在一次分數而在讓你能證明改動有效。循環這么做先看失敗題模型答錯前調用了哪些工具、工具返回了什么瓶頸通常就藏在返回內容里。再看 Feedback 的共性問題如果多道題都在抱怨工具 X 的參數描述不清楚這就是明確信號。一次只改一處比如只重寫一個工具的描述然后用同一份測試文件重跑。對比兩份報告準確率是否上升、耗時是否下降、工具調用次數是否收斂三項一起看比單看準確率更可靠。測試文件不用動改動的只是你的服務本身。這樣每一輪復測的差異才能真正歸因到那次修改上。【免費下載鏈接】skillsPublic repository for Agent Skills項目地址: https://gitcode.com/GitHub_Trending/skills3/skills創作聲明:本文部分內容由AI輔助生成(AIGC),僅供參考