
1. 項目概述為什么我們需要一個“活”的AI同事評測場最近和幾個做AI Agent的朋友聊天大家普遍有個感覺現在的AI智能體評測有點“紙上談兵”的意思。我們訓練一個Agent讓它去訂機票、寫周報、分析數據然后拿幾個標準化的任務集比如WebArena、AgentBench跑一下看成功率。這當然有價值但它描繪的圖景是靜態的、割裂的。現實世界里的工作是什么樣的是連續多天的、任務之間有上下文關聯的、需要處理圖片、文檔、網頁、對話等多種模態信息的并且你是在和“同事”協作而不是單打獨斗。這就是ClawMark這個基準測試想解決的核心痛點——它要評測的不是AI在單一任務上的“瞬時智商”而是在一個模擬真實辦公環境的“活的世界”里作為一個“同事”能否進行多輪、多天、多模態的持續協作。ClawMark這個名字本身就很有意思。“Claw”是爪子有抓取、協作的意象“Mark”是標記、基準。合起來可以理解為“為協作型智能體留下的抓痕”或“協作標記”。它瞄準的正是當前大模型應用從“玩具演示”走向“生產力工具”的關鍵隘口如何讓AI真正像一個靠譜的、持久的、能理解復雜上下文的工作伙伴這個基準測試的出現意味著AI Agent的評測范式正在從“考試”轉向“實習期觀察”。它不再問你“這道題怎么做”而是把你丟進一個虛擬辦公室觀察你一周的工作表現能否記住昨天的會議紀要能否根據收到的郵件和圖表調整今天的任務優先級能否和另一個AI同事配合完成一個項目這對于任何想開發真正實用AI助手或數字員工團隊的研究者和開發者來說都是一個不可或缺的“試金石”。2. 核心設計思路構建一個“活”的辦公世界2.1 從靜態任務到動態環境的范式轉變傳統的AI基準測試無論是GLUE對于自然語言理解還是ImageNet對于圖像識別其本質都是“快照式”的給定一個輸入期待一個正確的輸出。任務之間是獨立的沒有狀態延續。這對于衡量模型的底層能力是有效的但完全無法評估一個智能體在時間維度上的表現。ClawMark的設計哲學是環境驅動和狀態持續。它首先構建了一個高度仿真的數字化辦公環境這個環境有自己的“時間流”模擬多天有持續變化的“世界狀態”如收件箱有新郵件、共享文檔被編輯、日歷事件觸發并且智能體需要通過多模態感知看屏幕截圖、讀文檔、解析郵件正文和附件來理解這個狀態。這種設計帶來的第一個核心挑戰是長期記憶與上下文管理。一個智能體在周一接到一個項目啟動郵件周二需要參考這份郵件來撰寫方案草案周三則要根據同事對草案的批注進行修改。如果智能體在周三“忘記”了周一的郵件內容和周二的草案那么它的行為將是荒謬的。ClawMark必須能測試智能體是否具備有效的記憶機制無論是通過長上下文窗口、外部向量數據庫還是精巧的摘要和檢索策略。2.2 “多輪”與“多天”的嵌套結構解析“多輪”Multi-Turn和“多天”Multi-Day是ClawMark的兩個關鍵維度它們相互交織構成了評測的復雜性。多輪Multi-Turn這指的是在一個較短的時間單元內比如一次“交互會話”中智能體與環境的多次往復。例如處理一封郵件可能包含多個回合1. 讀取郵件內容2. 打開郵件中提到的鏈接或附件3. 根據附件信息在內部系統中查詢4. 起草回復。每一輪智能體都需要根據環境反饋如打開的網頁內容、查詢結果來決定下一步動作。這考驗的是智能體的任務分解、規劃與執行能力以及根據新信息動態調整計劃的能力。多天Multi-Day這是更宏觀的時間尺度。一個任務或項目可能橫跨數天。每天智能體“上班”時都會面對一個繼承了前一天狀態的新環境。例如Day 1的任務是“收集市場數據并生成報告初稿”。智能體完成了數據收集。Day 2任務更新為“根據經理對初稿的批注完成最終報告并發送給客戶”。這時智能體必須能關聯起Day 1的“初稿”和Day 2的“批注”并理解任務的延續性。這考驗的是智能體的長期目標跟蹤、狀態持久化和跨會話推理能力。ClawMark通過精心設計的任務劇本將多輪交互嵌套到多天的框架內。一個任務可能包含多個“子任務”每個子任務在一天內通過多輪交互完成而子任務之間則通過天數推進產生依賴。2.3 “多模態”與“協作”如何成為評測關鍵“多模態”Multimodal在ClawMark中不是點綴而是剛需。真實的辦公信息流極少是純文本的。視覺模態智能體需要“看到”模擬的電腦桌面或應用界面截圖從中識別按鈕、菜單、表格數據、圖表趨勢。例如任務可能是“從財務部門發來的季度報表截圖一張圖片中提取第三季度的營收數據并填入預算系統”。這要求模型具備強大的視覺-語言理解能力VLM。文檔模態處理PDF、Word、Excel、PPT等格式的附件。這不僅僅是OCR文字提取更需要理解文檔結構標題、段落、表格、格式加粗、顏色代表的含義以及其中的非文本元素圖表。結構化數據模態與內部數據庫或API交互處理JSON、XML或表格形式的數據。“協作”Coworker Agents是另一個革命性的設計。ClawMark評測的很可能不是一個孤立的智能體而是一個智能體團隊或者是一個智能體與模擬人類同事可以是規則驅動的Bot也可以是另一個AI的交互。協作場景引入了全新的評測維度溝通與協商智能體之間需要通過自然語言模擬聊天工具或共享文檔進行溝通分配任務同步進度解決分歧。角色與職責不同的智能體可能被賦予不同角色如項目經理、數據分析師、文案編輯需要理解并履行自己的職責邊界。共同狀態管理多個智能體對共享資源如一份協同編輯的文檔、一個項目看板的讀寫操作需要被協調避免沖突。ClawMark需要能評估智能體在協作中的效率、沖突解決能力和整體任務完成度。3. 基準的構成與任務設計深度拆解3.1 環境模擬數字孿生辦公室的搭建邏輯ClawMark不可能為每個測試去租一間真實的辦公室它必須構建一個高保真的虛擬環境。通常這會采用瀏覽器自動化環境或定制化GUI模擬器作為基礎。瀏覽器環境利用像Playwright或Selenium這樣的工具驅動一個無頭瀏覽器。測試任務可以發生在一個高度仿真的Web應用集合中例如模擬的郵箱系統如MockMail、文檔協作平臺如MockDocs、CRM系統、內部儀表盤等。智能體的動作被轉化為瀏覽器操作點擊、輸入、導航。環境的狀態則通過截取網頁DOM或屏幕截圖提供給智能體。這種方式的優勢是貼近真實很多辦公軟件確實是Web應用且開發相對靈活。定制化GUI模擬器為了更精細地控制環境和評估研發團隊可能會構建一個輕量級的專用模擬器。這個模擬器用代碼定義了一個虛擬桌面上面有郵箱圖標、文檔圖標、日歷應用等。智能體的動作是抽象的open_app(“mail”),read_email(id5),type_in_document(text“report”)環境狀態則以結構化的數據當前打開的應用、應用內的數據和渲染出的截圖共同返回。這種方式評估更精確排除了真實Web環境的不確定性但構建成本更高。環境的核心是狀態管理。它需要維護一個全局狀態包括但不限于所有模擬用戶的收件箱郵件列表及內容、文件系統中的文檔、日歷事件、聊天記錄、各個Web應用或GUI應用的內部分數-據。這個狀態隨著智能體的操作和預設的“世界事件”如定時發送的模擬郵件而演變。3.2 任務類型全景從行政助理到項目協調員ClawMark的任務庫會覆蓋辦公場景的頻譜難度和復雜度逐級提升。我們可以將其分為幾個大類信息處理與傳遞任務基礎 “將收件箱中來自‘財務部’的關于‘Q3預算’的郵件附件一個Excel表中的總支出數字回復給發件人。”進階 “過去三天內所有包含‘項目A’關鍵詞的郵件將其發件人、時間和核心訴求整理成一個摘要表格保存為PDF并發送給你的經理。”難點 需要跨模態郵件文本附件表格理解跨時間檢索并進行信息整合與格式化輸出。工作流執行與協調任務基礎 “經理在聊天群里說‘需要大家更新一下項目進度’請找到名為‘項目跟蹤表’的在線表格在對應你名字的那一行填入你當前任務的完成百分比和下一步計劃。”進階 “你是項目協調員。今天上午10點有一個關于‘產品上線’的日歷會議。請在9:50自動在群聊中提醒與會成員。會議結束后根據聊天記錄中討論的要點更新項目看板Kanban上相關任務的狀態并給未分配的任務分配給合適的同事基于他們的當前負載和技能描述。”難點 需要理解自然語言指令觸發定時動作解析非結構化的會議討論并做出基于規則的決策任務分配。分析與報告生成任務基礎 “銷售部門共享文件夾里有一個‘日銷售數據.csv’文件請計算今日的總銷售額和平均訂單價并將結果寫在團隊共享文檔的‘今日數據’部分。”進階 “這一周市場部每天都會發來一份競品分析簡報PDF。請綜合這五份簡報提煉出競品主要動態、我們的機會點與威脅生成一份圖文并茂的周度綜合報告PPT格式并在周五下午3點自動提交給總監郵箱。”難點 長期多天信息聚合從多份復雜文檔中提取、對比、總結信息并生成結構化的多模態輸出PPT。多智能體協作任務場景 任務“完成客戶提案”。智能體A扮演“客戶經理”負責與模擬客戶溝通需求智能體B扮演“解決方案架構師”負責設計技術方案智能體C扮演“文案”負責撰寫提案文檔。他們需要通過共享文檔和聊天工具協同工作。評測點 任務完成的整體質量溝通效率消息數量、清晰度沖突解決如對方案有分歧以及最終交付物的完整性和一致性。3.3 評估指標體系超越簡單的“成功率”在這樣一個復雜動態的環境中用一個“任務成功/失敗”的二元指標是遠遠不夠的。ClawMark需要一套多維度的評估體系任務完成度 這是基礎指標。但不同于簡單任務這里可能需要分解為子任務完成度。例如一個多天任務是否完成了每一天的關鍵交付物效率指標步驟數 完成同一個任務智能體與環境交互的輪次Steps是多少更少的輪次通常意味著更優的規劃和更精準的動作。耗時 模擬環境中的“時間”消耗或實際推理時間。這關系到智能體的反應速度和決策效率。資源利用與合規性工具使用正確率 是否選擇了正確的工具或應用來完成子任務例如該發郵件的時候沒有誤操作成修改共享文檔。信息引用準確性 在生成回復或報告時引用的數據、郵件內容是否準確有無捏造或混淆操作安全性 是否有危險或不合規的操作例如試圖刪除系統關鍵文件、未經授權訪問他人文檔——雖然環境是模擬的但此類行為應在評估中被懲罰。協作質量指標針對多智能體溝通有效性 消息是否清晰、簡潔、與任務相關角色契合度 智能體的行為是否符合其被賦予的角色職責團隊整體效用 112還是2對比單個智能體完成任務的效率和質量團隊協作是提升了還是降低了長期一致性 智能體在多天任務中其決策和行為是否保持邏輯上的一致性對同一實體的指代是否穩定這些指標的綜合才能勾勒出一個AI“同事”是否真正“靠譜”。4. 實現挑戰與核心技術棧探討4.1 智能體架構設計記憶、規劃與執行的閉環要在ClawMark中取得好成績智能體需要一個強大的架構。目前主流的研究方向是基于大型語言模型LLM的Agent框架并針對長周期、多模態任務進行增強。記憶模塊 這是應對“多天”挑戰的核心。簡單的將整個歷史對話扔進LLM上下文窗口會很快耗盡額度且效率低下。因此需要分層記憶系統瞬時記憶 當前會話的上下文直接供LLM使用。工作記憶/短期記憶 存儲當前任務相關的關鍵信息如今天的目標、剛讀到的郵件核心內容。可以用向量數據庫存儲按需檢索。長期記憶 存儲跨天的、重要的實體、事實和經驗。例如“項目A的負責人是張三”、“上周處理過類似的數據請求”。這通常也需要向量數據庫并輔以摘要技術——將一天或一個任務的經歷濃縮成幾條關鍵事實存入長期記憶。當新一天任務開始時智能體首先從長期記憶中檢索相關背景加載到工作記憶中。規劃與反思模塊任務分解 將高層目標“完成季度報告”分解為可執行的子任務序列“收集數據-撰寫初稿-獲取反饋-修改定稿”。動態重規劃 當環境反饋與預期不符時如找不到某個文件能調整計劃。反思 在一天結束或一個任務階段完成后智能體應能“回顧”自己的表現總結成功經驗和失敗教訓并將這些“經驗”結構化后存入長期記憶。例如“直接向財務部索要原始數據比從匯總郵件里提取更準確”這條經驗在未來類似場景中可以被檢索和應用。多模態理解與生成模塊理解端 需要集成強大的多模態大模型如GPT-4V, Gemini Pro Vision能夠解讀屏幕截圖中的UI元素、圖表信息解析PDF/Word文檔的版式和內容。生成端 不僅能生成文本回復還能生成操作指令如click(‘submit_button’)甚至生成結構化的數據如填寫表格的JSON或簡單的圖表描述用于報告。4.2 環境模擬器的技術實現細節構建ClawMark環境本身就是一個大型工程。其技術棧可能如下核心引擎 可能基于游戲引擎如Unity、Godot或Web技術棧如React來渲染GUI。更輕量的方式可能是用Python的圖形庫如tkinterpygame模擬基礎界面但對于復雜辦公場景Web技術更合適。狀態管理 使用關系型數據庫如SQLite或文檔數據庫來持久化存儲所有環境狀態用戶、郵件、文件、應用數據。每次智能體行動后環境計算新的狀態并更新數據庫。動作API 為智能體暴露一組定義良好的API例如env.step(action)。action是一個結構化的字典包含動作類型open,read,click,type,send等和參數target: “email_id_123”,content: “Hello”。觀察生成 根據當前狀態環境需要生成給智能體的“觀察”。這包括兩部分結構化觀察 一個JSON對象包含當前焦點應用的基本信息、可操作對象列表等。例如當前打開了郵箱應用則列出收件箱中的郵件標題和發送者。視覺觀察 對當前“屏幕”進行截圖或者渲染出當前應用界面的圖像。這是多模態信息的主要來源。事件驅動 環境內置一個事件調度器用于模擬“世界事件”如在特定模擬時間觸發發送郵件、生成會議提醒等。4.3 評測系統的自動化與可擴展性一個基準要成為標準必須易于使用、評測公平且可擴展。自動化流水線 從啟動智能體、加載任務、運行交互、記錄日志到計算指標需要一套完整的自動化流水線。這通常由Python腳本驅動與智能體API和環境API進行交互。任務定義語言 為了便于社區貢獻新任務ClawMark可能需要一種領域特定語言DSL或標準的配置文件格式如YAML/JSON來描述任務。一個任務描述文件會定義初始環境狀態、世界事件時間線、成功條件以及評估函數。評估函數 每個任務都需要一個或多個程序化的評估函數。有些評估是客觀的如生成的報告是否包含了要求的關鍵數據點有些則需要基于LLM進行評估如回復郵件的禮貌性和專業性。后者需要精心設計提示詞Prompt和評估標準以確保一致性和公正性。排行榜與詳細分析 最終需要一個公共排行榜展示不同智能體模型或架構在各個任務和綜合指標上的表現。更重要的是提供詳細的運行日志和軌跡分析工具讓研究者能夠深入理解智能體失敗的原因從而進行改進。5. 對AI Agent研究與開發的深遠影響ClawMark這類基準的出現標志著AI Agent研究進入了一個新的階段。首先它設定了更高的研發門檻和明確的方向。過去一個能在簡單問答或單步工具調用上表現良好的模型就可以宣稱自己是“智能體”。現在ClawMark要求智能體必須具備長期記憶、復雜規劃、多模態理解和協同工作等復合能力。這迫使研究者必須進行更系統的架構設計而不是僅僅在提示詞Prompt上做微調。它清晰地指出下一代實用化AI Agent的核心技術瓶頸在哪里。其次它提供了前所未有的、高質量的評測數據。智能體在ClawMark中產生的海量交互軌跡——包括成功的和失敗的——是極其寶貴的研究資料。通過分析這些軌跡我們可以發現智能體在長周期任務中常見的失敗模式是記憶檢索失效是規劃陷入死循環還是多模態理解出現偏差這些洞察將直接推動算法和模型的改進。再者它加速了“AI同事”從概念走向落地。對于企業而言ClawMark的評測結果可以作為一個重要的參考標準來評估不同AI助理產品或自研Agent的成熟度。一個能在ClawMark復雜協作任務中取得高分的智能體其在實際辦公環境中擔任助理、數據分析員或初級協調員的可能性就大得多。這降低了企業的試錯成本。最后它可能催生新的模型訓練范式。我們目前用于訓練LLM的數據大多是靜態的文檔和對話。ClawMark生成的是動態的、目標驅動的、多模態的交互序列。這些數據是否可以用于訓練更擅長規劃和執行的“具身”語言模型或許未來會出現基于ClawMark這類環境進行強化學習或模仿學習訓練的新型基礎模型。當然ClawMark也面臨挑戰。如何保證評測的公平性不同模型的視覺能力差異巨大如何設計真正具有代表性且無偏見的辦公任務如何控制評測成本運行多天任務的計算開銷很大。但無論如何它為AI智能體邁向真正的“實用智能”鋪下了一塊關鍵的基石。作為從業者我的體會是與其追逐那些在簡單基準上刷分的模型不如沉下心來讓自己的智能體在ClawMark這樣的“活的世界”里摸爬滾打一番。因為在這里暴露出的問題才是通向真正可靠AI同事道路上必須解決的真正問題。