
跑通一個超越人類的 GUI 智能體Agent-S3 的完整部署與調優路徑【免費下載鏈接】Agent-SAgent S: an open agentic framework that uses computers like a human項目地址: https://gitcode.com/GitHub_Trending/ag/Agent-S你大概也被問過這事為什么不讓程序自己干比如把散落在收件箱里的三百個附件按項目歸檔或者把 Word 里所有表格統一改成公司模板樣式。手動做費時專門寫腳本更煩——因為很多操作的入口只是屏幕上那個窗口而不是 API。這就是 GUI 智能體框架 Agent-S3 要解決的問題讓模型像人一樣看屏幕、點鼠標、敲鍵盤把復雜任務一步步做完。它在 OSWorld 基準上的最新成績是 72.6%剛好越過人類參考線約 72%。GUI 智能體能接住什么樣的任務先用兩個具體場景說清楚它和什么有關。場景一表格類辦公任務。打開 sales_data.xlsx算出各產品線的季度環比增長再畫一張趨勢圖。在 Agent-S3 的內部規則里電子表格的計算走代碼 agent直接寫 Python 執行畫圖走 GUI點菜單、選圖表類型。這個分工不是你去配置的而是內置在框架的程序性記憶里你讀一眼 程序性記憶源碼 就能看到它是怎么寫進提示詞的。場景二跨應用流程。把這周的會議記錄從日歷里導出整理成一份 Markdown 存到共享盤。這類任務沒有現成 API 可調最穩的自動化路線就是操作 GUI——人怎么點它怎么點。Agent-S3 支持 Linux、macOS、Windows單顯示器如果打開本地代碼執行環境它還能直接在你機器上跑 Python/Bash把一部分GUI 活變成程序活這是它區別于純多模態智能體方案的關鍵點。內部怎么運轉從一張截圖到一次點擊 用餐廳后廚的分工來理解最直觀Worker 是頭灶它拿到指令和最新截圖輸出一條描述性動作比如點擊右上角的保存按鈕。它只說點什么不管點在哪。Grounding 是傳菜員兼刀工把點保存按鈕翻譯成可執行的 Python 代碼——先由 Grounding 模型如 UI-TARS在截圖上定位按鈕的像素坐標再由 pyautogui 真正執行點擊。執行完截一張新圖送回給頭灶循環往復直到任務完成。在這個閉環外面還有兩樣東西。記憶是灶臺筆記每次任務結束都會沉淀經驗——哪類任務該走代碼 agent、哪類必須走 GUI、完成后怎么驗證這些會作為程序性記憶注入下一輪。Reflection 是試味員默認開啟在 Worker 跑偏時拉一把。值得一提的是 S3 相對 S2 最大的變化砍掉了上層 Manager 分層Worker 一個環節直接完成規劃 執行推理步驟更少、對環境變化反應更快。翻 AgentS3 核心源碼類注釋就一句話——no hierarchy for less inference time。圖中展示了 GUI 智能體一次任務執行的完整閉環計劃流向 Worker描述性動作經 Grounding 變成代碼執行經驗寫回 Memory十分鐘跑起來三個前置條件一臺單屏機器、主模型的 API Key、一個能部署 Grounding 模型的推理端點官方推薦把 UI-TARS-1.5-7B 掛在 Hugging Face Inference Endpoints 上自己用 vLLM 起也完全可以。安裝部分只有三行pip install gui-agents brew install tesseract # OCR 依賴必須裝 export OPENAI_API_KEY你的key # 用其他廠商則換對應 key裝好后用自帶 CLI 直接跑這就是最常見的 Agent-S3 部署姿勢agent_s \ --provider openai \ --model gpt-5-2025-08-07 \ --ground_provider huggingface \ --ground_url http://localhost:8080 \ --ground_model ui-tars-1.5-7b \ --grounding_width 1920 \ --grounding_height 1080想改源碼的話clone 倉庫https://gitcode.com/GitHub_Trending/ag/Agent-S后pip install -e .進入開發模式即可。不用 CLI 時SDK 的用法是實例化AgentS3OSWorldACI然后在循環里調agent.predict(instruction, obs)、執行返回的 action 代碼官方 CLI 源碼里就有完整的推理循環可以參考。主模型與 Grounding 模型怎么配GUI 智能體的配置其實只圍繞兩個大腦展開配置項推薦值說明主模型gpt-5-2025-08-07負責規劃與決策OpenAI、Anthropic、Gemini、Azure、Open Router、本地 vLLM 都支持Grounding 模型UI-TARS-1.5-7B自己部署在推理端點上負責在截圖中定位 UI 元素Grounding 分辨率1920×1080必須與模型輸出坐標系一致換 UI-TARS-72B 則用 1000×1000物理屏幕單屏1920×1080不支持多屏本地代碼執行默認關--enable_local_env開啟后以你的用戶權限跑任意代碼僅可信環境使用軌跡長度8--max_trajectory_length歷史保留的截圖輪數越大上下文越長踩過的坑提前說grounding_width/grounding_height如果和 Grounding 模型的輸出坐標系對不上點擊坐標會整體錯位表現就是智能體到處亂點。這是部署階段排障的第一嫌疑官方文檔里對兩種 UI-TARS 模型都有明確的坐標對照。GUI 智能體的強項與短板看數據先說強的。OSWorld 基準100 步設置上Agent-S3 單次運行 66.0%已經比前 SOTAGTA1 w/ GPT-563.4%高 2.6 個百分點再疊加 Behavior Best-of-N跑三次、用裁判挑最優軌跡到 72.6%越過 OSWorld 人類參考線約 72%。方法OSWorld 成功率提升幅度 vs 第二名Agent S3bBoN72.6%9.2 ppAgent S3 單次運行66.0%2.6 ppGTA1 w/ GPT-5前 SOTA63.4%—人類參考~72%—圖中展示了各 GUI 智能體在 OSWorld 基準上的成功率以及 Agent-S3 與約 72% 人類參考線的相對位置泛化性也值得一提沒有做任何平臺專項適配WindowsAgentArena 上從單次的 50.2% 提升到 3 次采樣擇優后的 56.6%AndroidWorld 從 68.1% 到 71.6%。再說不好聽的部署前得知道72.6% 是擇優分數。單次運行是 66%如果你的推理預算只夠跑一遍評估和排期都應該按 66% 算別按 72.6% 算。Grounding 模型要自己部署。7B 不算大但仍然意味著一塊推理端點的顯存和運維成本不像純 API 方案那樣零部署。本地代碼執行是雙刃劍。它用運行 agent 的同一用戶權限執行 Python/Bash官方警告寫得很大僅限可信環境。生產環境請放進沙箱并給 bash 設超時框架內建 30 秒限制但別依賴它。另外一個隱性成本長序列設置下成功率更高但模型調用次數和 token 消耗也同步上漲性能換算力的賬要自己算。圖中展示了允許步數從 15 步增加到 50 步時各智能體成功率的變化序列越長 Agent-S3 的領先越明顯三種可以復用的任務套路跑一段時間之后你會發現真正值得沉淀的不是某個具體任務而是三種套路。GUI 與代碼分工視覺活給 GUI畫圖、透視表、打印設置、一切必須點菜單的操作。數據活給代碼 agent求和、批量填充、篩選排序、批量改格式。Agent-S3 內部就是按這條線切分的而且明確規定圖表類操作永遠不走代碼 agent——你自己設計自動化流水線時可以直接照抄這條邊界。異常回退與驗證代碼 agent 的返回只有三種狀態DONE、FAIL、BUDGET_EXHAUSTED。框架內建的規則是代碼 agent 改完文件后必須回到 GUI 里打開應用驗證結果而且當前打開著的應用可能不反映磁盤上的變化——要整個關掉重開刷新頁面不夠。這套代碼干活、GUI 驗收、失敗回退到 GUI 手動收尾的組合是這篇文檔里我認為最值得抄走的一段工程實踐。關鍵任務跑多次擇優失敗代價高的任務上 bBoN 路線同一任務跑 3 次為每條軌跡的截圖變化生成事實描述再用裁判模型挑出最優的一條。倉庫里帶完整工具鏈osworld_setup/s3/bbon/下的 generate_facts 和 run_judge 就是干這個的。66% 到 72.6%、50.2% 到 56.6%都是這一招抬上去的。下一步值得關注S3 論文The Unreasonable Effectiveness of Scaling Agents for Computer Use已公開S2 被 COLM 2025 接收S1 被 ICLR 2025 接收這條 GUI 智能體路線在學術側是持續出活的。值得盯的兩個方向一是 bBoN 裁判的工程化——目前它更多是評測工具離自動重試到成功的生產組件還有一段距離二是單次運行的成本——性能上探的空間和推理成本下探的空間目前是反向的誰先解決誰就贏。速查卡項內容安裝pip install gui-agents 單獨裝 tesseract開發模式clone https://gitcode.com/GitHub_Trending/ag/Agent-S 后pip install -e .推薦主模型gpt-5-2025-08-07OpenAI推薦 GroundingUI-TARS-1.5-7B自部署端點坐標 1920×1080常用開關--enable_local_env/--max_trajectory_length 8/--enable_reflection坑一Grounding 分辨率與模型坐標系不匹配 → 點擊全錯位坑二多屏或非 1080p → 坐標偏移框架只支持單屏安全紅線本地代碼環境執行任意代碼默認關閉生產上沙箱運行評測資產osworld_setup/s3/ 內含完整運行腳本與 bBoN 裁判工具【免費下載鏈接】Agent-SAgent S: an open agentic framework that uses computers like a human項目地址: https://gitcode.com/GitHub_Trending/ag/Agent-S創作聲明:本文部分內容由AI輔助生成(AIGC),僅供參考