
2026年7月30日Google DeepMind正式發布Gemini Robotics ER 2模型。官方博客用一句話概括了它的定位——“一個高級大腦”。同一天谷歌在社交平臺X上拋出了更直白的九個字“一個大腦。適用于任何機器人。”當特斯拉、Figure AI等玩家在機器人本體賽道上競速時谷歌選擇了一條截然不同的路徑不造機器人只造機器人的“大腦”。Gemini Robotics ER 2的發布標志著這場“物理AGI”競賽進入了一個全新的階段。一、三層架構讓機器人“思考”與“行動”分離Gemini Robotics 2并非單一模型而是一個由三個模型組成的分層系統。第一層是Gemini Robotics 2——視覺-語言-動作模型VLA將攝像頭畫面和自然語言指令直接轉換為電機控制指令能夠控制整個人形機器人從腳到指尖的每一個關節。與此前主要控制機器人上半身的模型不同Gemini Robotics 2實現了真正意義上的“全身控制”——機器人可以行走、下蹲、伸展、抓取完成“穿過房間、拿起灑水壺并將其放到架子上”這樣需要全身協調的完整任務。第二層是Gemini Robotics ER 2——具身推理模型也就是本次發布的核心。它不直接控制電機而是充當機器人的“高級大腦”理解物理環境、規劃多步驟任務然后將執行指令交給底層的VLA模型。官方演示中ER 2驅動Boston Dynamics的Spot機器人僅憑語音指令即可完成導航和物體抓取。第三層是Gemini Robotics On-Device 2——輕量級VLA模型經過優化可在機器人本地運行只需幾小時數據就能適配全新的機器人本體。三層各司其職動作、規劃、部署——這個架構本身就是谷歌的競爭宣言。二、連續視頻理解從“停-想-動”到“邊想邊動”Gemini Robotics ER 2相比前代ER 1.6的核心突破在于連續視頻流處理能力。傳統機器人推理模型采用“停-想-動”模式——機器人必須先停下來思考再執行動作再停下來思考下一步。這種模式在物理世界中造成了明顯的卡頓和不自然。ER 2通過接入Gemini Live API的雙向流式端點實現了同步推理——機器人在執行當前動作的同時已經在規劃后續步驟。在性能數據上ER 2交出了一份扎實的答卷任務進度分類準確率達57.4%幫助機器人在不重啟整個工作流的情況下修正失敗步驟關鍵時刻定位準確率達91.3%平均時間誤差僅0.96秒——比如判斷“何時停止向杯中倒咖啡”執行速度是ER 1.6的4倍滿足現實機器人安全運行所需的亞秒級延遲要求128,000 Token的上下文窗口足以處理數分鐘連續視頻流更值得注意的是ER 2可以原生調用Google Search或開發者自定義函數。這意味著機器人遇到不確定的情況時可以直接“上網查”——這是具身智能走向實用化的關鍵一步。三、多機器人協作第一次讓不同的“身體”共享同一個“大腦”Gemini Robotics ER 2首次引入了多機器人協作機制。在官方演示中Apptronik公司的Apollo 2人形機器人與Franka F3 Duo機械臂平臺成功展示了跨設備協同作業。不同類型的機器人借助ER 2提供的共享語義理解可以實時溝通、分工配合、交接任務完成單臺設備無法獨立完成的復雜工作流。這一能力的意義遠超技術演示本身。它揭示了一個趨勢未來的機器人生態可能不是“一個機器人干所有事”而是“一群各有所長的機器人共享同一個智能系統協同作戰”。而谷歌想要的正是這個“共享的智能系統”。四、安全從“可選項”到“必答題”當AI模型開始控制物理世界中的人形機器人時安全不再是錦上添花而是生死攸關。谷歌在ER 2上采取了多層次安全防護策略。ER 2被官方稱為“迄今為止最安全的機器人模型”——它能更好地檢測人類是否靠近觸發安全工具調用并在有人過于接近時將機器人帶至安全停止狀態。谷歌還推出了名為ASIMOV-Agentic的安全評測基準專門測試推理模型作為“編排者”時是否安全——能否拒絕不安全的工具調用、判斷物理可行性、在不確定時尋求人類幫助。不過谷歌在模型卡中明確禁止開發者將機器人模型用于醫療和交通運輸等安全關鍵領域。這說明即便技術突飛猛進“物理AGI”距離真正進入高風險場景仍有距離。五、行業變局谷歌押注“Android時刻”Gemini Robotics ER 2的發布本質上是谷歌對整個機器人行業的一次戰略卡位。當前人形機器人賽道的主流玩家——特斯拉、Figure AI——走的是垂直整合路線自研模型、自研執行器、自建工廠。而谷歌的選擇截然相反做一個開放的、適用于任何機器人的智能層。DeepMind負責人Demis Hassabis曾表示他希望為機器人構建一個類似Android的操作系統。如果這一愿景實現任何機器人硬件廠商都可以搭載谷歌的“大腦”就像任何手機廠商都可以搭載Android一樣。谷歌不參與機器人本體的制造競賽卻可能成為所有機器人背后的平臺級贏家。在商業落地層面ER 2已通過Gemini API和Google AI Studio向開發者公開提供并在Gemini企業智能體平臺開啟私密預覽。首批合作伙伴包括Apptronik、Agile Robots SE、Boston Dynamics等。第一波應用場景將集中在倉庫分揀、設施巡檢、實驗室任務等風險相對可控的領域。 結語Gemini Robotics ER 2的發布標志著具身智能從“實驗室玩具”向“可部署系統”邁出了實質性的一步。連續視頻理解、同步推理、多機器人協作、工具調用——這些能力疊加在一起正在將一個曾經只存在于科幻中的概念變成現實一個能看、能想、能規劃、能協作的機器人“大腦”。谷歌不造機器人但谷歌想成為所有機器人的“大腦”。這條路能否走通尚需時間檢驗但有一點已經清晰物理世界與AI的交匯正在以前所未有的速度加速。而當這場加速發生時誰掌握了“大腦”誰就掌握了主動權。