
機器人一定要長得像人嗎Genesis AI 的回答是不一定。Genesis AI 這家base在法國和硅谷的具身新星今年6月推出了首款具身機器人Eno沒有頭和臉只保留靈巧操作必要的部分流暢簡潔的設計被稱為機器人界的iPhone今年四季度上市。圖Genesis AI的機器人EnoEno搭載機器人基礎模型GENE-26.5可以理解高層任務目標根據環境變化進行推理和規劃并完成長程、多步驟任務。并且配置與中國舞肌科技聯合研發的仿人靈巧手20個主動可反驅自由度尺寸與人手一一對應能夠以毫米級精度完成復雜操作。Genesis AI還開發了帶觸覺電子皮膚的數據手套實現“人手—手套—機器人手”1∶1∶1映射采集精細動作和接觸信息。Genesis AI把機器人的“大腦、雙手、數據和訓練環境”做成了一套完整的系統。在智元機器人與覓蜂科技聯合舉辦的“智啟具身論壇2026——迎接物理AI智能涌現”論壇上Genesis AI 聯合創始人王尊玄講解了Genesis完整的的系統觀、數據觀、仿真觀和模型觀。王尊玄麻省理工學院計算機科學與人工智能實驗室MIT CSAIL 博士 Genesis AI 聯合創始人曾兼任Liquid AI研究員 。其研究方向聚焦于構建能夠與物理世界交互的智能體。01Genesis的系統觀機器人是系統性問題王尊玄開篇定調機器人是一個系統性問題與LLM不一樣不僅僅是模型的問題。過去幾年大語言模型已經證明了Scaling的價值。隨著數據量、算力和模型規模不斷增加模型能力也在持續提升。盡管機器人不能完全照搬大語言模型的發展路線但其訓練范式仍然值得借鑒。圖LLM與Robotics的訓練階段對比大語言模型的訓練大致可以分為三個階段。第一階段是大規模預訓練。模型利用海量互聯網數據學習語言規律以及對世界的基礎認知。第二階段是對齊。通過監督微調、人類反饋等方式模型逐漸理解用戶的意圖知道人類希望它完成什么任務。第三階段是基于強化學習的后訓練。模型進入代碼、數學等具備明確反饋機制的環境通過大量交互獲得獎勵信號并逐步發展出推理和自我改進能力。Genesis AI希望為機器人構建一條相似的路徑。在預訓練階段機器人可以利用第一人稱視頻和手套采集的人類操作數據學習人類如何與物理世界交互在對齊階段加入少量手套數據和機器人真機數據明確模型需要完成的具體任務在后訓練階段則構建大規模仿真環境讓機器人在其中反復嘗試、獲得反饋并更新策略。但與大語言模型相比機器人系統更加復雜。語言模型主要處理數字世界中的信息而機器人必須面對真實世界中的物體、接觸、摩擦、力、形變和安全約束。模型輸出的也不只是文字而是必須轉化成機械手、機械臂或機器人身體可以執行的動作。因此機器人能力并不只取決于模型架構。數據采集設備是否準確、機器人硬件是否可靠、中間件是否穩定、控制系統是否及時、數據處理是否規范、評測體系是否可信都會影響最終效果。Genesis AI由此提出了一套端到端的系統方法從數據采集、硬件、中間件、控制棧、數據管線、模型訓練一直觀察到評測和真實部署再通過部署結果形成新的數據閉環。團隊首先尋找整條鏈路中最關鍵的痛點再集中資源進行優化。這也意味著算法不一定是所有問題的答案。如果模型難以實現人類動作與機器人動作的遷移除了設計更復雜的表征學習和遷移算法也可以重新設計機械手、傳感器和數據采集設備從源頭降低數據與機器人本體之間的差異。02**Genesis的數據觀**從人類操作中獲取可擴展的靈巧數據數據是機器人實現Scaling首先要解決的問題。目前常見的機器人數據采集方式包括遙操作、UMI等手持設備、第一人稱視頻、互聯網視頻以及機器人真機采集。不同數據各有優勢但很難同時滿足規模、精度、物理信息和部署相關性等要求。遙操作采集的數據與目標機器人最接近但很難大規模擴展。一方面遙操作依賴機器人硬件采集成本較高另一方面操作者很難通過現有設備完整控制高自由度靈巧手。普通夾爪可能只需要控制開合但靈巧手涉及多根手指、多個關節以及復雜接觸遙操作難以達到人手的精細程度。UMI或其他手持式數據采集設備具有更好的擴展性采集成本也通常低于遙操作。但它們會改變人原本的操作方式。在真實工廠或商業場景中如果要求工人先學習如何使用一套特殊設備不僅會增加培訓成本也會影響原有的工作效率部分精細任務甚至無法按照原來的方式完成。第一人稱視頻和互聯網視頻擁有更大的數據規模與任務多樣性。人只需要佩戴相機便可以記錄大量真實操作。但純視頻數據通常缺少準確的動作軌跡、接觸狀態、作用力和觸覺信息與機器人本體之間也存在較大差距。機器人真機數據與部署場景的相關性最高但采集成本同樣最高。真機運行速度有限還會產生設備磨損、安全風險和人工維護成本因此很難獲得互聯網數據級別的規模。Genesis AI的選擇是設計一套盡可能讓人手、數據手套與機器人靈巧手相互一一對應的采集系統。工人戴上手套后仍然可以按照原來的習慣完成工作不需要為了采集數據改變操作方式。系統則在不影響生產流程的前提下被動記錄人手動作、接觸和觸覺等信息。圖Emo的靈巧手這種設計需要滿足兩個要求。第一是非侵入式。數據采集設備不能顯著改變工人的動作習慣商業上也不增加過多培訓和部署成本。只有能夠進入現有工作流程數據采集才能真正擴展到工廠、廚房等真實場景。第二是數據與機器人硬件的對齊。手套、人手和最終部署的機械手需要在動作自由度、關節映射和接觸信息等方面盡可能一致。手套還應具備觸覺傳感能力記錄視覺之外的物理信息。在王尊玄看來判斷一種機器人數據是否有價值不能只看數據量而需要考慮至少五個維度。首先是可擴展性即數據能否以較低成本進行大規模采集其次是多樣性能否覆蓋不同人員、物體、場景和任務第三是動作保真度采集到的動作能否保留人手操作的精細程度第四是物理信息數據是否包含接觸、力、觸覺和動力學狀態第五是部署相關性即數據與最終使用的機器人和真實工作環境是否足夠接近。第一人稱視頻在規模和多樣性方面具有優勢機器人數據在部署相關性方面更強而手套數據試圖在規模、動作精度和物理信息之間取得平衡。圖Genesis的數據組合Genesis AI希望把這些數據按照不同訓練階段進行組合利用第一人稱視頻和手套數據進行預訓練再使用少量機器人數據完成對齊和任務微調。03Genesis的仿真觀從生成訓練數據轉向高保真仿真評測除了數據仿真是Genesis AI系統路線中的另一個核心環節。機器人研發高度依賴評測。模型在哪些任務上失敗、失敗發生在哪個環節直接決定下一輪應該優化什么。但真機評測需要反復布置環境、重置物體、維護設備并組織人工操作不僅效率低也很難做到完全標準化。真實環境還存在覆蓋不足的問題。一個機器人可能在實驗室中完成數十次測試卻無法覆蓋實際部署中的物體差異、環境變化和長尾情況。對于靈巧操作而言物體位置、摩擦系數、材料、接觸角度的細微變化都可能導致不同結果。強化學習對交互量的需求更大。如果把全部探索放在真機上完成訓練速度、安全風險和硬件損耗都會成為限制。機器人不可能像語言模型生成文本一樣低成本地進行數百萬次物理試錯。因此Genesis AI希望把仿真的保真度推到足以服務機器人研發的程度。這里的“高保真”并不只是畫面逼真而是仿真中的物理過程和評測結果能夠對應真實世界。模型在仿真中表現出的能力和缺陷應當能夠反映其在真機上的表現。Genesis AI最開始是做了一個物理引擎目標是生成仿真數據去做模型訓練。但在實踐過程中團隊逐漸把重點轉向模型評測。因為仿真數據最終是否有價值仍然要看訓練后的模型能否在真實世界工作。與其一開始就同時解決數據生成、模型訓練和Sim-to-Real遷移不如先建立可靠的仿真評測體系驗證仿真結果與現實結果的相關性把fidelity做到極致。圖Genesis World 1.0 2026年5月27日發布 高保真評測一旦建立仿真便可以進一步發展為機器人的自我學習環境。機器人模型能夠像Coding Agent在代碼環境中工作一樣與仿真環境持續交互執行動作、獲得評分、更新策略再進入下一輪嘗試。這樣一來機器人學習就有機會從一個受制于真機數量和實驗時間的問題轉化成一個能夠依靠算力擴展的問題。更多算力可以支持更多并行環境、更大規模的實驗以及更豐富的任務覆蓋。但仿真環境不能脫離真實需求。Genesis AI希望從工廠和商業部署中提取任務、設備、物體和操作流程再構建對應的仿真場景。真實部署定義問題仿真環境提供評測與訓練模型能力提升后再回到真實世界驗證由此形成完整閉環。04**Genesis的模型觀**淡化模型架構之爭走向即時部署在模型層面Genesis AI并不過度強調某一種模型架構也不把開源模型本身視為最終目標。相比模型采用什么結構團隊更關注模型接收什么輸入、輸出什么信息以及如何吸收不同來源的數據。機器人訓練面對的是異構數據互聯網視頻提供視覺先驗第一人稱數據記錄人類視角下的操作過程手套數據包含精細動作和觸覺信息機器人數據對應具體本體仿真數據則可以提供大規模交互與獎勵信號。真正困難的是找到一套有效的訓練配方將這些數據放在正確的訓練階段并解決它們在信息形式、動作空間和物理精度上的差異。從資源分配來看Genesis AI把更多精力放在數據采集、硬件對齊、數據轉換和仿真環境上模型架構等純算法研究只占相對較小的一部分。其背后的判斷是機器人基礎模型的競爭力不只來自某個新網絡結構更來自數據、訓練配方和評測體系共同構成的系統能力。Genesis AI最終追求的是“即時部署”。衡量模型價值時不能只看單項任務成功率還要看為了達到這一成功率付出了多少任務專項成本。圖Genesis靈巧操作能力同樣是一個小時的數據獲取方式可能完全不同。一個小時的手套數據可以由工人在正常工作過程中采集而一個小時的機器人專項數據可能需要遙操作、場景重置、設備維護和大量人工配合。因此評估機器人的部署成本既要看數據時長也要看這些數據是如何獲得的。Genesis AI希望通過擴大預訓練數據規模不斷減少新任務對專項數據和微調的依賴。當機器人進入一個新場景時不再需要為每項任務重新投入大量數據和工程資源而是能夠通過零樣本能力或少量數據快速適應。結語演講的最后王尊玄再次讓大家思考這個決定資源分配方式的問題Robotics究竟是一個全局問題還是一個局部問題如果機器人必須從感知、語言、推理到控制全部重新學習那么它需要覆蓋完整智能體系的數據和算力。但另一種可能是機器人問題可以被分層處理。在上層任務理解、常識推理和高層規劃可以借用大語言模型、多模態大模型的能力在底層機器人的重點是身體控制、物理感知、接觸反饋和動作反射在兩者之間則需要建立從高層意圖到物理動作的映射。按照這一思路機器人公司沒有必要重復構建所有通用認知能力而應把有限的數據和算力集中在物理世界特有的問題上如何控制機器人身體如何感知接觸和作用力如何完成高精度靈巧操作以及如何讓這些能力遷移到不同任務和場景。這也是Genesis AI系統路線的最終落點利用第一人稱視頻和手套數據擴大預訓練規模通過機器人數據完成本體對齊通過高保真仿真進行評測與強化學習再把模型部署到工廠、廚房等真實環境中。部署中出現的問題繼續產生新數據反過來推動硬件、模型和仿真迭代最終形成持續運轉的數據飛輪。在機器人模型路線尚未收斂的階段Genesis AI給出的答案并不是死磕某一種模型架構而是把數據、硬件、控制、模型、仿真、評測和部署連接成一個完整系統。機器人真正的Scaling或許不只來自更大的模型更來自這條鏈路中每一個環節的協同演進。圖片資料來源GenesisAI官方智元機器人與覓蜂科技聯合舉辦的“迎接物理AI智能涌現”論壇