球賽開戰(zhàn),機器人極限救球,讓鄭潔看呆了)
中國機器人的AstraTennis時刻中國機器人的AstraTennis時刻來了。8月22日第二屆世界人形機器人運動會開幕中央廣播電視總臺面向全球直播。當(dāng)鏡頭掃過賽場全場的呼吸仿佛都停滯了。球網(wǎng)兩側(cè)一邊是人類網(wǎng)球名將另一邊是一臺人形機器人。這一刻標(biāo)志著中國技術(shù)創(chuàng)新迎來足以載入史冊的具身智能奇點。全球第一場真正意義上的人機網(wǎng)球?qū)?zhàn)正式開打世界首次人機對戰(zhàn)網(wǎng)球賽一上來就是精彩的人機混合網(wǎng)球雙打。令人意外的是銀河星仔的表現(xiàn)非常精彩它步法矯健根據(jù)需要迅速前后移動打得十分流暢。而且星仔和人類搭檔非常默契地形成了一前一后的站位全力應(yīng)戰(zhàn)對面的對手。接下來由網(wǎng)球名將鄭潔和銀河通用機器人開展了全世界第一次人機對戰(zhàn)的網(wǎng)球單打比賽。無論是正拍還是反拍機器人都和人類打得有來有回。然后鄭潔決定上點難度打出一個月亮球。結(jié)果在被對手左右調(diào)動的過程中機器人不小心摔了個四腳到底。出乎意料的是下一秒它居然立刻調(diào)整姿勢站了起來。而面對鄭潔的切削和旋轉(zhuǎn)機器人的判斷居然也很不錯。終于鄭潔知道不能放水了開始左右前后分點調(diào)動機器人出人意料地完成一個精彩的跨步贏得現(xiàn)場喝彩。比賽結(jié)束機器人的表現(xiàn)讓所有人歡呼。整場比賽里屈膝、拋球、轉(zhuǎn)體這些動作全都由人形機器人自己完成。而且發(fā)球時速達到一百多公里留給它的反應(yīng)時間只有零點幾秒它卻幾乎沒有掉鏈子。這臺機器人正是來自銀河通用。十年前AlphaGo贏了李世石。十年后國產(chǎn)機器人與網(wǎng)壇頂尖運動員同臺競技。如果說AlphaGo證明AI能征服數(shù)字世界那么今天銀河通用的國產(chǎn)機器人證明AI能扛住物理世界的極限壓力測試。它第一次從代碼里站了起來在真實的對抗中奔跑、揮拍、博弈甚至摔倒后自己爬起繼續(xù)戰(zhàn)斗。如此精彩的具身智能AstraTennis時刻被全球同時見證中國機器人的AstraTennis時刻為什么這場網(wǎng)球賽能引起全球科技圈的巨大地震因為網(wǎng)球是對具身智能極致的壓力測試。由于反應(yīng)時間只有零點幾秒這項運動同時將機器人的感知、決策、全身運動控制和實時博弈能力逼到了物理極限。而且打網(wǎng)球比下圍棋對AI來說難得多。畢竟AlphaGo面對的是19路網(wǎng)格上361個確定的交叉點對手落子后它有幾十秒甚至幾分鐘來推演下一步。那是數(shù)字世界的博弈解空間雖大但邊界清晰規(guī)則恒定。整個世界是靜態(tài)的、離散的AI對此一覽無余。雖然這道題的解空間比宇宙原子數(shù)還多但對AI而言這也不過是道難度更大的「數(shù)學(xué)題」。但網(wǎng)球場不一樣。球以每小時一百多公里的速度過來落點受旋轉(zhuǎn)、風(fēng)、場地摩擦影響每一拍的物理參數(shù)都不重復(fù)。機器人必須在幾百毫秒內(nèi)完成感知、預(yù)測、決策、全身協(xié)調(diào)同時保持自己不摔倒。對手是打活人會騙機器人還會變節(jié)奏。這就是莫拉維克悖論的現(xiàn)場版。1988年卡內(nèi)基—梅隆大學(xué)移動機器人實驗室主任漢斯·莫拉維克就指出過「讓計算機在智力測驗或下跳棋時表現(xiàn)出成人水平的表現(xiàn)相對容易但要賦予它們一歲兒童在感知和行動方面的技能則困難甚至不可能。」三十多年過去前半句早已兌現(xiàn)但后半句卻很難實現(xiàn)。所以這次網(wǎng)球賽真正的意義要遠(yuǎn)遠(yuǎn)大于「機器人會不會打球」。它問的是這一次AI究竟能不能從數(shù)字世界走出來把感知、決策、運動控制和實時博弈在真實物理環(huán)境里閉環(huán)跑通AI不能止步于思考而是要完成從認(rèn)知決策到全身執(zhí)行的完整閉環(huán)。這一次中國企業(yè)率先交卷了賽場上銀河通用機器人的表現(xiàn)實在令人驚艷。發(fā)球、正手、反手、底線調(diào)動、網(wǎng)前截?fù)暨@些單項能力在比賽里全部出現(xiàn)了而且全都是超常發(fā)揮。而雙打考驗就更大了。機器人和人類隊友同場要實時判斷誰去接這個球、誰補位動態(tài)調(diào)整打法和。所以它要理解的不只是球還有隊友下一步想干什么。高速攻防里還出現(xiàn)了極限救球的場面。摔倒之后機器人自己站起來繼續(xù)打。很多人第一反應(yīng)是這些單項動作之前機器人不是做到了嗎投籃、踢球、跑百米過去兩年人形機器人的視頻里似乎什么都有。但其中最大的差別在于網(wǎng)球是兩個玩家在對抗。跑步的環(huán)境是確定的網(wǎng)球的每一拍都是對手臨時出的新題。跑步可以一個動作練一萬遍網(wǎng)球沒有兩個完全一樣的來球。能在對抗中站住才是真正的智能。大腦和小腦第一次裝在同一個模型里背后支撐這一切的是銀河通用自研的具身智能大模型「銀河星腦」AstraBrain。它最大的亮點之一就在于架構(gòu)選擇。過去行業(yè)里的主流做法是分層一個「大腦」模型負(fù)責(zé)理解任務(wù)、做高層決策一個「小腦」模塊負(fù)責(zé)實時運動控制兩者之間用接口傳遞指令。這種架構(gòu)的弊端也很直接大腦想得再清楚傳到小腦已經(jīng)慢了半拍小腦動作再標(biāo)準(zhǔn)不知道大腦為什么要它這么動。更隱蔽的問題是信息斷層。大腦下指令的時候不知道此刻自己的重心壓在哪條腿上、右臂還有多少發(fā)力余量小腦執(zhí)行動作的時候不知道這一拍是想調(diào)動對手還是想直接得分。兩邊各自最優(yōu)合起來卻是一個「想得到做不到」或者「做得到想不到」的系統(tǒng)。在打網(wǎng)球這種任務(wù)上稍微慢半拍結(jié)果就是輸球。銀河星腦的做法是把大腦層任務(wù)理解與戰(zhàn)術(shù)決策、小腦層高動態(tài)全身運動控制和神經(jīng)控制集成在同一個模型里。按銀河通用的說法這是全球首個模型能同時負(fù)責(zé)「想清楚」和「做出來」中間不再有信息損耗。從網(wǎng)球這個任務(wù)倒推這可能是唯一的解法。戰(zhàn)術(shù)決策離不開對自己身體極限的實時感知運動控制也離不開對戰(zhàn)術(shù)意圖的理解兩者本來就不該分家。從不完美的人類數(shù)據(jù)里學(xué)在虛擬球場里對打一千萬次架構(gòu)之外的另一個問題是這個模型怎么練出來的機器人領(lǐng)域的一個傳統(tǒng)難題就是——沒有數(shù)據(jù)。語言模型可以吃掉整個互聯(lián)網(wǎng)的文本機器人沒有這樣的互聯(lián)網(wǎng)。真機采一小時動作數(shù)據(jù)要一小時還要人盯著還會摔壞硬件。這也是為什么過去幾年具身智能的進展總是慢于大家的預(yù)期。這背后離不開銀河通用核心技術(shù)平臺「銀河星坊」 的支撐。接下來分兩個步驟。第一步是從「不完美人類數(shù)據(jù)」里學(xué)。人類打網(wǎng)球的動作數(shù)據(jù)可以采動作捕捉、視頻、穿戴傳感器都行。但人類的動作本身不標(biāo)準(zhǔn)業(yè)余選手的確很業(yè)余有多余動作。而職業(yè)選手的動作最大化個人運動素質(zhì)別人做不來而且每個人的身高臂展關(guān)節(jié)角度都跟機器人對不上。傳統(tǒng)模仿學(xué)習(xí)要求示范數(shù)據(jù)干凈、對齊、高質(zhì)量這種要求在人類數(shù)據(jù)上幾乎不可能滿足。銀河星坊數(shù)據(jù)平臺要做的就是從這堆帶噪聲、不對齊、良莠不齊的示范里提煉出有用的先驗什么時候該啟動揮拍的大致節(jié)奏身體重心怎么轉(zhuǎn)移真正學(xué)會其中的運動規(guī)律。這一步的價值在于冷啟動。機器人不用從隨機亂動開始摸索它一上來就大概知道「打網(wǎng)球長什么樣」。第二部就是進虛擬網(wǎng)球世界。在仿真環(huán)境里多個智能體互相對打。不是一個機器人對著發(fā)球機練而是若干個策略各自演化、互為對手。一方學(xué)會了壓邊線另一方就被迫學(xué)會橫向大范圍移動一方學(xué)會了放小球另一方就被迫學(xué)會快速上網(wǎng)。在這海量的虛擬博弈中奇跡發(fā)生了——「技能涌現(xiàn)」。工程師沒有教過它怎么滑步救球但在無數(shù)次沒接到球的失敗后模型自己「領(lǐng)悟」了極限伸展的姿態(tài)。工程師沒有寫下倒地后起身的硬代碼但在虛擬世界摔了千萬次后模型自己「學(xué)會」了如何調(diào)動全身電機重新站立。技能無需手工設(shè)計出在對抗壓力下AI學(xué)會自學(xué)。最后當(dāng)這些在虛擬世界中練就神功的「靈魂」被無損遷移到物理世界的真實機器人軀體中時一個網(wǎng)球大師就此誕生放在整個機器學(xué)習(xí)的譜系里這條路走在兩個極端中間。純模仿學(xué)習(xí)的天花板是示范者的水平人類教練教不出超過自己的學(xué)生而且人類示范里根本沒有「摔倒后怎么爬起來繼續(xù)打」這種數(shù)據(jù)。純強化學(xué)習(xí)從零開始探索在網(wǎng)球這種動作空間巨大、獎勵稀疏的任務(wù)上搜索成本高到不現(xiàn)實而且容易學(xué)出一些人類完全看不懂的怪異動作能贏球但不像打球。先用人類先驗打底再用自主進化拔高。這本身不算新AlphaGo當(dāng)年也是先學(xué)人類棋譜再自我對弈。新的地方在于十年前這套方法在棋盤上跑通十年后它第一次在需要身體的任務(wù)上跑通。某種意義上這正是AstraTennis與AlphaGo之間最迷人的技術(shù)呼應(yīng)。AlphaGo的時代智能在棋盤上思考而這一次智能開始進入物理世界。這絕不僅是一場網(wǎng)球賽。這個AstraTennis時刻證明在碳基與硅基共生的新紀(jì)元里中國力量開始創(chuàng)造更多奇跡。原文鏈接剛剛?cè)蚴讏鋈藱C網(wǎng)球賽開戰(zhàn)機器人極限救球讓鄭潔看呆了-36氪