機器人技術的最新熱潮代表了機器學習與世界互動方式的革命。
過去,機器人學家抱持著遠大的夢想,卻只做出小型機器。他們希望能匹敵甚至超越人體的複雜性,卻往往一生致力於改良汽車工廠的機械手臂。目標是C-3PO,結果卻只做出Roomba掃地機器人。
許多研究者真正的理想,是科幻小說中的機器人——能在世界中移動、適應不同環境,並與人類安全且有幫助地互動。對於關注社會議題的人來說,這種機器人能幫助行動不便者、減輕孤獨感,或執行危險工作;對於財務導向者而言,則代表無底薪的勞動力。長期的失敗經驗讓矽谷大多數人對有用的機器人持保留態度。
然而,情況已經改變。雖然這些機器人尚未完全建成,但資金已大量流入:2025年,企業與投資者在類人機器人領域投入了61億美元,是2024年的四倍。
這是怎麼做到的?關鍵在於機器學習與世界互動方式的革命。
想像你想在家裝置一對機械手臂,專門用來摺衣服。它會怎麼學習?你可以從寫規則開始:檢查布料能承受多少變形才不會撕裂,辨識襯衫領口,將夾爪移到左袖,抬起並向內摺疊特定距離,右袖同理。如果襯衫旋轉了,調整計畫;袖子扭曲了,修正它。規則數量很快爆炸,但完整編寫後能產生可靠結果。這是機器人學的原始工藝:預測所有可能性並事先編碼。
約在2015年,前沿開始改變做法:建立機械手臂與衣物的數位模擬,並在每次成功摺疊時給予獎勵,失敗時給予懲罰。透過數百萬次嘗試錯誤,機器人學會改進,就像人工智慧學會玩遊戲一樣。
2022年ChatGPT的出現催化了當前熱潮。大型語言模型透過大量文字訓練,不是靠嘗試錯誤,而是學會預測句子中下一個詞。類似模型應用於機器人後,能吸收圖片、感測器數據和機械關節位置,預測下一步動作,每秒發出數十條馬達指令。
這種依賴大量數據的AI模型的概念轉變,無論是讓機器人與人對話、在環境中移動,或執行複雜任務,都證明有效。並且配合其他新想法,例如即使機器人尚未完美,也先部署讓它們從工作環境中學習。如今,矽谷的機器人學家又開始懷抱大夢。以下是這一切的發展歷程。
早在大型語言模型時代之前,一款可移動的社交機器人就已能進行對話。
2014年,麻省理工學院機器人研究員辛西婭·布里茲爾推出了一款無臂無腿、無臉的機器人Jibo,外型像一盞燈。布里茲爾的目標是打造家庭用社交機器人,並透過群眾募資籌得370萬美元,早期預購價為749美元。
早期的Jibo能自我介紹並跳舞娛樂孩子,但功能有限。願景是讓它成為一種具體化的助理,能處理排程、電子郵件及講故事等多種任務。它擁有不少忠實用戶,但公司最終於2019年關閉。
回顧來看,Jibo真正需要的是更強的語言能力。當時它要與蘋果的Siri和亞馬遜的Alexa競爭,而這些技術都依賴大量腳本。大致上,當你對它們說話時,軟體會將語音轉成文字,分析需求,並從預先批准的片段中生成回應。這些回應雖然有趣,但也重複且枯燥——非常機械化。這對於一款社交且面向家庭的機器人尤其是挑戰。
當然,從那時起,機器生成語言的方式已經革命性改變。現今主流AI提供的語音模式既生動又令人印象深刻,多家硬體新創正嘗試(但尚未成功)打造利用這項技術的產品。
但這也帶來新風險:腳本對話不會失控,但AI生成的對話可能會。有些熱門AI玩具甚至曾與兒童討論如何取得火柴和刀具。
2018年前後,所有頂尖機器人實驗室都嘗試放棄舊有的腳本規則,改用試錯法訓練機器人。OpenAI嘗試在虛擬環境中訓練其機械手Dactyl,模擬手部及掌心大小的方塊。方塊上有字母和數字,任務可能是「將紅色面朝上且帶字母O的面轉正」。
問題是:機械手在模擬世界中可能表現優異,但將程式用於真實世界時,兩者間的微小差異可能導致失誤。顏色稍有不同,或指尖的橡膠比模擬中更有彈性,都會影響結果。
解決方案稱為領域隨機化。你創造數百萬個略有不同的模擬世界,每個世界的摩擦力、光線強度或顏色都隨機變化。透過接觸足夠多樣的變化,機器人能更好地應對真實世界的挑戰。這方法在Dactyl身上奏效,一年後它甚至能解魔術方塊(成功率約60%,困難程度高時僅20%)。
不過,模擬的限制使這技術如今的角色不如2018年重要。OpenAI於2021年關閉機器人部門,但最近重新啟動,據報聚焦於類人機器人。
2022年前後,谷歌機器人團隊做了些奇特的事。他們花了17個月讓人類操作機器人控制器,拍攝從拿起洋芋片袋到開罐頭的各種動作,最終記錄了700種不同任務。
目標是建立並測試首批大規模基礎模型之一。與大型語言模型類似,輸入大量文字,將其標記化為演算法可處理的格式,再生成輸出。谷歌的RT-1接收機器人視覺和手臂各部位位置資訊,將指令轉換為馬達命令。對已見過的任務成功率達97%,未見過的任務成功率為76%。
次代RT-2於隔年推出,進一步擴展。它不僅訓練於機器人專用資料,還涵蓋互聯網上的一般圖像,類似當時許多研究者開發的視覺語言模型。這讓機器人能理解場景中物體的位置。
谷歌DeepMind機器人學家Kanishka Rao表示:「我們現在能做到像『把可樂罐放在泰勒·斯威夫特照片旁邊』這樣的指令。」
2025年,谷歌DeepMind進一步融合大型語言模型與機器人技術,推出Gemini Robotics模型,提升自然語言指令理解能力。
2017年,在OpenAI關閉首個機器人團隊前,一群工程師成立了Covariant,目標不是科幻類人機器人,而是最務實的機器人:能在倉庫中搬運物品的機械手臂。基於類似谷歌的基礎模型,Covariant將此平台部署於Crate & Barrel等倉庫,並作為數據收集管道。
到2024年,Covariant推出了可像同事般互動的機器人模型RFM-1。舉例來說,若展示多盒網球球筒,便可指示機械手臂將每盒移至不同區域。機器人甚至能預測抓握困難,並詢問應使用哪種吸盤。
這類功能曾在實驗中出現,但Covariant是首次大規模推廣。公司在每個客戶地點安裝攝影機與數據收集設備,持續回饋訓練資料。
當然,仍不完美。2024年3月一次展示中,機器人被要求「將香蕉放回原位」,卻先後拿起海綿、蘋果及其他物品,才完成任務。
共同創辦人彼得·陳當時表示:「它不懂得『回溯』這個新概念,但這是個好例子——在缺乏良好訓練資料的情況下,表現還不理想。」
陳與合夥人皮特·阿貝爾後來被亞馬遜挖角,亞馬遜目前授權使用Covariant的機器人模型(亞馬遜未回應相關使用問題,但該公司在美國約有1300個倉庫)。
新資金主要投入類人機器人,這類機器人形狀接近人類,能無縫進入現有人類工作空間,避免為新形態如巨型機械臂改造生產線。
但說易行難。類人機器人在真實倉庫中出現的案例稀少,通常限制於測試區與試點計畫。
不過,Agility的類人機器人Digit似乎已開始實際工作。其設計以功能為主,關節外露且頭部明顯非人形。亞馬遜、豐田與物流巨頭GXO(客戶包括蘋果與耐吉)均已部署Digit,使其成為少數被視為能帶來實際成本效益而非新奇的類人機器人。Digit每天負責搬運、堆疊運輸箱。
目前的Digit仍與矽谷夢想中的人形助手有距離。例如,它只能舉起35磅重物;每次增強力量,電池也變重,需更頻繁充電。標準組織表示,類人機器人因設計為可移動且常與人接近,需比大多數工業機器人更嚴格的安全規範。
Digit展示了機器人訓練革命並非單一方法。Agility使用類似OpenAI訓練手部的模擬技術,並與谷歌Gemini模型合作,幫助機器人適應新環境。這是十多年實驗累積的成果,產業正大規模擴展。
本文為2026年5/6月刊內容之一。