圖/人形機器人的知識主要來自影片模仿、虛擬環境訓練、具身智能大模型及群體經驗共享;本圖為AI生成示意圖。
人形機器人如何取得思考知識,已成為人工智慧與機器人產業發展的重要議題。現代人形機器人的能力並非單純來自寫死的程式碼,而是建立在具身智能架構上,透過觀看人類示範、虛擬環境試錯、大型人工智慧模型推理,以及多台機器人之間的經驗共享,逐步學會理解真實世界並完成任務。
其中一項重要學習方式,是讓機器人透過影片與人類操作示範進行模仿。研究人員可利用攝影機、穿戴式感測器或遠端操控設備,記錄人類拿取物品、摺衣服、開門及使用工具時的手勢軌跡、視角、速度與力道,再將資料轉化為機器人可學習的動作範例。搭配視覺語言模型後,機器人不只是複製動作,也能逐步理解畫面中的物品、動作目的及彼此關係。
另一項核心技術則是利用數位雙生與物理模擬環境進行大量試錯。由於實體機器人若在現實環境中反覆跌倒、碰撞或操作失敗,不僅成本高,也可能造成設備損壞,因此研究團隊通常先讓機器人在虛擬世界中接受數百萬次訓練。透過強化學習,機器人可以反覆嘗試走路、保持平衡、跨越障礙或抓取物品,再將訓練成果移植至實體設備,這項過程通常稱為從模擬到現實的技術遷移。
大型語言模型則扮演人形機器人高階思考與任務規劃的重要角色。當人類下達「把桌面清乾淨」或「我打翻咖啡了」等抽象指令時,機器人無法直接將句子轉換為馬達動作,必須先理解語意並拆解任務。大型語言模型可以協助判斷下一步應尋找抹布、拿取清潔工具、移動至桌邊、擦拭液體,再處理使用過的抹布,讓抽象語言轉化為一連串可以執行的步驟。
大型語言模型也為機器人提供物理世界的常識,例如玻璃杯容易破裂、雞蛋不能用力抓取、牛奶通常放在冰箱、衣服應放入衣櫃。這些知識可協助機器人在面對未曾設定過的情境時,進行初步推理與判斷,而不是只能執行單一固定指令。
不過,單純的文字型大型語言模型無法直接看見環境,也不能自行控制機器人的關節,因此目前人形機器人的發展逐漸轉向視覺語言模型與視覺語言動作模型。視覺語言模型可結合攝影機畫面與文字指令,辨識環境中的人、物品及空間關係;視覺語言動作模型則進一步把文字指令、即時影像與機器人動作整合在同一套系統中,使機器人能根據看到的畫面直接產生抓取、移動或操作指令。
在實際架構上,人形機器人通常具有類似「大腦」與「小腦」的分工。大腦負責理解人類語言、辨識環境、運用常識、規劃任務及決定下一步行動;小腦則負責馬達扭力、關節角度、步態平衡、避障與防跌倒等即時控制。大型語言模型主要提供高階邏輯與知識,但不會直接決定每一個關節應旋轉多少角度,低階動作仍需由控制演算法、感測器及端側晶片高速處理。
隨著人形機器人逐步進入工廠、物流、家庭與服務場域,群體經驗共享也可能成為重要訓練方式。當一台機器人在某個工作環境中成功學會抓取新型零件或處理特殊物品,相關資料可上傳至雲端,經過整理與重新訓練後,再同步至其他同型機器人。這種機隊學習模式,可降低每一台機器人都要從頭訓練的成本,但實際導入時仍須處理資料品質、設備差異、資安與隱私等問題。
整體而言,大型語言模型確實為人形機器人提供重要資訊,但它更像是機器人的百科全書、語言理解與邏輯規劃中心。真正讓機器人能在現實世界完成任務的,是大型模型、視覺感知、動作控制、模擬訓練及人類示範資料的共同整合。未來人形機器人能否走向通用化,關鍵也將取決於這些系統能否在不同環境中安全、穩定地理解與執行任務。
回覆
刪除回覆投票表決
最新消息
獲取最新新聞
訂閱我們的新聞,以獲取最新新聞和獨家更新。
最近評論
-
由 Anonymous
GDiYulZhRqeEhasqFlU
-
由 jOKUtWhOjxBwzsJmXtWhnVXK
XfGgIUOHXhFuxECXvkSlT
-
由 林岳維
好有趣的體驗!
蘇硯川

