AICoE 專案

基於多模態推理的具身智能:整合空間時序理解、對齊、自我反思與具身推理

計畫名稱

基於多模態推理的具身智能:整合空間時序理解、對齊、自我反思與具身推理

計畫目標

本計畫旨在打造具備高階推理、自我修正與人類級學習能力的通用型機器人,回應智慧製造、服務型機器人等應用場域對智能、自主性與適應力的高度需求。針對當 前視覺語言模型(VLMs)在影片理解與決策應用中所面臨的幻覺生成、推理能力 不足與遷移困難等問題,本計畫提出一套循序漸進、整合式的四年研究藍圖。
在第 一年,我們開發「自我增強式對比對齊架構(SANTA)」,針對 VLM 在影片任務 中常見的物體與動作幻覺進行抑制。此架構透過幻覺偵測與對比式訓練機制,使模型能對齊真實的空間與時間特徵,大幅提升語意生成的精確性與真實感知能力。第二年,進一步導入「自我強化機制」,模擬人類在錯誤中學習的過程,讓機器人能透過分析互動影片自動識別任務瓶頸與關鍵行為,並回饋至策略模型中進行自我修正與優化,有效降低人工監督需求,提升任務穩健性與適應性。第三年,我們提出「ThinkAct」框架,賦予多模態模型「先思考、再行動」的能力。結合結構化推理與強化學習,ThinkAct 可利用視覺與動作資料進行長期策略規劃,並將中介推理壓縮為潛在軌跡,提升控制模型在新情境下的泛化與效率。第四年,著重於「學習推理(Learning to Reason)」能力,開發一套能從人類示範影片中學習高階任務 邏輯並內化為可遷移策略的VLA框架。此階段將大幅提升機器人面對複雜與未知情境的規劃、拆解與自主決策能力,邁向真正具備理解與行動智慧的通用機器人。
整體而言,本計畫從模型基礎強化出發,逐步進化至策略學習與具身推理,不僅回應 AI 與機器人整合之國際趨勢,也可望提升台灣於泛用型智慧機器人領域的研究深度與全球影響力。


計畫概述

在人工智慧與機器人技術高速發展的浪潮下,打造能夠自主理解、多模態推理、並靈活適應複雜真實世界任務的通用機器人已成為全球學術與產業界的共同目標,如 Google 提出的 Gemini Robotics 和 NVIDIA 的 GR00T-N1 等等。近年來,隨著視覺語言模型(VLMs)持續突破,使得部署在機器人上的 VLMs 已逐漸具備語意 理解、視覺辨識與初步文字推理能力。然而,現有模型在空間與時間感知理解、長期任務規劃與自我修正、甚至直接從人類影片學習技能等層面,仍然存在顯著瓶頸 。例如,容易產生不論是空間或時序資料無中生有的(hallucination)描述、無法精確結合視覺與動作資訊、及面對新場景時缺乏自我學習與推理能力,這些問題在智慧製造與服務型機器人等關鍵應用場域尤為急迫。 
有鑑於此,本計畫規劃以四年為期,從增強型視覺語言模型(VLMs)為起點,逐步推進至真正具備推理、自我修正與人類級技能學習能力的通用機器人:第一年專 注於利用自我增強式對比學習,解決視覺語言多模態模型的空間-時間幻覺挑戰 ,強化模型的真實感知;第二年延伸前述成果,將強化後的 VLM 應用於機器人決策推理,並透過自我改進策略降低任務執行錯誤;第三年則導入結構化推理與強化學 習,使機器人能夠結合視覺-語言-動作推理並具備自我修正(self-correction)能力 ;第四年進一步突破,發展具身推理框架,跳拓對世界模型的仰賴,使模型可從專家示範影片中理解並推理高階任務邏輯,進而轉移至機器人本身策略學習。此分期規劃不僅回應國際最新趨勢,更能持續推進台灣在泛用型智能機器人領域的研究與 實踐前沿。