AICoE 專案

以人為本具備可驗證、可控與包容性之新世代多模態AI代理研究

計畫名稱

以人為本具備可驗證、可控與包容性之新世代多模態AI代理研究

計畫目標

在多模態代理平台上進行研究,大幅提升效能、可靠性、可信賴性、可解釋性、風險性、與實用性的問題。包括:
(1) 複雜任務推理能力,開發能處理複雜情境的推理框架;
(2) LLM輸出的控制能力:研究網路內部的解釋性,開發可控的LLM;
(3) 原生影像理解:開發能突破現今”圖像轉文字”限制的原生視覺推理MLLMs,直接視覺思考與邏輯推導,理解圖表、三維空間等;
(4) 語音及情緒能力:開發語音及情緒感知偵測,使AI Agent與使用者人性化互動,也能應用於心理或精神相關疾病;
(5) 構建人機協作機制:設計並試驗創新的人機協作方式,使AI產出具簡要且可解釋性的輸出,防止AI學習錯誤決策過程;
(6) 適當醫療情境驗證:在醫療照護場景中驗證AI代理的實用性、 有效性和安全性。


計畫概述

本計畫旨在發展以人為本、具備可驗證、可控與包容性之新世代多模態AI代理。現今大型語言模型(LLM)仍面臨推理能力、輸出控制、幻覺現象及跨模態因果推論等挑戰。本計畫將針對這些問題,提升AI代理能力,包括:
• 開發可控的多代理人AI系統,解決AI代理對目標理解不清、多代理系統面臨可解釋性下降及訓練不易等核心挑戰, 開發主動釐清需求與Agent訓練機制。 
• 多模態LLM的視覺推理,發展原生視覺推理能力,整合視覺圖像 與文字的思考模式,應用於影片學習、具身智慧及開放詞彙三維點雲分割,以突破現今依賴「圖像轉文字」的限制。
• 具包容性語音代理AI,處理語音多元異質性及對弱勢族群適應性不足的問題, 透過強化情感感知與生成具同理心的回應,並探索其在緊急通報及自閉症社交行為分析等場景的應用。
• 具可驗證性與人機協同之多模態智慧型代理架構,從推理式LLMs的過程中,萃取精簡、精確且個人化的多模態佐證, 以提升高風險領域的可信度,並建立相應的AI評量基準。
• 在電子病歷平台上建立自動化疾病管理的AI代理,開發具時間感知、 多模態整合與推理能力的AI代理,兼顧台灣核心資料群(TWCDI)及FHIR標準的互操作性。整合創新研究, 提升台灣在多模態AI的能見度與技術自足率,推動AI醫療照護應用。