AICoE 專案

大語言模型和其他機器學習方法的稀疏矩陣運算

計畫名稱

大語言模型和其他機器學習方法的稀疏矩陣運算

計畫目標

本計劃著重於常見機器學習演算法(如:分群演算法、分類演算法、與大語言模型推理)的關鍵運算最佳化關鍵。 目標為提升模型在實際應用中的底層運算效能與訓練、推理效率。


計畫概述

1. 優化運算效率     
* 探討 K-Means 演算法與深度學習中稀疏和稠密運算時的效能瓶頸。   
* 優化底層運算實踐方法,例如開發高效版本的 Transformer 架構的注意力機制。  

2. 提升模型訓練與推理效率     
* 減少梯度偏差:研究隨機梯度下降 (SGD) 中的偏差並開發去偏差技術。     
* 利用模型稀疏性:識別大型語言模型 (LLM) 推理中的稀疏運算瓶頸並建立模型稀疏化函式庫。