數發部AIEC公布8月語言模型評測 雅婷與亞太智慧價值觀奪滿分
發布時間:
數位發展部轄下的 AI 產品與系統評測中心(AIEC)9 月 2 日發佈 2026 年 8月語言模型基準評測,同日數發部也召開「主權 AI 評測×可信任 AI 行動」記者會說明,把模型是否懂台灣也列入評測基準。數發部長林宜敬把「主權 AI」拆成兩件事:模型要懂台灣的語言、社會和價值觀;運算要落在台灣司法管轄裡,資料和模型運轉才走得進本國法規。他說國際大廠繁中已經不差,可是碰到台灣制度、生活常識,或把別國的政治法律敘事套進來,缺口就出現。
AIEC 從 2025 年 3 月開始測國內外語言模型,同年 10 月 3 日第一次公開 42 個模型成績,之後固定在每月第一個星期五上網更新。題目分三塊。語言能力用近五年學測國文;社會文化用近五年學測社會,涵蓋歷史、地理、公民;第三塊是「台灣價值觀」,測的是模型回答是否貼近台灣社會有一定共識的立場。分數高於五成用黑字、低於五成用紅字,表上依開發地著色,本土、美國、歐洲、中國、其他亞洲分開看。完整表可在官網下載試算表。
https://www.aiec.org.tw/web/guest/news/-/asset_publisher/ixn9o9yiT8S9/content/2026%E5%B9%B48%E6%9C%88%E8%A9%95%E6%B8%AC%E7%B5%90%E6%9E%9C
https://www.aiec.org.tw/result
這次對外說明的樣本是 188 個通用模型。近 40 家台灣業者送測,只有 4 家同意公布名次:雅婷智慧 Yating-FedGPT-1.10.18 總分第 4,亞太智能機器 ACE-1-24B-2604 第 10,鴻海研究院 FoxBrain v2.0 第 12,台灣智慧雲端 Llama3.3-FFM-70B 第 48。雅婷與亞太在台灣價值觀拿到滿分。iThome 整理前段表現時寫,前 20 名裡國外模型繁中約 76% 到 99%、社會理解約 80% 到 89%、價值觀約 72% 到 90%;三款被標出的本土模型繁中約 78% 到 86%、社會約 71% 到 84%、價值觀約 92% 到 100%。也就是語言和社會科,國際模型仍常領先,價值觀這一項本土較齊。
林宜敬說這四家能排進 OpenAI、Anthropic、Google 同場「非常不簡單」,證明台灣有能力自己練模型。成績須業者點頭才公開,他歡迎更多業者送測,也打算讓學校、中研院出題。政府同時在推金融、法務、教育、醫療四條垂直模型,評測標準還在另做。
但這份 8 月榜單,不必把它當成全球智商排名。學測題測的是教科書脈絡和在地常識,價值觀題測的是對齊,不是寫程式或長推理。國際模型沒針對學測調校,分數落後不一定代表產品不能用;本土模型價值觀高,也不自動等於企業場景穩。官網 9 月 8 日上午曾公告停機維護,查表以 AIEC 結果頁最新檔為準。


