跳到主要內容
2.3 生成式 AI 導入評估
114-4 科目 45

下列哪一個資料集專門設計用於測試大型語言模型在多領域、多任務語言理解中,涵蓋人文、科學與社會科學等領域,而非專門用於數學推理或中文專業知識?

請選擇一個答案

答案 A

核心概念

主流基準測試各有守備範圍,記名字就記得住考點。 MMLU 是通識大考,GSM8K 跟 MATH 是數學小考,C-Eval 是中文考卷。 MMLU(Massive Multitask Language Understanding)涵蓋 57 個學科,橫跨人文、社會科學、STEM 與專業領域。它是衡量模型通用知識廣度的代表性基準。GSM8K 是小學程度的數學應用題,測多步驟算術推理。MATH 是競賽級數學題,難度更高。C-Eval 則是中文語境的綜合評測,聚焦中文與中國相關的專業知識。
答題技巧

快速判斷技巧:從資料集的名字拆解就好。 ・MMLU 有 Multitask,多任務 ・MATH 與 GSM8K 一看就是數學 ・C-Eval 的 C 代表 Chinese 題目要的是多領域、非數學、非中文,答案自動浮現。

易錯陷阱:這是把答案寫在題幹裡的送分題。 「多領域、多任務」直接對應 Multitask Language Understanding。 別漏讀後半句的兩個排除條件,那是用來刪掉另外三個選項的。