一句話說明
AI Benchmark 是用標準化的題目和評分方式,衡量 AI 模型在特定能力上的表現,讓不同模型之間可以做比較。
為什麼需要 AI 評測
當市場上有幾十個 AI 模型可以選,每家都說自己表現最好,你要怎麼判斷?AI 評測提供了一套相對客觀的比較方式。就像大學入學考試不能代表一個人的全部能力,但至少提供了一個可比較的基準。
AI 評測的存在解決了三個問題。第一,讓研究者有共同的標準來衡量進步——去年的模型在 MMLU 上拿 70 分,今年的拿 90 分,這個進步是可量化的。第二,讓使用者可以在不同模型之間做初步篩選——如果你需要寫程式的模型,先看 HumanEval 分數,可以快速縮小選擇範圍。第三,讓模型開發者知道自己的模型在哪些方面還有改善空間。
不過,飛飛要先提醒:Benchmark 分數高不代表在你的實際應用場景中表現也好。選模型要看你的具體需求,不是看誰在排行榜上名次高。
常見的 AI 評測項目
MMLU(Massive Multitask Language Understanding)
測試 AI 的知識廣度。涵蓋 57 個學科,從高中數學到專業法律,總共約 15,000 道選擇題。MMLU 分數高代表模型「知道很多事情」,但不代表它能把這些知識正確地應用在實際問題上。
MMLU 的出題方式是四選一的選擇題,模型只需要輸出 A/B/C/D 其中一個字母。這種格式的問題在於:一個模型可能因為理解語言的模式而「猜對」答案,而不是真的理解題目的概念。
目前主流模型的 MMLU 分數都已經超過 85%,差距越來越小,這個指標的鑑別度正在下降。MMLU-Pro 是升級版,題目更難、選項更多(10 選 1),更能區分模型之間的差異。MMLU-Pro 還加入了需要多步推理的題目,降低了靠猜測答對的機率。
HumanEval
測試 AI 寫程式的能力。包含 164 道 Python 程式題,每題給函式簽名和說明,AI 要寫出能通過測試案例的程式碼。HumanEval 分數高代表模型在「根據規格寫短函式」這件事上表現好。
HumanEval 的評分方式叫 pass@k:讓模型生成 k 個答案,只要其中一個通過所有測試就算對。pass@1 最嚴格(只生成一個答案就要對),pass@10 最寬鬆(十次機會裡至少對一次)。看評測結果時要注意是 pass@1 還是 pass@10,差距可能很大。
限制是:HumanEval 只測 Python,題目偏短(通常 10-20 行),跟實際開發中要處理的跨檔案、多模組、既有程式碼修改差距很大。SWE-bench 是更接近真實軟體工程場景的評測,它讓 AI 解決 GitHub 上的真實 issue——讀懂問題描述、找到相關程式碼、做出正確修改、通過測試。SWE-bench Verified 是經過人工確認的子集,品質更高。
MT-Bench
測試 AI 的多輪對話能力。包含 80 組兩輪對話題目,涵蓋寫作、推理、數學、程式碼等 8 個類別。特別之處在於它測的是「第二輪追問」的品質,例如先請 AI 寫一首詩,再要求它改成特定風格。
這很重要,因為很多模型在第一輪回答得很好,但第二輪追問時會「忘記」第一輪的上下文、無法正確修改、或者直接重寫而不是在原有基礎上調整。MT-Bench 測的就是這種追問和修改的能力。
評分方式是用另一個 AI(通常是 GPT-4)來打分,滿分 10 分。這代表 MT-Bench 的評分本身就受限於評審模型的判斷力——如果評審模型對某種回答風格有偏好,分數就會偏向那種風格的模型。
Chatbot Arena
由 LMSYS 組織營運的群眾評測平台。真實使用者同時跟兩個匿名模型對話,然後投票選出比較好的那個。累積數十萬筆投票後,用 Elo 評分系統(類似棋類排名)計算出各模型的排名。
Chatbot Arena 的運作方式:你進入網站後,打一個問題,系統會同時把問題送給兩個你不知道名字的模型。你看到兩個回答後,選出你覺得比較好的那個,或者選平手。投票後才會揭曉模型名稱。
Chatbot Arena 的優勢是最接近真實使用者的偏好,因為投票者不知道模型名稱,避免了品牌偏見。但它也有偏差:使用者傾向選擇回答較長、語氣較有自信的模型,即使較短的回答可能更正確。另外,使用者群體以英文為主的科技工作者居多,不一定代表所有使用者的偏好。
ARC(AI2 Reasoning Challenge)
測試 AI 的推理能力,使用美國中小學的自然科學題目。分為 Easy 和 Challenge 兩個子集,Challenge 集的題目需要多步推理才能解答——不能只靠關鍵字匹配,需要理解概念之間的關係。
ARC 的價值在於它測的是「理解」而不是「記憶」。例如一道題問「為什麼冰塊放在桌上會留下水漬?」,模型需要理解固態到液態的相變、溫度差異造成的融化,然後組合這些知識來回答。
GPQA(Graduate-Level Google-Proof Questions & Answers)
測試 AI 在專家級問題上的表現。題目由各領域的博士生設計,難到連其他領域的專家也只能答對 30-40%。特點是「防 Google」——不能靠搜尋就找到答案,需要深入的專業知識和推理。
GPQA 對評估模型在醫學、法律、科學等專業領域的可靠度特別有參考價值。
為什麼 Benchmark 會被「刷」
AI 評測存在一個根本問題:當大家都追求某個 Benchmark 的高分,這個 Benchmark 就會失去意義。這個現象在測量領域有個名字叫 Goodhart's Law(古德哈特定律):當一個指標變成目標,它就不再是好指標。
常見的刷分方式包括:
針對測試集優化。如果訓練資料中「不小心」包含了測試題目(稱為 data contamination 或資料污染),分數自然會虛高。有研究發現某些模型在 MMLU 上的高分,部分原因是訓練資料中已經包含了類似的題目。驗證方法之一是看模型在 MMLU 的「原始版」和「改寫版」(把同樣的問題換種方式問)上的分數差距——如果差距很大,就有資料污染的嫌疑。
只在評測的領域上加強。模型可以在特定題型上密集訓練,拉高 Benchmark 分數,但在未被測試的領域表現不變甚至退步。這就像一個學生只練考古題而不學基礎概念,考試分數高但遇到沒見過的題型就不會。
調整輸出格式。有些評測對輸出格式很敏感,光是調整回答的格式(例如在選擇題中先輸出答案字母)就能提升幾個百分點。這不是作弊,但它讓分數反映的是「格式適配度」而非「理解能力」。
提交選擇性結果。有些公司可能測試了多個版本的模型,只公布分數最高的那個版本的結果。你看到的 92% 可能是五次嘗試中的最好成績,不是穩定的表現水準。
如何正確解讀 Benchmark
飛飛建議用以下方式看 AI 評測結果:
看趨勢而非絕對數字。MMLU 從 70% 進步到 90% 有意義,但從 88% 到 90% 的差距在實際使用中幾乎感受不到。當所有頂尖模型的分數都擠在 85-92% 的範圍時,這個 Benchmark 的鑑別力已經很低了。
看多個指標的組合。單一 Benchmark 高分不代表什麼,要看模型在你關心的多個維度上的表現是否一致。例如你需要寫程式的模型,就要同時看 HumanEval、SWE-bench 和 Chatbot Arena 的程式碼類別排名。如果一個模型在 HumanEval 分數很高但 SWE-bench 排名很低,代表它會寫短函式但處理不了真實專案的問題。
自己測。最準確的評測是用你自己的真實使用場景來測試。準備 20-30 個你實際會問的問題,用同樣的 prompt 分別丟給不同模型,比較結果。這比任何公開 Benchmark 都有參考價值。
注意測試日期。AI 模型更新頻繁,三個月前的評測結果可能已經不準確。看 Benchmark 時要確認測試的是哪個版本的模型。
區分公司自測和獨立評測。模型公司在發表新模型時會附上 Benchmark 分數,但這些數字是公司自己測的。獨立組織(LMSYS、Stanford HELM)的評測結果通常更可靠,因為測試條件對所有模型一致。
注意評測的局限性。Benchmark 通常測的是模型的「天花板」——在最佳條件下能達到的最好表現。但你日常使用時不會每次都寫出最好的 prompt,模型的實際表現會低於 Benchmark 呈現的水準。
正在發展中的評測方式
傳統的靜態 Benchmark(固定的題目集)正在被幾種新方式補充:
動態評測。每次出新題,避免資料污染。例如 LiveBench 每月更新題目,模型不可能事先接觸到測試內容。
任務型評測。不是答題而是完成真實任務。WebArena 讓 AI 在模擬的網站環境中完成購物、搜尋等任務;SWE-bench 讓 AI 修復真實的軟體 bug。
長文本評測。隨著模型支援的上下文長度越來越長(從 4K 到 128K 甚至 1M token),需要專門的評測來測試模型在長文本中找到關鍵資訊、保持一致性的能力。RULER 和 Needle-in-a-Haystack 就是這類評測。
多模態評測。隨著模型開始支援圖片、影片、音訊輸入,需要測試跨模態理解的能力。MMMU 測試模型理解圖表和圖片的能力,不只是文字。
安全與限制
Benchmark 不測安全性。一個 MMLU 分數很高的模型,不代表它不會洩漏機密資訊、產生有害內容、或被 prompt injection 攻擊。安全性需要另外的紅隊測試和安全評估來檢驗。Anthropic 的 RSP(Responsible Scaling Policy)和 OpenAI 的 Safety Evaluations 是針對安全性的評估框架,跟能力 Benchmark 是不同的維度。
排行榜可能影響採購決策。企業在選擇 AI 工具時,容易被 Benchmark 排名誤導。飛飛在企業培訓中常強調:先定義你的需求場景,再看哪個模型在那個場景下表現最好,而非直接選排行榜第一名。
評測結果不等於生產環境表現。Benchmark 通常在理想條件下測試(充足的 prompt、足夠的 token、不限時間),跟實際部署時的延遲、成本、併發處理能力無關。一個 Benchmark 分數稍低但回應速度快兩倍的模型,在需要即時回應的場景中可能是更好的選擇。
繁體中文的評測資源不足。主流 Benchmark 幾乎都是英文。模型在英文 MMLU 上拿 90 分,在繁體中文版本上可能只有 75 分。台灣使用者特別需要注意這個落差,用自己的繁體中文 prompt 做測試,不能完全依賴英文 Benchmark 的結果。
知識檢測
讀完文章後,測試一下你對這個主題的理解。
常見問題
AI Benchmark 分數高就代表模型好嗎?
不一定。Benchmark 只測量特定面向的能力。分數高代表模型在那個特定的測試上表現好,但你的使用場景可能跟測試內容差異很大。一個 MMLU 90 分的模型可能在繁體中文法律問答上表現不如 MMLU 85 分的模型,因為後者在中文法律語料上訓練更充分。建議用自己的真實需求來做測試。
為什麼不同的排行榜上,模型排名不一樣?
因為每個排行榜測量的能力不同。一個模型可能在知識問答(MMLU)上很強,但在程式碼(HumanEval)上排名較低。這代表模型各有擅長,選擇時要看你最需要哪種能力。就像一個人可能數學很好但英文普通,用不同科目的考試來排名自然會得到不同結果。
Chatbot Arena 的排名可信嗎?
Chatbot Arena 是目前最接近真實使用者偏好的評測,累積了數百萬筆投票,統計效力很高。但它偏向一般對話能力,不一定反映專業場景的表現。而且使用者有偏好長回答的傾向,可能不利於回答精簡但正確的模型。如果你的用途很專業(例如醫學問答或法律分析),Chatbot Arena 的排名參考價值有限。
企業選 AI 工具應該看哪些 Benchmark?
取決於用途。程式開發看 HumanEval 和 SWE-bench,文字處理看 MT-Bench 和 Chatbot Arena,知識查詢看 MMLU。但最重要的是用你自己的實際工作內容做測試——準備 20-30 個真實問題,用相同的 prompt 測試不同模型,記錄回答品質、回應速度和成本。Benchmark 只是初步篩選的參考,不是最終決策依據。
台灣使用者需要特別注意什麼?
主流 Benchmark 大多是英文測試,中文(特別是繁體中文)的表現可能跟英文分數有落差。如果你的使用場景以繁體中文為主,務必用中文 prompt 實際測試,不能只看英文 Benchmark 的結果。另外注意台灣特有的用語和情境——模型可能不理解「健保卡」、「統一編號」、「里長」這些概念,這些不會出現在任何英文 Benchmark 中。