簡短回答。 通過從自身工作中構建一個小型評估集,並以盲評的方式對其進行評分,因為公開的排行榜衡量的是在幾乎肯定不屬於你自己的任務上的通用能力。選取五十到一百個具有代表性的樣本——重點覆蓋難度大和不常見的案例——由兩名評審員依據書面評分標準進行評分,且隱藏模型身份,這樣比任何排名都能更可靠地區分候選者。然後確定真正制約生產過程的標準:輸出權限、數據處理、延遲、在實際使用量下的成本、語言覆蓋範圍以及版本穩定性。大多數選擇都是由這些標準之一決定的,而非輸出質量,後者在真正有競爭力的候選者之間才顯得更為明顯,而供應商材料往往誇大其詞。
這是一個採購問題,而不是測試問題。如何在部署前評估一個系統——閾值、控制點、上線後應測量什麼——在部署前的AI評估中有專門說明。以下內容更為具體:如何選擇在生產流程中運行的生成式模型,以及如何在事後解釋這一選擇的依據。
公開基準測試能告訴你什麼,又不能告訴你什麼?
排行榜回答了一個真實的問題——這些系統在一組標準任務上的表現如何——而這通常並不是生產團隊真正關心的問題。這一差距有多個具體原因,每個原因都提示了不同的修正方法。
| 侷限性 | 它對你的決策會產生什麼影響 |
|---|---|
| 任務不匹配 | 基準測試衡量推理、知識和通用指令遵循能力;而實際生產任務則非常狹窄——請用我們一貫的語氣重新表述,準確描述該產品,並生成一張符合此參考的圖像 |
| 汙染 | 基準測試項目公開傳播,可能出現在訓練數據中,導致分數虛高,且這種優勢無法遷移到實際場景 |
| 聚合 | 單一分數是各子任務的平均值,因此模型在整體上可能領先,但在你真正需要的那個關鍵任務上卻明顯表現更差 |
| 語言覆蓋不足 | 大多數頭部基準測試僅限英文,且不同語言之間的排名確實會發生實質性變化 |
| 沒有實際操作標準 | 不提供排行榜分數的輸出權限、數據保留、區域可用性或版本穩定性 |
語言維度通常是被默認假設而非被驗證的。MMLU-ProX(arXiv預印本2503.10497 / EMNLP 2025)在29種語言中提出相同題目,並報告了在36個評估模型中高資源語言與低資源語言之間高達24.3分的差距。一個在英文中獲勝的模型,可能在你的第三個市場中表現糟糕。
公共基準測試的建設性用途是作為初步篩選工具:它們能夠可靠地區分出真正有實力的候選者與不靠譜的候選者。像斯坦福CRFM的HELM這樣的綜合框架,比單一數值排名在這一階段更有用,因為它們報告了多種場景和指標,而非簡化為一個數值。在真正有實力的候選者之間進行選擇,是你的工作內容。
你是如何從自己的工作中構建評估集的?
這大約需要一個人一週的時間,且在每次模型變更時都可以重複執行——正是這種可重複性,使其值得建立而非臨時應付。
1. 從實際工作中收集項目內容,重點偏向困難案例。 從真實項目需求說明中抽取五十到一百個輸入項。刻意增加困難案例的比例:如不常見產品、敏感話題、格式最差的原始材料、最小的市場。一個典型的輸入集將顯示所有真正有實力的候選者表現良好,卻無法為你提供任何有效信息。
2. 在查看任何輸出之前編寫評分標準。 任務中關鍵的維度——準確性、語氣、指令遵循性、格式合規性、品牌契合度——配以嚴重程度等級和具體示例。在查看輸出之後撰寫的評分標準,僅描述了你偶然看到的第一個模型的表現。
3. 使用完全相同的輸入集對所有候選模型進行測試。 輸入內容相同,參數在可比情況下也保持一致,嘗試次數也相同。當某個模型需要不同的提示才能表現良好時,這實際上揭示了集成成本的真實情況。應記錄這一發現,而不是悄悄地對某個候選模型進行更嚴格的調優。
4. 評分時保持盲態。 去除模型身份標識,隨機化順序,並由兩名評審員獨立評分。未盲態評分反映的是對品牌的預期;盲態評分則反映的是輸出本身。
5. 在信任結果之前,先檢查評審員的一致性。 如果兩名評審員存在顯著分歧,說明評分標準存在模糊性,此時比較尚無意義。需修正評分標準並重新評分。Landis 和 Koch(Biometrics, 1977)所定義的偶然校正一致性是報告此類情況的標準方法。
6. 在所有運營語言中進行評估。 不是將英文集進行翻譯——而是每種目標語言都獨立創作內容。不同語言間的排序會發生變化,僅基於英文表現做出的選擇,可能對大多數市場而言都是錯誤的。
7. 測試失敗模式,而不僅僅是成功案例。 每個候選模型在超出範圍請求、模糊需求說明以及旨在引發自信錯誤回答的輸入下,會表現出怎樣的行為?一個失敗得明顯清晰的模型,遠比一個失敗得看似合理的模型更容易操作。
8. 凍結測試集,並在每次版本更新後重新運行。 這才是將‘模型本月感覺不同’轉化為可測量差異的關鍵。確保該測試集不用於任何訓練或微調,以保持其作為純淨參考集的完整性。
區分度 = 領先候選方案的平均評分 − 第二名候選方案的平均評分
如果這種差異小於兩名評審員之間的分歧,那麼候選模型在質量上並無明顯區別,該決策應依據下文所述的運營標準進行。
哪些標準實際上決定了選擇?
一旦短名單在輸出質量上處於一個合理範圍內——這比供應商對比所暗示的情況更為常見——決策就基於運營層面作出。
| 標準 | 需要提出的問題 | 它如何決定具體案例 |
|---|---|---|
| 輸出權利 | 我們對輸出可以做什麼,以及提供商是否主張任何權利? | 如果許可不允許可用,那麼質量優勢將毫無價值 |
| 數據處理 | 輸入是否被保留、用於訓練或被記錄?在何處,以及保留多長時間? | 客戶保密義務通常會排除原本表現優異的候選方案 |
| 區域可用性與本地化部署 | 我們是否能夠從我們運營的區域調用模型,並在這些區域存儲數據? | 在某個市場中模型不可用,則該模型不適用於該市場 |
| 延遲與吞吐量 | 在我們的併發處理能力下,單條請求的延遲以及實際的速率限制 | 批量生產受限於吞吐量;交互式工具受限於延遲,而這兩種場景的選擇標準不同 |
| 按實際用量計費 | 包含重試和被拒請求的每個最終交付物成本 | 按令牌或按圖像計費低估了你捨棄的請求成本 |
| 版本穩定性 | 版本是如何鎖定、廢棄和公告的? | 即使質量良好,一個在生產流程中未經通知就發生變化的模型也是一種操作風險 |
| 語言覆蓋範圍 | 在你實際市場中的表現測量 | 最常被假設而非驗證的標準 |
| 來源追溯支持 | 它是否以一種方式標記輸出,且這種標記能在你的流程中持續存在? | 歐盟人工智能法案第50條關於透明度的義務,使這一點成為合規要求而非可有可無的附加項 |
輸出權利和數據處理是通常會直接排除領先候選方案的兩個因素,而且在質量對比中這兩個因素是最不顯眼的。在花費一週進行評分之前,請務必檢查它們。
決策記錄
模型選擇正日益成為組織被期望能夠解釋而非僅僅完成的事情。美國國家標準與技術研究院(NIST)的人工智能風險管理框架(AI RMF 1.0,2023年1月發佈),被廣泛引用為自願的基準,將文檔記錄、測量和可追溯性視為核心實踐。在實際操作中,當客戶或審計人員詢問為何選擇某個特定系統時,他們實際上就是在要求一個良好評估所生成的正是這些成果:
- 評估集和評分標準,版本化。
- 每個候選者和每種語言的評分,已記錄評審員之間的共識。
- 非質量標準以及每個候選者如何被評估這些標準的詳情。
- 決策及其日期,包括哪個標準是決定性的。
- 在每個模型版本變更時的重新評估記錄。
在當時這些成本幾乎為零,且事後無法重建。這是在生產環境中運行AI的反覆主題:工作本身通常沒問題,但證明工作已完成的證據卻會丟失。
值得采納的兩種模式
不要在單一模型上標準化。 同一管道中的不同任務確實由不同的系統贏得,而支持兩個或三個模型並通過統一接口集成的成本,相對於強制使用單一模型所帶來質量成本而言是微不足道的。此外,當供應商更改條款、定價或可用性時,這也能避免單一故障點。
將模型與管道分離。 提示、參考文本、評分標準、評審流程、來源追溯和交付應與具體模型無關,這樣更換模型僅需配置變更而非重新構建。鑑於該領域發展迅速,一個與特定供應商綁定的管道將在一年內被重新編寫。
Lifewood的應對方式
Lifewood 採用第三方生成模型而非自研模型,因此該評估環節屬於日常運營流程,而非一次性的採購活動。該數據集源自真實項目需求說明,已凍結,隨版本更新重新運行,並按語言維度執行——因為語言維度才是排名實際變動的領域,而覆蓋 50+ 語言 的 40+ 交付中心分佈在 30+ 個國家 的情況,意味著僅以英語為篩選標準將無法代表大多數工作內容。
評分過程為盲評且由兩名評審員交叉審核,遵循在所有交付項目中統一應用的 95% 以上準確率 閾值。
參見 AIGC 服務,質量保證流程,交付方法論 和 部署前的 AI 評估。
資料與進一步閱讀
- 斯坦福大學基礎模型研究中心,HELM — 語言模型的綜合評估。
- MMLU-ProX:面向高級大語言模型的多語言基準測試(29 種語言,36 個模型),arXiv 預印本 2503.10497 / EMN-2025。
- 美國國家標準與技術研究院,人工智能風險管理框架(AI RMF 1.0),2023 年 1 月。
- Landis, J.R. 和 Koch, G.G.,《對分類數據的觀察者一致性測量》,生物度量學 33(1),1977 年。