簡短回答。 用於訓練AI的訓練數據是指任何被用來教授或測試模型的材料——預訓練語料庫、書面演示、偏好對比、評估集和多模態配對——這四類是不同的產品,由不同的生產方、成本和質量測試構成。質量並非單一屬性,而是七個相互權衡的維度:正確性、一致性、覆蓋度、相關性、新鮮度、多樣性和來源追溯。關鍵問題不在於你擁有多少數據,而在於這些數據是否真實反映了模型實際運行的環境,因為一個語料庫可能非常龐大、乾淨,卻完全不具備代表性。只有當數據增加有效信號時,更多數據才有幫助;超出這一點,它只會增加爬取、存儲、審核和法律風險,而主要準確率指標則保持不變。
大多數數據集問題在訓練階段才被發現,這是最昂貴的時刻。這些問題在訓練前是可見的,但僅限於那些使用特定問題集進行數據檢查的人才能發現。本指南明確了訓練數據的構成內容、質量維度的實際含義,以及在投入計算資源前必須執行的審核流程。
什麼才算作AI訓練數據?
這一術語涵蓋至少五種不同的產品。它們來自不同的供應商,由不同的人生產,並通過不同的測試標準進行評估——這就是為什麼預算表中一條‘訓練數據’通常會掩蓋一個排序錯誤。
| 產品 | 它所教授的內容 | 由誰生產 | 如何評估質量 |
|---|---|---|---|
| 預訓練語料庫 | 通用語言、世界知識、格式 | 大規模獲取或授權;人工編寫較少 | 與分層計劃的覆蓋度對比;去重;權利位置分析 |
| 監督式演示 | 一個優質響應應呈現的樣子 | 能夠產出目標質量的撰稿人 | 符合評分標準;專家評審;不同撰稿人之間的差異 |
| 偏好對比 | 兩個響應中哪一個更好 | 經過訓練的評審員,具備多語言市場經驗 | 獨立評審員之間經校正後的共識度 |
| 標註任務數據 | 信號所在位置及其含義 | 經過訓練的標註員,依據版本化的指南 | 標註員間的一致性;裁決負擔 |
| 評估集和安全集 | 沒有——它們是衡量的項目 | 獨立於訓練集構建 | 汙染篩查;硬尾部分的覆蓋範圍 |
兩個影響預算的觀察結果。第一,評估數據是最常被排除的項目,且其回報最高,因為沒有它,就無法對其他四項進行任何驗證。第二,難度沿著中間列遞減:寫作比判斷更難,判斷比獲取更難——因此,獲取率絕不能被用來推斷演示成本。
一個數據集不僅僅是其記錄。它承載著上下文:來源、同意或許可依據、應用的變換、現行的標註指南版本以及執行的檢查。正是這些上下文使得當模型行為受到質疑時,數據集具備可審計性、可更新性和可辯護性——而這些上下文一旦發生,便無法再被重建。
數據質量的維度是什麼?
"高質量"並不是一個數據集所具備的屬性。它是由七個屬性構成,每個屬性都有不同的測試方法和不同的失效模式。
| 維度 | 它所回答的問題 | 如何測試它 | 當缺失時對您造成的成本 |
|---|---|---|---|
| 正確性 | 標籤是否正確? | 標註員無法識別的裁決黃金標準集 | 直接錯誤,被當作真理學習 |
| 一致性 | 兩位標註員是否以相同方式應用指南? | 在重疊項目上的校正機會一致率 | 類別邊緣的決策邊界不穩定 |
| 覆蓋範圍 | 部署條件是否被體現? | 與書面覆蓋計劃的分層計數 | 在聚合指標中不可見的盲點 |
| 相關性 | 該材料是否與任務相關? | 根據任務規範進行的示例評審 | 浪費的計算資源;信號被稀釋 |
| 時效性 | 是否反映了當前的實踐、產品和語言? | 過時的採樣;各領域內的評審週期 | 自信且流暢的過時現象 |
| 多元 | 是否沿著關鍵維度發生變化? | 按各維度分別提供分佈報告,而非整體報告 | 僅適用於多數情況的模型 |
| 來源追溯 | 你能說出每項內容的來源嗎? | 每項內容的來源記錄,可導出 | 權利暴露;無法後續過濾 |
各維度之間存在權衡。縮小分類體系會提升一致性,但會丟失邊界案例。捨棄舊材料會提升時效性,但會減少內容量。更廣泛地獲取來源會提升多樣性,但會降低準確性,直到指南跟上。沒有任何配置能同時最大化七個維度,因此這些維度應根據具體項目進行規定,而非作為通用標準提出。
NIST的AI風險管理體系(AI RMF 1.0,2023年1月)在項目層面提出了相同觀點:可信性是貫穿生命週期管理的,而非在某個基準點一次性認證。數據質量是該生命週期中最早階段的決策點,此時決策成本較低。
更多的訓練數據是否總是更好?
不是,這種認為‘更多數據總是更好’的觀念,是當前市場中大多數浪費的根源。
額外數據在以下四種情況下會起作用:當它擴展了模型尚未覆蓋的內容,或降低了模型在薄弱區域的不確定性時。一旦超出這四種情況,額外數據反而會停止幫助,甚至開始產生負面影響:
- 重複會扭曲評估。 靠近的重複內容分佈在訓練集和測試集之間,會虛增測得的性能,而不會真正提升模型,除非你在跨分割進行去重,否則這種影響是不可見的。
- 平均值掩蓋了細分結果。 一個大型數據集可能產生令人印象深刻的總體數值,而對罕見但重要的細分場景的性能卻很差。總體數值隨數據量增加而上升,而細分場景的性能則不會。
- 偏差會加劇。 數據量通常來自最容易獲取的來源,這意味著每個新增批次通常會強化現有分佈,而不是填補其空白。
- 權利暴露隨數據量增長。 來源不明確的內容是一種風險,隨著每個批次的攝入而不斷增長,如果從未記錄其來源,則無法在後期移除。
更關鍵的問題是,一個批次是否能增加可用信號——在實踐中,這意味著數據收集應聚焦於代表性不足的場景、困難示例、新興市場以及模型自身觀察到的失敗案例,而不是簡單地增加其已處理內容的量。
覆蓋下限 = 各分層中(實際數據項數 ÷ 目標數據項數)的最小值
報告地面情況,而不是平均值。平均值是讓一個完全空的語料層看起來被充分覆蓋的數字,也是供應商和內部團隊默認使用的數字。
在訓練前如何審計一個數據集?
數據集審計需要幾天時間,通常會改變採購的內容。按照這個順序進行,因為每一步都會讓後續步驟變得更便宜。
- 首先寫下預期行為。 任務、用戶、語言、運行環境、每個失敗類別的成本,以及模型評判的標準。所有後續的問題都是基於這一點提出的。一個數據集不能在抽象層面被評估。
- 檢查分層情況,而不只是總量。應對照第 1 步的計劃,要求提供語言、地區、設備、場景、類別和難度等各層級的數量。未經分層的總數只能說明數據規模。
- 進行分層抽樣,而不是全局抽樣。 全局通過率主要由最大且最容易的段落主導。從每個分層中抽取樣本,並分別報告。
- 尋找洩露現象。 檢查訓練、驗證和測試分區之間的近似重複項,以及評估集中是否存在可能出現在預訓練語料中的項目。模型記住了某個基準,比沒有基準更糟糕,因為它會做出自信的錯誤決策。
- 手動閱讀一百個樣本。 不是關於它們的報告——而是樣本本身。這是團隊常常跳過的步驟,也是發現那些沒有指標能命名的問題:截斷記錄、套話、機器翻譯文本被當作原生語言呈現、標註滿足指南卻偏離了本意。
- 端到端追蹤十個樣本。 隨機選擇它們,並要求供應商提供每個樣本的來源、權利依據、採集方法、處理過程和標註歷史。無論答案在幾小時內還是幾週內到達,都說明了來源記錄的真實情況。
- 運行試點實驗。 對數據集的唯一可靠判斷是它是否在關鍵條件下提升了目標模型或評估表現。在投入大規模使用前,先在一小部分上進行測試。
對於主觀任務,再增加一項:對一部分樣本進行重疊,計算校正後的共識度,並根據命名的尺度進行解釋。蘭迪斯和科奇的帶寬(Biometrics, 1977)——0.61–0.80為實質性,高於0.80為幾乎完美——是常見的參考標準,其作者將其呈現為任意基準而非統計閾值。命名尺度是該主張的一部分。
數據集記錄應包含什麼內容?
將文檔與數據版本同步。一個可操作的版本記錄應包含:
- 目的 —— 數據集是為哪些用途構建的,以及它不適用於哪些用途。
- 構成 —— 各分層的計數、類別平衡、語言和方言細分、模態混合。
- 採集與權利 —— 每個來源是如何獲取的,時間範圍,以及所依據的許可或同意基礎。
- 標註 —— 指南版本、標註員資質、重疊率、共識度數據、仲裁規則。
- 已知侷限 —— 你已經知道的空白點。一個沒有侷限性部分的數據集卡片,就是營銷。
- 變更日誌 —— 自上次版本以來發生了什麼變化,以及哪些早期工作因此被重新裁定。
記錄的目的不是合規。而是六個月後,當模型在某個市場表現異常時,記錄是唯一能讓任何人找出原因的東西。
Lifewood的應對方式
Lifewood 將訓練數據構建為一個受控的流程,而非交付:在數據採集開始前就指定覆蓋範圍,採用分層抽樣而非全局通過率,使用版本化的指南,並實施雙重人工參與閉環審查,準確率保持在 95%+ 以上。來源追溯是按每個項目記錄,而不是在交付時重建,因為後者在大規模上是不可實現的。
全球項目中質量約束的問題在於,誰有資格來評判數據。50+種語言,覆蓋30多個國家的40多個交付中心和56,788名註冊貢獻者意味著內容是在市場本地生產並審核的,而不是被翻譯到當地——這一點在覆蓋最薄弱的群體中尤為重要。
參見全球AI數據,AI數據驗證,質量保證流程,以及企業級LLM訓練數據。
資料與進一步閱讀
- NIST,人工智能風險管理框架(AI RMF 及1.0,2023年1月)——強調在整個AI生命週期中管理可信度,而非僅在單一基準點。
- Ouyang等,《通過人類反饋訓練語言模型以遵循指令》,arXiv:2203.02155,2022年——上述提及的演示與偏好流程。
- Landis, J.R. 和 Koch, G.G.,《對分類數據的觀察者一致性測量》,生物度量學 33(1),159–174,1977年——所引用的一致性區間來源。
- 配套指南:橫向與縱向LLM訓練數據對比。