簡短回答。 有三種不同的數據產品被標為"LLM訓練數據",並承擔不同的任務。SFT(監督微調) 教授模型什麼樣的回應是優質的,需要書面示範——成本高昂,依賴專家,單位成本效益最高。RLHF(基於人類反饋的強化學習) 教授模型在兩個回應中哪一個更好,需要偏好對比——單位成本較低,但需要大量樣本,其成敗取決於評分者的一致性。蒸餾 將強模型的行為轉移到弱模型中,需要生成數據和人工驗證。大多數企業項目首先需要SFT,其次需要評估數據,最後需要RLHF——而他們通常以相反的順序購買這些數據,這是最常見的、也是最昂貴的排序錯誤。
進入這一市場的團隊通常知道他們需要‘人類數據’,但對具體類型、比例和順序則不夠清晰。術語體系也無助於理解:供應商將這三種數據產品從同一頁面銷售,且定價單位不可比。
本指南將它們區分開來——每種數據產品實際是什麼、它所消耗的數據類型、其質量如何衡量,以及如何安排支出順序。
三個產品並列展示
| SFT | RLHF/偏好數據 | 蒸餾 | |
|---|---|---|---|
| 它所教授的內容 | 一個好的答案是什麼樣子 | 兩個答案中哪一個更好 | 更強模型的行為表現 |
| 人類產生的內容 | 一份書面的演示回應 | 一個排序或比較,附帶理由 | 生成數據的驗證與過濾 |
| 每項成本 | 最高 | 中等 | 每項最低,計算資源最高 |
| 所需數據量 | 更低 | 更高 | 最高 |
| 所需專業能力 | 高 — 寫作者必須能夠產出目標質量 | 中到高 — 評分者必須能夠 評判 它 | 中等,集中在審核階段 |
| 主要的質量風險 | 不同作者之間風格和深度不一致 | 評分者一致性低;評分標準模糊 | 繼承教師模型的錯誤 |
| 通過以下方式衡量 | 評分標準符合性、專家評審 | 評分者之間經校正的共識 | 下游評估;錯誤繼承檢查 |
該表格中隱藏的經濟要點:寫作比評判難,評判比驗證難。 你的預算應隨難度而調整,人員來源的獲取也應如此——能夠完成每個環節的人群規模和成本各不相同。
SFT: 演示
這是什麼。 一組提示-響應對,其中人類撰寫模型應生成的響應。這是最直接地引導模型行為的方法,因為它展示了目標輸出,而不是對嘗試輸出進行評分。
企業如何使用它。 領域適配——法律、醫療、金融、工業支持——以及語音和格式一致性,即模型必須按照特定的內部風格、結構或語體生成輸出。
什麼決定了質量。 有三個因素,按順序如下:
- 撰寫能力。 演示具有上限。如果撰寫者無法生成專家級輸出,則其生成的數據會教導模型成為非專家。在專業領域,這意味著需要具備資質的撰寫者,而非自我聲明的撰寫者。
- 評分標準的明確性。 "有幫助且準確" 會產生不一致的數據。評分標準應明確結構、深度、謹慎表達、拒絕行為、引用實踐和格式——任何你可能會注意到錯誤的地方。
- 提示分佈的覆蓋範圍。 演示應涵蓋用戶實際發送的提示分佈,包括那些棘手的提示,而不是僅涵蓋容易回答的提示。
在採購大量數據前如何檢查。 從兩位不同的撰寫者處獲取二十個最難案例的樣本,並將它們並列閱讀。同一提示下兩位撰寫者之間的差異程度,是預測你數據集一致性水平的關鍵指標。
RLHF:偏好數據
它是什麼。 一個人看到兩個或多個模型的響應,並指出哪一個更好,通常會附帶理由,有時還會對各個維度進行評分——如幫助性、準確性、安全性、語氣。
企業如何使用它。 在行為對齊方面,當‘更好’更容易被識別而非被明確寫出時,例如語氣、拒絕程度的校準、表達的冗餘性、對政策的遵守程度。實際上,這也是安全行為調優的方式。
什麼決定了質量。 有一項因素佔據主導地位,而且它是可測量的:
Cohen's kappa = (Observed agreement − Expected agreement) ÷ (1 − Expected agreement)
評分者的一致性是關鍵。 如果獨立的合格評分者對哪個響應更好存在分歧,那麼偏好信號就是噪聲,模型就會學習到噪聲。評分者之間的一致性很低幾乎總是意味著評分標準不夠明確,而不是評分者能力不足——這使得它成為最便宜的診斷工具,也是在首次批次數據中必須運行的檢查項。
三個實際要求:
- 需有維度級評分標準,而不是單一的‘哪一個更好’。整體偏好會抹平權衡——一個在準確性上更優但語氣更差的響應會因無人記錄而被淘汰。
- 必須記錄理由。 這是調試評分標準的方式,而且在最初幾週,這些理由比偏好標籤本身更具信息量。
- 允許並明確定義的關聯。 強迫在兩個等效響應之間做出選擇,會製造出並不存在的信號。
多語言註釋。 偏好是文化相關的——禮貌、直接性以及適當的委婉表達因市場而異。一種語言的偏好數據應由該市場本地用戶產生,而不是通過翻譯英文偏好集來獲得,否則模型在所有語言中都會以英語的方式表現禮貌。
蒸餾:經過人類驗證的生成數據
它是什麼。 一個更強的模型生成訓練數據,用於訓練一個更小或更便宜的模型。人類的角色從生產轉變為驗證和篩選——決定哪些內容足夠好而值得保留。
企業在哪裡使用它。 降低成本和延遲,支持在設備端或邊緣部署,並擴展一個已有模型表現良好的任務的覆蓋範圍。
什麼決定了質量。 失敗模式是具體且容易被忽視的:學生會繼承教師的錯誤,包括那些自信的錯誤,而人類驗證過於輕率會因為閱讀流暢而通過這些錯誤。要求:
- 一個驗證率,必須明確說明並加以辯護,採樣設計應旨在發現罕見錯誤,而非確認常見正確性。
- 對教師的錯誤分類跟蹤,以便專門篩查已知的薄弱環節,而不是寄希望於避免它們。
- 來源追溯標註。 合成項目必須能在語料庫中被識別,以便控制其比例,並在評估過程中將其影響隔離。
- 關注教師模型輸出的許可位置,以滿足您的實際用途——這是一個合同問題,而非技術問題,且在數據存在之前更容易回答。
評估數據:沒有人預算卻人人都需要的東西
這不是一個訓練產品,而是列表中回報最高的投資。如果沒有一個獨立的人工構建的評估集,就無法判斷上述任何一項是否有效。
需求:獨立於訓練數據構建,覆蓋相同的分佈,包括尾部困難樣本,定期更新以避免過擬合,並且——對於多語言項目——按語言分別構建而非翻譯。對訓練語料庫進行汙染篩查是值得的;模型記憶中的基準比沒有基準更糟糕,因為它會產生自信的錯誤決策。
如何安排支出順序
- 首先構建評估集。 你無法管理你無法衡量的東西,所有後續決策都是基於這一基礎做出的。
- 接著進行SFT,針對具體錯誤行為進行精準調整。一個規模小、質量高、覆蓋充分的SFT集通常優於一個規模大但分散的SFT集。
- 偏好數據第三,一旦評分標準穩定且在試點批次中已證明評審員的一致性。
- 蒸餾最後,當行為正確且目標是更便宜或更快的推理時。
常見的反例——在評分標準尚未穩定且評估集不存在的情況下,先購買大量偏好數據——會產生一致性低、無法證明其有效性、事後也無診斷手段的數據集。
向供應商提問的內容
- 你們實際上在內部交付的三種方案是哪幾種,哪些是外包的?
- 專精的SFT撰稿人是如何獲得資格的——是經過驗證還是自我聲明?
- 請提供一個可比的偏好項目中,按任務類別劃分的評審員一致性數據。
- 你們的評分標準開發流程是什麼,誰擁有該評分標準?
- 您捕獲了多少個推理路徑,我們能否閱讀它們?
- 在多語言工作中:偏好評分員是否是市場中的母語者?
- 如何處理分歧和邊緣情況——有什麼升級流程?
- 在蒸餾工作中:您的驗證率是多少,樣本是如何抽取的?
- 在我們項目長度的項目中,您的標註員留存率是多少?
- 當客戶詢問在標準尚未穩定前先增加數量時,您會如何回應?
最後一個問題是揭示性的。一個回答為‘我們會把產品賣給他們的’供應商,是在銷售處理能力;而一個描述‘會提出反對意見’的供應商,是在銷售成果。
Lifewood的應對方式
Lifewood 會內部完成全部三項工作——RLHF、SFT 和數據蒸餾,並在 50 多種語言 上進行提示和響應評估——通過自有交付中心的管理團隊完成,而非開放眾包。這一點對偏好數據尤為重要:只有當合格的評分員長期持續參與某一標準,其一致率才變得有意義,而這恰恰是高流失率的來源所無法實現的。
多語言維度是結構層面的。偏好是文化相關的,因此某一市場的偏好數據應當在該市場內產生;在全球30多個國家的40多個交付中心和56,788名貢獻者使得在語言市場中進行本地化評分成為可能,而替代方案則是將英文偏好集進行翻譯。參與方涵蓋前沿模型實驗室、語音AI開發者、AI計算供應商、計算機視覺供應商以及自動駕駛項目,客戶身份根據協議已予以保密。
參見企業級LLM訓練數據,類型B橫向LLM數據,類型C縱向LLM數據,AI數據驗證和質量保證流程。
資料與進一步閱讀
- Cohen's kappa是偏好和判斷任務中標準的偶然校正一致性度量。
- 配套指南:多語言LLM訓練數據和對標註供應商應要求何種準確度標準?
- Lifewood 大語言模型訓練數據範圍已發佈於 lifewood.com/enterprise-llm-training-data。