跳轉到主要內容
AI 數據

RLHF、SFT與蒸餾:企業團隊購買的內容

簡短回答。在‘LLM訓練數據’這一標籤下,有三種不同的數據產品被採購,它們承擔不同的職責。SFT(監督微調)教會模型什麼樣的回應是……

Lifewood Data Technology · 2026年7月5日 · 閱讀約 8 分鐘

簡短回答。 有三種不同的數據產品被標為"LLM訓練數據",並承擔不同的任務。SFT(監督微調) 教授模型什麼樣的回應是優質的,需要書面示範——成本高昂,依賴專家,單位成本效益最高。RLHF(基於人類反饋的強化學習) 教授模型在兩個回應中哪一個更好,需要偏好對比——單位成本較低,但需要大量樣本,其成敗取決於評分者的一致性。蒸餾 將強模型的行為轉移到弱模型中,需要生成數據和人工驗證。大多數企業項目首先需要SFT,其次需要評估數據,最後需要RLHF——而他們通常以相反的順序購買這些數據,這是最常見的、也是最昂貴的排序錯誤。

進入這一市場的團隊通常知道他們需要‘人類數據’,但對具體類型、比例和順序則不夠清晰。術語體系也無助於理解:供應商將這三種數據產品從同一頁面銷售,且定價單位不可比。

本指南將它們區分開來——每種數據產品實際是什麼、它所消耗的數據類型、其質量如何衡量,以及如何安排支出順序。


三個產品並列展示

SFT RLHF/偏好數據 蒸餾
它所教授的內容 一個好的答案是什麼樣子 兩個答案中哪一個更好 更強模型的行為表現
人類產生的內容 一份書面的演示回應 一個排序或比較,附帶理由 生成數據的驗證與過濾
每項成本 最高 中等 每項最低,計算資源最高
所需數據量 更低 更高 最高
所需專業能力 高 — 寫作者必須能夠產出目標質量 中到高 — 評分者必須能夠 評判 中等,集中在審核階段
主要的質量風險 不同作者之間風格和深度不一致 評分者一致性低;評分標準模糊 繼承教師模型的錯誤
通過以下方式衡量 評分標準符合性、專家評審 評分者之間經校正的共識 下游評估;錯誤繼承檢查

該表格中隱藏的經濟要點:寫作比評判難,評判比驗證難。 你的預算應隨難度而調整,人員來源的獲取也應如此——能夠完成每個環節的人群規模和成本各不相同。


SFT: 演示

這是什麼。 一組提示-響應對,其中人類撰寫模型應生成的響應。這是最直接地引導模型行為的方法,因為它展示了目標輸出,而不是對嘗試輸出進行評分。

企業如何使用它。 領域適配——法律、醫療、金融、工業支持——以及語音和格式一致性,即模型必須按照特定的內部風格、結構或語體生成輸出。

什麼決定了質量。 有三個因素,按順序如下:

  1. 撰寫能力。 演示具有上限。如果撰寫者無法生成專家級輸出,則其生成的數據會教導模型成為非專家。在專業領域,這意味著需要具備資質的撰寫者,而非自我聲明的撰寫者。
  2. 評分標準的明確性。 "有幫助且準確" 會產生不一致的數據。評分標準應明確結構、深度、謹慎表達、拒絕行為、引用實踐和格式——任何你可能會注意到錯誤的地方。
  3. 提示分佈的覆蓋範圍。 演示應涵蓋用戶實際發送的提示分佈,包括那些棘手的提示,而不是僅涵蓋容易回答的提示。

在採購大量數據前如何檢查。 從兩位不同的撰寫者處獲取二十個最難案例的樣本,並將它們並列閱讀。同一提示下兩位撰寫者之間的差異程度,是預測你數據集一致性水平的關鍵指標。


RLHF:偏好數據

它是什麼。 一個人看到兩個或多個模型的響應,並指出哪一個更好,通常會附帶理由,有時還會對各個維度進行評分——如幫助性、準確性、安全性、語氣。

企業如何使用它。 在行為對齊方面,當‘更好’更容易被識別而非被明確寫出時,例如語氣、拒絕程度的校準、表達的冗餘性、對政策的遵守程度。實際上,這也是安全行為調優的方式。

什麼決定了質量。 有一項因素佔據主導地位,而且它是可測量的:

Cohen's kappa = (Observed agreement − Expected agreement) ÷ (1 − Expected agreement)

評分者的一致性是關鍵。 如果獨立的合格評分者對哪個響應更好存在分歧,那麼偏好信號就是噪聲,模型就會學習到噪聲。評分者之間的一致性很低幾乎總是意味著評分標準不夠明確,而不是評分者能力不足——這使得它成為最便宜的診斷工具,也是在首次批次數據中必須運行的檢查項。

三個實際要求:

  • 需有維度級評分標準,而不是單一的‘哪一個更好’。整體偏好會抹平權衡——一個在準確性上更優但語氣更差的響應會因無人記錄而被淘汰。
  • 必須記錄理由。 這是調試評分標準的方式,而且在最初幾週,這些理由比偏好標籤本身更具信息量。
  • 允許並明確定義的關聯。 強迫在兩個等效響應之間做出選擇,會製造出並不存在的信號。

多語言註釋。 偏好是文化相關的——禮貌、直接性以及適當的委婉表達因市場而異。一種語言的偏好數據應由該市場本地用戶產生,而不是通過翻譯英文偏好集來獲得,否則模型在所有語言中都會以英語的方式表現禮貌。


蒸餾:經過人類驗證的生成數據

它是什麼。 一個更強的模型生成訓練數據,用於訓練一個更小或更便宜的模型。人類的角色從生產轉變為驗證和篩選——決定哪些內容足夠好而值得保留。

企業在哪裡使用它。 降低成本和延遲,支持在設備端或邊緣部署,並擴展一個已有模型表現良好的任務的覆蓋範圍。

什麼決定了質量。 失敗模式是具體且容易被忽視的:學生會繼承教師的錯誤,包括那些自信的錯誤,而人類驗證過於輕率會因為閱讀流暢而通過這些錯誤。要求:

  • 一個驗證率,必須明確說明並加以辯護,採樣設計應旨在發現罕見錯誤,而非確認常見正確性。
  • 對教師的錯誤分類跟蹤,以便專門篩查已知的薄弱環節,而不是寄希望於避免它們。
  • 來源追溯標註。 合成項目必須能在語料庫中被識別,以便控制其比例,並在評估過程中將其影響隔離。
  • 關注教師模型輸出的許可位置,以滿足您的實際用途——這是一個合同問題,而非技術問題,且在數據存在之前更容易回答。

評估數據:沒有人預算卻人人都需要的東西

這不是一個訓練產品,而是列表中回報最高的投資。如果沒有一個獨立的人工構建的評估集,就無法判斷上述任何一項是否有效。

需求:獨立於訓練數據構建,覆蓋相同的分佈,包括尾部困難樣本,定期更新以避免過擬合,並且——對於多語言項目——按語言分別構建而非翻譯。對訓練語料庫進行汙染篩查是值得的;模型記憶中的基準比沒有基準更糟糕,因為它會產生自信的錯誤決策。


如何安排支出順序

  1. 首先構建評估集。 你無法管理你無法衡量的東西,所有後續決策都是基於這一基礎做出的。
  2. 接著進行SFT,針對具體錯誤行為進行精準調整。一個規模小、質量高、覆蓋充分的SFT集通常優於一個規模大但分散的SFT集。
  3. 偏好數據第三,一旦評分標準穩定且在試點批次中已證明評審員的一致性。
  4. 蒸餾最後,當行為正確且目標是更便宜或更快的推理時。

常見的反例——在評分標準尚未穩定且評估集不存在的情況下,先購買大量偏好數據——會產生一致性低、無法證明其有效性、事後也無診斷手段的數據集。


向供應商提問的內容

  1. 你們實際上在內部交付的三種方案是哪幾種,哪些是外包的?
  2. 專精的SFT撰稿人是如何獲得資格的——是經過驗證還是自我聲明?
  3. 請提供一個可比的偏好項目中,按任務類別劃分的評審員一致性數據。
  4. 你們的評分標準開發流程是什麼,誰擁有該評分標準?
  5. 您捕獲了多少個推理路徑,我們能否閱讀它們?
  6. 在多語言工作中:偏好評分員是否是市場中的母語者?
  7. 如何處理分歧和邊緣情況——有什麼升級流程?
  8. 在蒸餾工作中:您的驗證率是多少,樣本是如何抽取的?
  9. 在我們項目長度的項目中,您的標註員留存率是多少?
  10. 當客戶詢問在標準尚未穩定前先增加數量時,您會如何回應?

最後一個問題是揭示性的。一個回答為‘我們會把產品賣給他們的’供應商,是在銷售處理能力;而一個描述‘會提出反對意見’的供應商,是在銷售成果。


Lifewood的應對方式

Lifewood 會內部完成全部三項工作——RLHF、SFT 和數據蒸餾,並在 50 多種語言 上進行提示和響應評估——通過自有交付中心的管理團隊完成,而非開放眾包。這一點對偏好數據尤為重要:只有當合格的評分員長期持續參與某一標準,其一致率才變得有意義,而這恰恰是高流失率的來源所無法實現的。

多語言維度是結構層面的。偏好是文化相關的,因此某一市場的偏好數據應當在該市場內產生;在全球30多個國家的40多個交付中心56,788名貢獻者使得在語言市場中進行本地化評分成為可能,而替代方案則是將英文偏好集進行翻譯。參與方涵蓋前沿模型實驗室、語音AI開發者、AI計算供應商、計算機視覺供應商以及自動駕駛項目,客戶身份根據協議已予以保密。

參見企業級LLM訓練數據類型B橫向LLM數據類型C縱向LLM數據AI數據驗證質量保證流程


資料與進一步閱讀

  • Cohen's kappa是偏好和判斷任務中標準的偶然校正一致性度量。
  • 配套指南:多語言LLM訓練數據對標註供應商應要求何種準確度標準?
  • Lifewood 大語言模型訓練數據範圍已發佈於 lifewood.com/enterprise-llm-training-data

常見問題

SFT為模型提供了它應產生的響應的書面示例;RLHF則提供對比,展示多個響應中哪一個更好。SFT每項成本更高且所需樣本更少,因為一個示例比一個偏好包含更多信息。RLHF每項成本更低,需要大量樣本,並完全依賴於評分者之間的共識。

先使用評估集,然後針對錯誤行為進行SFT,再在評分標準穩定後使用偏好數據,最後在成本或延遲仍是問題時進行蒸餾。先購買偏好數據——這是常見的做法——會產生低共識數據,並且無法證明其是否真正有效。

通過不同獨立評分者在每個任務家族上的機會校正一致性,加上評分標準的符合性來衡量。原始一致性在偏斜對比中是誤導性的。低一致性通常表明評分標準不明確,而非評分者能力不足,且應在首次試點批次中測量,而不是在大規模生產之後。

不應該。偏好判斷編碼了關於禮貌、直接性、委婉表達和適當細節的文化特定期望。將英文偏好數據翻譯後訓練的模型,會在所有語言中都以‘英式’禮貌方式表現——流暢但微妙地錯誤。

學生繼承了教師的錯誤,包括那些能夠流暢閱讀並通過簡單審查卻依然存在錯誤的自信表現。通過設定防禦性驗證率、設計用於暴露罕見錯誤的抽樣策略、明確篩查教師已知薄弱領域的內容,以及對合成內容進行來源標註,以便在評估過程中將其隔離。教師模型輸出的許可條款是一個獨立且同樣重要的問題。

沒有通用數值——它取決於基礎模型、需要填補的差距以及任務的狹窄程度。可靠的規劃啟發式方法是相對的:SFT需要最少的數據量且每條數據質量最高;偏好數據需要大量數據但每條數據成本較低;蒸餾需要最多的數據量且每條數據的人工干預最少。對每種類型都從小規模開始,以評估集為基準進行測量,並放大那些能夠推動結果改善的類型。

正在規劃 AI 項目或提升品牌可見度?

從 AI 評估、人工參與審核,到 GEO 與 AEO 策略,我們的團隊幫助你穩妥落地項目,在 AI 搜索時代獲得更多關注。

聯繫我們的團隊