簡短回答。 偏好數據的質量取決於產生該數據的人之間的共識程度,而低共識幾乎總是源於評分標準的問題,而非評分者的問題。一個能夠產生共識的評分標準必須明確說明四個要素,而單個"哪一個更好?"的問題無法做到:被評判的評判維度、描述每個評分等級樣例的錨點、當維度之間存在衝突時的優先規則,以及明確的平局處理政策。增加與經裁定的黃金對比樣本的校準輪次,記錄推理過程,並按維度而非整體測量校正後的共識度。必須在首次試點批次中診斷所有內容——在大規模生產前未經過共識測試的評分標準,在大規模使用時會產生噪聲,而這種噪聲一旦進入文件,將無法與真實信號區分。
基於人類反饋的強化學習將人類判斷轉化為訓練信號。該流程已有充分文檔記錄——首先在示範數據上進行監督微調,然後在模型輸出之間進行人類比較,最後從這些比較中推導出獎勵信號或偏好學習目標,如 Ouyang 等人在指令遵循模型研究中所述。然而,較少被記錄的是決定所生成數據是否具有價值的部分:人類所使用的工具。
本指南關注的就是這個工具。關於應購買哪三種大語言模型數據產品以及購買順序的問題,已在購買什麼:RLHF、SFT 或蒸餾中詳細說明。
為什麼評分者會對模型輸出產生分歧?
語言生成是開放式的,因此兩個響應可能因不同原因均被接受,一個響應可能在某維度上更強,而在另一維度上更弱。但"任務是主觀的"僅是一種描述,而非診斷。分歧有其原因,而這些原因有不同的解決方法。
| 原因 | 具體表現 | 解決方案 |
|---|---|---|
| 真實等價 | 評分者平均分配,理由一致認為兩者都合適 | 明確允許並定義平局情況 |
| 維度衝突 | A 更準確,B 更有幫助;評分者權重不同 | 按維度評分;明確優先級 |
| 缺少上下文 | 評分者想像出不同的用戶或場景 | 在項目內容中提供上下文,而不是在評分標準中提供 |
| 專業能力差距 | 評分者無法驗證所陳述的領域主張 | 通往專家層級的路徑 |
| 評分標準模糊 | 理由引用了對同一選擇的不同標準 | 以錨點重寫評分標準 |
| 評分者偏差 | 隨著時間推移,評分一致性下降且評分標準未變更 | 重新校準;檢查疲勞情況和隊列變化 |
只有第一條是與任務本身固有的。其餘五條是可以解決的,其中四項在生產開始前就可以解決。
一個偏好計劃最能捕捉到的是理由,而不是偏好本身。在最初的幾週裡,理由比標籤更具信息量:它們能幫助區分維度衝突與評分模糊,同時也是撰寫下一輪評分標準的原始材料。
偏好評分標準必須明確說明的內容
維度,而非結論。 應分別詢問哪個響應在準確性、指令遵循、助人程度、安全性、語氣、完整性方面表現更好。一個綜合性的偏好會抹平權衡:一個在準確性上更優但愉悅感更差的響應,會因無人記錄而被判定為更差,模型因此學習到這種綜合結果。
維度衝突率 = 各維度判斷不一致的比較次數 ÷ 比較總次數
在試點階段進行計算。如果衝突率較高,說明綜合偏好標籤對你的任務毫無意義,計劃應收集每個維度的評分;如果衝突率較低,則說明可以安全地進行聚合,且成本更低。
每個等級的錨定標準。 "對助人程度進行1到5分評分" 會形成評分者的私人量表。錨定標準應描述2分和4分分別是什麼樣子,並給出每個等級的實例。錨定標準是評分表與問卷之間的區別,而撰寫錨定標準是評分表設計中投入最大精力的部分。
優先級規則。 當不同維度出現矛盾時,哪一個應優先?準確性優於語氣是常見的默認規則;安全性高於一切是常見的絕對規則。無論答案是什麼,都必須寫入文檔中,否則每個評分者都會自行制定規則——這些規則在每個評分者內部是一致的,但在不同評分者之間是不同的,而這正是導致評分一致性低而個體可靠性高的根本原因。
平局政策。 強制在兩個等效響應之間做出選擇,會製造出不存在的信號並將其注入訓練過程。允許平局,明確什麼構成平局,並期望在構建良好的對比集上,平局的比例具有實際意義。
對拒絕、含糊和長度的明確處理。 這三個方面是評分標準最常保持沉默的地方,也是評分者最常產生分歧的地方。一個正確的拒絕是否應優於對邊緣請求的有幫助的回答?一個含糊的回答是否優於一個自信但錯誤的回答?長度是體現充分性還是隻是填充?這些未明確說明的內容最終都會成為模型的行為,由評分者各自傾向的方式決定。
評分者所需的情境,由項目內容提供。 是誰提問、為何提問、在何種情境下。如果評分者需要想像這些內容,不同的評分者會以不同方式想像,由此產生的分歧根本不是關於響應本身的問題。
如何進行校準
校準不是訓練。它是通過評分者作為工具,發現評分標準模糊之處的過程,在其輸出被當作數據之前完成。
- 構建一個經過裁定的黃金標準集。 包括最困難和最模糊的案例,由資深評審員通過書面理由解決的二十到五十個對比案例。這是校準評分標準所依據的參考基準。
- 進行盲評。 每位評分者獨立地根據當前評分標準對黃金標準集進行評判,並提供理由。
- 按維度計算一致性,經過校正的,且分別與黃金答案對比,以及彼此之間對比。
Cohen's kappa = (Observed agreement − Expected agreement) ÷ (1 − Expected agreement)
- 一起閱讀不同的理由。 這是整個評審環節的實際工作內容。當評審者對同一選擇引用不同的評判標準時,說明評分標準存在模糊性;當他們引用相同標準卻得出不同結論時,說明錨定標準存在問題。
- 修訂評分標準,進行版本迭代,並重復此過程,直到在關鍵維度上達成一致。通常需要兩到三輪評審;若超過此數量,通常說明維度集合設置不當,而非表述問題。
- 按週期重新校準,並在評分標準變更、群體變更或觀察到的一致性下降後始終進行。
將Kappa值與明確的量表進行對比,而非使用私有量表。Landis和Koch提出的量表(Biometrics, 1977)——0.61–0.80為顯著,高於0.80為幾乎完美——是通用參考標準,其作者明確表示這些是任意設定的基準,而非統計學閾值。客觀維度(如指令遵循)應達到較高區間;真正主觀的維度(如語氣)很少能達到,若在主觀維度上出現異常高的數值,通常表明評審者是基於建議答案進行錨定,而非表現出卓越的工作質量。
生產階段中的分歧處理
一旦評審量達到一定規模,分歧需要通過路由規則而非討論來解決。請依次提出三個問題:
- 該項目是否存在問題? 兩個幾乎完全相同的回答,或一個模糊的提示,所產生的分歧並不能反映評審者或評分標準的問題。應移除該條目並檢查其如何進入數據集。
- 評分標準是否未明確說明? 如果評審理由中提到了評分標準未涵蓋的考量因素,那麼這應被寫成正式規則——並且一旦形成,需回溯應用於已收集的相關條目。
- 評分者是否出現偏差? 一個評分者始終與群體偏離,通常只是可糾正的誤解,而非能力問題。只有在按評分者和按維度分別追蹤一致率時,這種偏差才會顯現。
追蹤一致性隨時間的變化。群體整體一致性下降通常意味著疲勞或漂移;出現突變則通常意味著評分標準或題項來源發生了變化,但未被提前標記。
多語言註釋。 對‘偏好’的文化定位是情境化的——不同市場對直接性、禮貌、委婉表達和適當細節的期望各不相同。一種語言的偏好集合應由該市場本地母語者制定,而非從英文集合翻譯而來,否則模型會以英語方式表達禮貌,應用於所有語言。這不是小細節:當使用翻譯後的評分標準時,某些市場會出現持續低一致性,而這種低一致性是源於評分標準本身,而非評分者。
將訓練偏好與評估偏好分開
相同的判斷基礎設施同時支持兩者,但數據集必須分開。訓練偏好塑造行為;評估偏好則用於估計行為是否改善,包括在未參與的提示上進行測試,尤其是那些困難和對抗性的提示。
三個要求:獨立構建評估集,而非簡單分割訓練集;對評估集進行汙染檢查,確保其與訓練語料無交叉;定期更新評估集,以避免過擬合。對於多語言項目,應按語言分別構建評估集,而非翻譯成統一語言——一個被翻譯的評估集,實際上是在測量翻譯質量,而非模型表現。
成熟的工作流程會通過錯誤分類體系形成閉環:評估失敗會被分類,出現失敗最多的類別將決定下一階段偏好收集的重點。否則,偏好數據會不斷積累卻無法持續優化。
Lifewood的應對方式
Lifewood 採用‘評分標準先行’的方式開展偏好收集和響應評估工作:按維度打分,配有書面錨定標準、明確的優先級規則和打平政策,通過仲裁的黃金對比案例,進行規模前的校準輪次,並對每個維度進行機會校正的一致率測量,且按評分者追蹤。理由記錄作為標準流程,因為正是這些理由使得評分標準能夠持續改進。
交付模式是使協議數據在時間維度上具有意義的關鍵。採用自有交付中心的管理型團隊,而非開放眾包,意味著經過篩選的合格評估員能夠長期穩定地使用某一評估標準,從而使其趨於穩定;而高流失率的來源獲取方式則從設計上就阻止了這種穩定性——2025年孟加拉國團隊累計投入的414,120訓練小時,正是在項目規模擴大過程中維持這種一致性的基礎。在多語言偏好工作方面,覆蓋50多種語言,涉及30多個國家的40多個交付中心,並擁有56,788名註冊貢獻者,使得市場內評估成為現實,而替代方案則是將英文偏好集進行翻譯。該範圍涵蓋RLHF、SFT、數據蒸餾以及提示與響應評估。AI數據遺產可追溯至2004年,公司目前成立於2018年。
參見企業級大語言模型訓練數據、AI數據驗證、質量保證流程以及類型C垂直大語言模型數據。
資料與進一步閱讀
- Ouyang 等人,"通過人類反饋訓練語言模型以遵循指令",arXiv:2203.02155,2022 — 上述描述的演示與排序流程。
- Landis, J.R. 和 Koch, G.G.,《對分類數據的觀察者一致性測量》,生物度量學 33(1),159–174,1977年——所引用的一致性區間來源。
- 配套指南:如何選購:RLHF、SFT或蒸餾。