簡短回答。 在偏好標註中,通常的直覺——儘可能提高標註員間的共識——會破壞獎勵模型本應學習到的信號。MultiPref 使用四名標註員各自評分的10,000組偏好數據,報告了加權二次卡帕值為0.268,其中約39%的偏好對錶現出分歧;PRISM 在75個國家的1,500名參與者中發現,一致性偏好本質上是主觀的。實際問題並非提高共識,而是區分漂移(這是一種缺陷)與合法的差異(這是數據本身)——兩者在共識統計上看起來完全相同。解決方法是將規範拆分為客觀部分,其中低共識意味著漂移,以及主觀部分,其中差異被記錄而非被解決。
關於在覆蓋全球交付網絡的偏好標註工作中,有一個事實讓我花了很長時間才真正理解:顯而易見的目標其實是錯誤的。
在大多數標註工作中,你都會盡可能提高標註員間的共識。分歧意味著模糊性,模糊性意味著指南存在問題,而一個運行良好的項目最終會趨於一致。這種直覺對於目標檢測、轉錄、意圖分類是正確的。
將其應用於強化學習與人類反饋(RLHF)的偏好數據,你將系統性地摧毀你本應收集到的信號。
因為在偏好標註中,相當一部分的分歧並非錯誤。而是來自不同背景、價值觀和情境的人們,真正偏好不同的事物,而這正是獎勵模型應當學習的內容。如果將其抹平,你訓練出的模型將滿足一個實際上無人持有的共識。
Lifewood 於2023年啟動了首個大語言模型(LLM)和強化學習與人類反饋(RLHF)項目,目前這項工作已覆蓋全球30多個國家的40多個交付中心。本文探討的問題是實際操作中真正重要的問題:如何在如此廣泛的網絡中保持評分員的校準,同時不抹去你本應捕捉到的文化差異?
首先,一個令人不自在的基準線:共識度很低,而這很正常
如果你是從分類工作獲取偏好數據,那麼共識數值會令你感到不安。
在MultiPref數據集中,包含10,000個偏好配對,每個配對由四位不同的標註員進行標註,研究人員報告了加權二次Cohen's kappa值為0.268。在剔除平局和輕微偏好情況後,大約39%的偏好配對顯示出不同的偏好傾向。
以Landis和Koch的分類標準來看,這屬於‘中等’範圍,遠低於任何分類項目所能接受的水平。
然而,MultiPref是一個結構良好、配備受訓標註員並明確制定協議的數據集。共識度低並不構成質量缺陷,它反映了對開放式回答進行偏好判斷的真實情況。
研究文獻在此問題上已明確轉向。從Aroyo和Welty早期工作,到最近Basile及其同事的研究均指出,標註員之間的分歧並非僅僅是測量誤差:它反映了語義模糊性、主觀解讀以及真正的價值多元性。對於RLHF而言,如何聚合這種分歧,決定了哪些解讀能夠持續保留在學習系統中。
因此,在大規模開展偏好工作時,首要的紀律是停止將低共識數值視為需要修復的問題,轉而提出一個更難回答的問題:這種分歧中,哪些部分是信號,哪些部分是漂移?
將合理變異與實際漂移區分開來
這是核心運營問題,我認為在行業中真正被忽視了。
漂移是指評分員對規範的應用隨時間變化或偏離共享標準,而這些變化與內容本身無關。例如疲勞、無聊、記錯指南、無意識的捷徑、某個本地團隊負責人獨特解釋在站點內傳播。這是一種缺陷,需要糾正。
合法的變異是指評分員正確應用規範,但仍得出不同結論,因為所要求的判斷本質上依賴於誰在回答。這是一種數據,需要保留。
在一致性統計中,兩者看起來完全相同。兩者都顯示為分歧。要區分它們,需要結構支持。
有效的方法是將規範拆分為客觀與主觀兩個部分,並分別進行衡量。
客觀部分是存在正確答案的情況:回應是否事實準確、是否遵循明確指令、是否包含請求元素、是否違反安全規則。在這些方面應達成高度一致,若此處一致性低,則是漂移。這部分黃金標準項目的工作方式與分類任務中的完全一致。
主觀部分是判斷本質上屬於偏好情況:語氣是否恰當、直接程度是否有助於溝通、長度是否合適、表達方式是否尊重。這部分的一致性本應較低,且這種差異應被記錄而非解決。
一個設計良好的偏好協議要求評分員分別對這些方面打分,而不是產生一個單一的整體‘哪一個更好’的判斷。這會增加每個項目的成本。同時,當一致性下降時,就能明確判斷是哪種類型的分歧。
文化維度,附實際數據
各國之間的差異是真實存在的,並且已經被測量過。
PRISM研究由Kirk及其同事開展,從75個國家的1,500名參與者中收集了對對齊偏好的數據,發現這些偏好是主觀且依賴於情境的,而非普遍存在的。這是本節所有內容的基礎性發現。
CulturalFrames研究文化期望對齊情況,報告了圖像提示與質量判斷在國家層面的Krippendorff's alpha值範圍為0.24至0.42,與CUBE報告的0.09至0.58範圍相比,並指出Fleiss kappa值為0.179至0.406,而CultDiff的值為0.07至0.17。這些是領域在文化相關判斷上實際達成的一致性水平。
這對分佈式運營的實際意義是,各站點之間的一致性目標必須按維度設定,而非全局統一。要求馬尼拉、內羅畢和貝爾格萊德對某一響應的語氣得體性達成一致,實際上是在要求它們對文化判斷達成一致;而要求它們對響應中是否存在事實錯誤達成一致,則是完全合理的。
這裡還存在一個更微妙的問題值得指出。如果您的評分員群體集中在少數幾個國家,並將評分結果聚合為單一獎勵信號,那麼這些國家的偏好就會被導出到模型服務的每一個市場。這並非一箇中立的技術選擇,而是一個關於模型編碼了哪些規範的決策,這一決策是通過負責標註項目的人員隱含做出的。
實際上用於發現問題的漂移機制
在明確了客觀與主觀判斷的劃分之後,實際的監控流程如下。
各站點共享校準集。一個共同的題項批次,包括客觀維度上的黃金題項,會由每個站點在週期性地進行評分。這是最核心的機制,因為它直接產生可比的數值。如果沒有共享題項批次,站點層面的一致性差異就會與題項難度差異混淆,從而毫無意義。
按評分者進行時間維度追蹤。對評分者的群體一致性進行持續時間維度的跟蹤,而不僅僅是單次測量。如果某評分者在數週內其客觀維度的準確性持續下降,那麼其評分就出現了漂移,無論其絕對數值是否仍高於閾值。這能在其表現於交付前就發現疲勞和捷徑形成的問題。
站點層面的分歧監控。如果某個站點在主觀維度上的評分持續且一致地偏離網絡整體,這值得深入調查。這可能是真實的文化信號,此時應將其記錄為真實信號;也可能是本地指南解釋的形成,屬於帶有本地口音的漂移,需要在團隊負責人層面進行糾正。
帶有時間間隔的重複題項。這一機制使用不足,但具有真正的診斷價值。將同一題項對同一評分者在數週後重復使用,並測量其自我一致性。如果某評分者在多數情況下與早期判斷相矛盾,那麼其並未產生穩定偏好信號。
最後一個機制關聯到一個應讓本領域所有從業者深思的發現。2026年的一項無意識偏好交換研究發現,91%的被悄悄交換的偏好未被做出該選擇的個體察覺。
相關研究分析了PRISM和PluriHarms,探討了同一標註員對語義相似的提示語給出不同評分的現象,認為部分標註響應可能根本無法代表穩定的內在偏好。
如果某評分者未能察覺自己選擇的反轉,那麼‘每個偏好標籤都代表一個固定內部值’這一假設的可靠性,遠低於大多數流程所認為的程度。這要求我們測量自我一致性,按偏好強度加權,並誠實地說明哪些比較真正具有信號意義。
我們實際上對評分者所採取的措施
結構能捕捉漂移。防止漂移的關鍵在於如何構建和維護評分群體。
招聘應面向市場,而非僅僅面向語言。一個評判印尼用戶語氣恰當性的評分員應當是印尼本地人,而不是一個在海外生活十五年的流利印尼語使用者。在那些存在合理差異的維度上,文化契合度至關重要。
將評分員的族裔特徵作為數據集元數據進行記錄。包括國家、語言變體、年齡區間,以及項目中定義了分析用途的任何其他屬性,均需在知情同意的前提下收集。否則,客戶後續無法判斷某種偏好模式是真實人口觀點的反映,還是僅由當時在崗人員構成的產物。
輪換校準,而非輪換評分員。高評分員流動率會以一種分類一致性無法抵消的方式破壞偏好的一致性,因為新評分員帶來的是全新的先驗知識,而非僅僅需要學習一條規則。在偏好工作領域,保留評分員比任何其他環節都更為重要。
進行跨站點分歧審查,而不僅僅是單站點內部審查。當兩個站點在主觀維度上出現分歧時,審查應包含來自兩個站點的評分員。通常,審查結果並非達成解決,而是記錄發現該維度具有文化差異性,這對客戶而言比強行達成共識更有價值。
保持分佈情況,而不僅僅是彙總結果。當客戶的流程支持時,應同時交付完整的標籤分佈和彙總偏好,以保留單一標量所丟失的信息。獎勵建模文獻正日益轉向分佈性和群體感知的方法,正是出於這一原因。
什麼是優質表現
一個在分佈式網絡中運行良好的偏好項目,應按維度和站點分別報告如下內容:
客觀維度的一致性,應保持高且穩定;主觀維度的一致性,會較低,並需監控其變化而非穩定水平;每個評分員在客觀維度上的時間趨勢;重複項目的自洽率;站點層面的分歧模式,需標記並分類為文化信號或漂移;以及評分員的族裔構成,以便客戶瞭解其購買的是哪些人群的偏好。
這是一份比單一準確率數值更復雜的報告。它也是唯一能讓客戶判斷他們所訓練的偏好數據是否真正代表了他們所面向的用戶群體的版本。
Lifewood將這項工作通過分佈式網絡進行,而不是集中處理,並非主要出於成本考慮,而是因為一個在三個國家收集的偏好數據訓練出的獎勵模型,會編碼這三個國家的規範,而一個在全球部署的客戶通常希望在實際接觸用戶之前就瞭解這一點。
關鍵要點
- 在偏好標註中,追求儘可能高的共識會破壞獎勵模型本應學習到的多樣性。某些分歧是正當的價值多元性,而非錯誤。
- MultiPref項目包含10,000個偏好對,由四位標註員各自評分,其加權二次Cohen's kappa值為0.268,約39%的偏好對錶現出分歧。
- 自Aroyo和Welty的研究以來,已有研究證明,標註員之間的分歧反映了語義模糊性、主觀解讀和價值多元性,而不僅僅是測量誤差。
- 核心問題在於區分漂移(一種缺陷)與合法的多樣性(即數據本身),二者在共識統計指標中表現完全相同。
- 有效機制是將規範拆分為客觀部分——當共識較低時意味著存在漂移——和主觀部分——此處的多樣性應被記錄而非強行解決。
- PRISM研究發現,在來自75個國家的1,500名參與者中,對齊偏好具有主觀性和情境依賴性。
- CulturalFrames報告的國家層面Krippendorff's alpha值為0.24至0.42,而CUBE的範圍為0.09至0.及0.58。
- 跨站點的一致性目標應按維度設定。在事實準確性上達成一致是合理的;而在語氣恰當性上達成一致則要求各國達成文化判斷的一致。
- 漂移監控使用各站點之間的共享校準集、單個評分員的時間序列跟蹤、站點層面的差異監控以及具有時間間隔的重複項目。
- 2026年的一項無意識偏好交換研究發現,91%的被悄悄替換的偏好未被察覺,這說明需要測量自我一致性,並根據偏好強度進行加權。
- 評分員實踐:應根據市場而非僅語言招募評分員,將文檔人口統計信息作為元數據記錄,優先考慮保留評分員,進行跨站點分歧審查,並保持標籤分佈。
- 一個集中在少數國家的評分員池,並被聚合到單一獎勵信號中,會將這些國家的規範輸出到模型服務的每一個市場。
資料與進一步閱讀
- 王等,"分歧偏好:當評分員產生分歧以及模型是否知曉?"(arXiv),在MultiPref、HelpSteer2上,0.268的加權二次kappa值和39%的分歧率
- Kirk等,PRISM,引自《Hidden Consensus: Preference-Validity Compression in Human Feedback》(arXiv),關於來自75個國家的1,500名參與者之間的主觀性和情境依賴性偏好,以及Aroyo和Welty和Basile等人關於分歧遠超噪聲的研究
- "CulturalFrames: 評估文本到圖像模型和評價指標中的文化期望一致性" (arXiv),在國家層面的Krippendorff's alpha和Fleiss kappa範圍與CUBE和CultDiff進行對比
- "立場:RLHF可能無法反映真實偏好" (arXiv, 2026),關於PRISM和PluriHarms中的偏好不一致性分析以及獎勵建模中爭議性判斷的處理
- Hash Block, "當RLHF標籤悄然漂移時" (Medium, 2026),報告了2026年選擇盲視發現91%的偏好交換未被檢測到,並涉及偏好強度加權
- "在大語言模型中實現獎勵魯棒的RLHF" (arXiv),關於專家與外部標註員群體在偏好一致性測試中的比較方法
- Hershcovich等, "跨文化自然語言處理中的挑戰與策略", ACL 2022,被用於標註員間一致性度量文獻中
- Lifewood公司時間線,關於2023年首個大語言模型和RLHF項目以及交付網絡