跳轉到主要內容
AI 數據

如何構建能夠教會模型展示其推理過程的推理軌跡數據

簡短回答。結果監督僅告知模型其答案錯誤,但未指出哪一步出錯,因此長軌跡在單一負向信號下收集了大量正確步驟。流程獎勵模型……

Mumu D. · 2026年9月2日 · 閱讀約 13 分鐘

簡短回答。 結果監督會告訴模型其答案是錯誤的,但不會指出是哪個步驟出錯,因此長軌跡會收集大量正確步驟以應對一個負向信號。過程獎勵模型通過評分中間步驟而非最終答案來解決這一問題,需要步驟級標註——每條示例的成本更高,監督效果顯著更強。由於 Lightman等(2023年) 證明,有效的PRM訓練僅需識別 第一個錯誤步驟;在此之前的所有步驟都由構造確保是正確的。 OmegaPRM 通過二分搜索而非標註每一個步驟來找到該步驟。


這是否教會模型展示其思考過程?

這裡是一個問題的簡潔表述,也是這個領域存在的根本原因。

當一個模型通過十二步推理得出錯誤答案時,結果監督會告訴它答案是錯誤的。但它不會說明是哪一步推理出了問題。

研究文獻對此有更精確的表述:僅基於結果的監督,在最終答案錯誤時,幾乎無法提供關於哪些中間步驟是有幫助的信息。而在強化學習設置中,如果驗證器只檢查最終答案,那麼長推理鏈會產生大量獲得相同結果獎勵的樣本,這種現象會削弱學習信號,以至於模型無法區分是偶然猜測還是真正合理的推理。

解決方法是標註每一步。這聽起來顯而易見,但在實際操作中卻非常困難,因為它需要一種標註形式,而大多數數據項目並未為此設計相應的標註流程。


結果與過程的區別,以及這一區別的關鍵性

這兩類獎勵模型構成了這一問題的理論基礎。

結果獎勵模型(ORMs)評估最終答案。標註成本低,因為只需要判斷結果是否正確。監督信號是針對整個推理鏈的單一比特。

過程獎勵模型(PRMs)評估中間推理步驟的正確性,而非僅依賴最終答案。它們已被用於重排序、搜索和測試時擴展,通過評估推理過程本身的質量來實現這一目標。

這項交易非常直接,值得明確指出:逐步標註每個示例的成本高於結果層面的標註,但能產生顯著更強的推理質量監督信號。

還有一個更細微的好處往往被忽視。僅基於結果進行訓練的模型可能會通過不成立的推理路徑得出正確答案,因為訓練信號中沒有任何部分會懲罰錯誤路徑。過程監督使得可見的推理變得可信,而非僅僅裝飾性。


使這一方案可行的發現

如果對每一條軌跡中的每一個步驟都進行標註,成本將變得不可承受。Lightman及其同事在2023年的一項研究顯著改變了經濟性,這是在規劃此類工作時最需要了解的單個關鍵內容。

有效的PRM訓練僅需識別完整思維鏈中第一個錯誤步驟。一旦找到第一個錯誤,所有前置步驟均被標註為正確,所有後續步驟則被標註為錯誤。

這將一個全面的標註任務轉化為一個搜索問題。而搜索可以被優化:OmegaPRM(Luo等,2024)採用二分搜索來定位第一個錯誤步驟,減少了所需的評估次數,正如作者所描述的,它在不標註每個步驟的情況下模擬了人工標註過程。

對於一個十二步的軌跡,二分搜索意味著大約四次判斷,而非十二次。在大規模應用中,這種差異就是可行項目與不可承受項目之間的分水嶺。


標註員的畫像實際上完全不同

這是最與任何委託此項工作的人員相關的一部分,也是推理軌跡程序最容易失敗的地方。

標註推理軌跡需要一種與標準標註任務截然不同的標註員畫像。這一要求是明確的:標註員需要具備足夠的領域專業知識,以驗證每個推理步驟是否正確,而不僅僅是最終答案與已知輸出匹配。

具體來說這意味著什麼?數學推理軌跡需要能夠識別出第七步對錯誤數量應用了有效操作的人。代碼推理軌跡需要能夠發現邏輯正確但循環邊界偏移一位的人。法律或醫療領域的推理軌跡則需要具備該領域資質的專業人員。

這並非大多數標註程序所使用的‘標註’意義上的標註。這屬於專家評審,應當配備並相應定價。一支被招募和培訓用於邊界框或情感標籤任務的團隊無法勝任,將他們分配到該任務上會產生看似完整但實際上無法為模型提供任何有效訓練的數據庫。

實踐中使用的標籤集區分了四種狀態,而非二元狀態:

推動推理進程的正確且必要的步驟;正確但冗餘的步驟,因為冗餘是生成推理中的真實質量問題;錯誤的步驟;需要額外信息才能驗證的不完整步驟。

使其可靠的方法論要求是:每個步驟都由一位合格評審員獨立標註,該評審員在不參考最終答案的情況下單獨評估該步驟。

這種獨立性就是紀律。一個知道最終答案正確的評審員會無意識地為有缺陷的中間步驟進行合理化,而一個知道答案錯誤的評審員則會尋找並發現並不存在的錯誤。在步驟評審過程中隱藏最終結果,正是確保標籤真實性的關鍵。


質量優於數量,原因異常直接

在大多數數據工作中,'質量優於數量'是一種建議。在這裡,它是一種機制。

一個包含低質量或邏輯錯誤的推理軌跡的大型數據集,會訓練模型復現這些錯誤。

模型並非學習如何得出答案,而是學習模仿推理過程,它會模仿你提供的任何推理,包括那些錯誤的推理。

有兩個質量維度,它們方向不同。

每一步的準確性與邏輯一致性是關鍵的質量要求。這是底線。

推理路徑的多樣性對泛化能力至關重要。在狹窄的推理模式集上進行訓練,會產生對需要不同方法的問題極為脆弱的模型。因此,一千條都以相同方式解決問題的推理軌跡,不如五百條以五種不同方式解決問題的推理軌跡。

矛盾在於,獲得高質量推理軌跡最簡單的方法是使用一個強大的模型配合固定提示模板生成,這恰好會產生狹窄且同質的推理,限制了泛化能力。多樣性必須刻意設計,而不是期望自然產生。

衡量程序是否有效運行的指標:在全面標註開始前,基於校準集對步驟正確性標籤進行的高標註員間一致性測量。這與任何標註程序中的原則相同,但應用於更復雜的判斷。如果兩位合格專家對第七步是否正確存在分歧,那麼要麼該步驟本身確實存在歧義,要麼關於何為‘步驟’的指導原則不明確。這兩點都必須在擴大規模前得到解決。


這能否被自動化?部分可以,但存在真實限制

人工標註是瓶頸。正如一篇2026年的論文所指出,依賴人類對數據進行標註,是擴展過程級數據集過程中的一個重要瓶頸,而對細粒度步驟獎勵的標註通常需要人類專家或高性能模型,無論哪種方式,都耗費大量人力且成本高昂。

已有多種自動化方法,瞭解每種方法實際做了什麼很有價值。

基於展開的估算。MathShepherd 從部分推理鏈開始生成完整解答,並測量達到正確答案的百分比,以此作為該步驟的評分。有效,但需要大量計算資源。

基於展開的二分搜索。OmegaPRM 結合了展開評估與二分搜索,以定位第一個錯誤步驟,從而大幅降低計算成本。

信息論標註方法。2026年的一項框架定義了蒙特卡洛網絡信息增益,用於構建步驟級監督,生成結構化推理輸出,通過任務特定函數驗證最終答案,並從信息增益中推導出步驟標籤。

對比方法。CPMI 量化了在每個步驟上正確答案與錯誤答案預測概率的對比變化,作者認為這消除了對繁瑣的人工標註和昂貴的蒙特卡洛展開的依賴。他們構建了 CPMI-80k,一個包含8萬條步驟級監督數據的示例集,源自 Math-Shepherd。

完全避免使用獨立的獎勵模型。ProcessThinker在ICLR 2026上發表的工作,將推理軌跡重寫為帶步驟標籤的格式,用於冷啟動微調,然後應用GRPO方法,採用基於流程的獎勵機制,從每個中間步驟中採樣多個後續路徑,並以實際成功率為步驟獎勵。其動機是,訓練和維護一個獨立的PRM會增加工程開銷,並可能在PRM與最終策略之間引入不匹配。

現在是需要警惕的幾點,這些觀點始終被報告,卻很少被強調。

依賴蒙特卡洛回放或MCTS風格搜索的自動化方法可能具有噪聲性,並對"步驟"的定義非常敏感。這一點尤為重要:步驟的定義是一個設計決策,而非數據的固有屬性,自動化方法繼承的是你所採用的分段方式的定義。

還有一項值得關注的發現,關於哪些步驟實際上值得標註。關於步驟熵作為推理軌跡中冗餘性和可壓縮性的度量研究顯示,並非所有步驟對預測能力的貢獻都相等。

因此,對所有步驟進行均勻標註是低效的,一個關鍵問題是哪些步驟承載了有效信號。

由此形成的務實立場:自動化用於覆蓋範圍和數據量,人工專家審核用於校準集、模糊案例以及那些錯誤步驟會產生實際後果的領域。這與任何嚴肅數據項目所採用的架構是相同的。


多語言維度,以及一個真正令人鼓舞的發現

大多數推理軌跡工作都是在英語和數學領域進行的,這有其可理解的原因:答案可驗證、資料豐富、專家資源充足。

這裡有一個值得知曉的結果,其方向與本系列中大多數多語言研究發現相反。關於跨語言泛化性的研究發現,基於中文推理數據進行強化學習,不僅提升了中文表現,還在德語、西班牙語和孟加拉語的評估中實現了顯著提升,遠超在相同數據上進行監督微調所取得的效果。相關研究指出,與事實記憶不同,推理能力在不同語言之間具有極佳的可遷移性。

這確實是好消息,它改變了投資決策。一種語言中的事實知識並不能直接轉化為另一種語言中的事實知識。但教會模型進行仔細推理,似乎是一種更通用的技能。

由此產生兩個實際意義的推論。

推理軌跡投資在跨語言回報方面優於大多數數據投資。如果預算必須做出選擇,那麼在一個語言中進行過程監督所帶來的收益,遠超過知識數據投資的收益。

但它並不能覆蓋所有情況。依賴本地情境、法規、單位、慣例或術語的領域推理,仍然需要針對每個市場單獨構建。例如,一個引用某國藥品名稱的臨床推理軌跡,或引用某國稅收政策的金融推理軌跡,無論其底層推理能力多麼出色,都無法實現跨語言遷移。


這與我們自身工作的關聯

聲明利益:Lifewood 將此項工作作為其 AI 數據服務的一部分,與強化學習反饋(RLHF)和偏好數據一同開展,並在 50 多種語言中實施人工參與閉環審查。

從這一視角出發,我有兩個觀察結果,我認為這些結果獨立於具體執行方,都是有用的。

第一個是關於人員配置的觀察。推理軌跡標註打破了標準標註操作模式。你無法通過招募一個通用人群、培訓他們遵循指南並進行規模擴張來實現。你需要的是具備特定領域知識的審核員,這意味著需要不同的招聘渠道、不同的薪酬區間、每個領域可獲得的審核員數量更少,且上手週期更長。

在標註流程中為推理軌跡分配預算的項目,通常在幾週後就會發現這一問題,其常見結果要麼是質量崩潰,要麼是重新協商預算。

第二個問題涉及校準。關鍵的衡量指標是不同標註員對步驟正確性的共識程度,該共識是在擴標前基於校準集建立的。根據我們的經驗,在推理任務上的首次校準輪次中,團隊通常會發現共識程度低於預期,而原因幾乎總是源於步驟的分割:兩位專家對第幾步是否正確存在分歧,往往是因為他們對第幾步的起始位置存在不同理解。明確步驟定義能夠解決比重新培訓標註員更多的分歧。

這與任何標註項目中的發現都是一致的,這令人意外地令人安心。該領域更難,評審人員更昂貴,但其操作流程是完全相同的。


如果正在規劃此類項目,應如何操作?

明確什麼是步驟,並將其寫下來並附上示例。這一單一決策將決定標註的一致性、自動化標註的可靠性以及結果的可比性。

採用首錯識別而非全面標註。Lightman及其同事已證明,這足以有效支持PRM訓練,且通過二分搜索可實現高效執行。

招募領域專家而非普通標註員。並相應地安排預算,包括更長的適應期。

將步驟獨立於最終答案進行評判。這是保持標籤真實性的關鍵控制措施。

運行校準集並在放大前測量步驟級的一致性。首先將其視為分割問題,其次再視為訓練問題。

刻意設計路徑多樣性。使用一個模型和一個模板生成軌跡,會產生同質化的推理過程和脆弱的結果。

應利用自動化實現覆蓋範圍,而用人類處理複雜案例,而不是在兩者之間做出選擇。

不要假設結果正確就意味著過程正確。一個通過錯誤推理最終得出正確答案的軌跡,是一個帶有正面標籤的負面訓練樣本,是數據集中最具破壞性的記錄類型。


關鍵要點

  • 結果監督僅告訴模型答案是錯誤的,但並未指出是哪個步驟出錯。在僅基於結果的強化學習中,長軌跡會產生大量獎勵相同的樣本,從而削弱學習信號。
  • 結果獎勵模型評估最終答案;過程獎勵模型評估中間步驟,並支持重排序、搜索和推理時的擴展。
  • 步驟級標註每個示例的成本高於結果級標註,但能顯著提升對推理質量的監督強度。
  • Lightman 等人(2023)證明,有效的 PRM 訓練僅需識別第一個錯誤步驟:在此之前的所有步驟被標記為正確,之後的所有步驟被標記為錯誤。
  • OmegaPRM採用二分搜索定位首個錯誤,降低評估成本,且在無需標註每一步的情況下模擬人工標註。
  • 推理軌跡標註需要一種根本不同的標註員畫像,其需具備足夠領域的專業知識以驗證每一步,而非僅檢查最終答案。
  • 實際的標籤集合包含四種狀態:正確且必要、正確但冗餘、錯誤,以及信息不完整需進一步補充。
  • 每一步應獨立判斷,且與最終答案相隔離,因為知曉最終結果會雙向偏倚對步驟級評審的判斷。
  • 大量邏輯錯誤的推理軌跡數據訓練模型復現這些錯誤,模型模仿推理過程,包括不良推理。
  • 推理路徑的多樣性對泛化能力至關重要;狹窄的模式覆蓋會生成脆弱的模型,多樣性必須被主動設計而非默認假設。
  • 在完整標註前,基於校準集對步驟正確性的高標註員間一致性,是表明該流程產生可靠監督的信號。
  • 自動化方法包括MathShepherd的模擬運行、OmegaPRM的二分搜索、蒙特卡洛網絡信息增益、CPMI對比標註(基於CPMI-80k數據集)以及ProcessThinker在ICLR 2026提出的無需PRM的方法。
  • 依賴回滾或MCTS的自動化方法可能噪聲較大,且對步驟定義非常敏感,同時維護獨立的PRM會帶來工程開銷和潛在策略不匹配問題。
  • 步驟熵研究顯示,並非所有步驟對預測能力的貢獻都相等,因此均勻的標註投入效率低下。
  • 推理在跨語言遷移方面優於知識遷移:在中文推理數據上進行強化學習,在德語、西班牙語和孟加拉語評估中均取得了顯著提升。
  • 依賴本地法規、單位、慣例或術語的領域推理,無論是否存在遷移,仍需針對每個市場進行單獨工作。

資料與進一步閱讀

常見問題

結果監督僅標註最終答案,為整個推理鏈提供一個信號位;流程監督標註中間步驟,雖然每個示例的成本更高,但能告知模型其推理過程中的哪一部分失敗。

不需要。Lightman及其同事已證明,有效的流程獎勵模型訓練僅需識別第一個錯誤步驟,此後前面的步驟標記為正確,後面的步驟標記為錯誤。二分搜索能高效地找到該步驟。

因為驗證一個推理步驟需要具備足夠領域的專業知識,以判斷該步驟是否正確,而不是僅僅判斷最終答案是否匹配。數學或代碼追蹤需要能夠識別對錯誤數量應用了有效操作的人。

因為知道結果會雙向地偏見評審。知道答案正確的評審員會為有缺陷的步驟進行合理化;知道答案錯誤的評審員則會發現並不存在的錯誤。

部分可以。基於展開、信息論和對比的方法都已存在,並能減少人工標註成本,但它們存在噪聲,且對步驟定義方式敏感。實際架構採用自動化實現覆蓋範圍,而由專家人工進行校準和處理難題案例。

優於大多數數據類型。研究發現,在中文推理數據上進行強化學習,顯著提升了在德語、西班牙語和孟加拉語上的評估表現,表明推理能力比事實知識更具可移植性。然而,與特定領域相關的推理仍需根據市場本地化背景進行構建。

正在規劃 AI 項目或提升品牌可見度?

從 AI 評估、人工參與審核,到 GEO 與 AEO 策略,我們的團隊幫助你穩妥落地項目,在 AI 搜索時代獲得更多關注。

聯繫我們的團隊