簡要回答。在特定條件下會發生,而且條件至關重要。Shumailov及其同事於2024年在《自然》發表研究,指出不加區分地使用遞歸生成內容訓練生成模型——每一代都學習上一代的輸出——會導致模型崩潰:分佈尾部首先消失,隨後輸出趨於狹窄、低方差的範圍。有目的地使用合成數據,將其與真實數據混合、進行質量篩選,並以人工核驗的材料為基礎,是正常且有效的技術。失敗情形是從越來越多由機器撰寫的網絡內容中,無意間積累未標記的合成數據;多數組織即使沒有主動選擇,也可能暴露於這種風險。
無論是合成數據還是真實數據,並非在所有情況下都更優。真實數據能夠捕捉到真實世界的複雜性——傳感器噪聲、意外行為、自然發生的邊緣情況、文化差異——是判斷合成數據保真度的基準。然而,真實數據也昂貴、耗時、有時稀缺,且常常涉及敏感信息。相比之下,合成數據具有可控性,可以輕鬆調整且隨時可用,還能復現其生成器的偏見,同時看起來完全真實。
因此值得回答的問題不是哪種數據更好,而是生成數據在何種條件下會劣化模型的學習效果。這個問題已有公開發表的答案。
《Nature》論文實際上展示了什麼內容
2024年7月,Shumailov、Shumaylov、Zhao、Papernot、Anderson 和 Gal 在 Nature(第631卷,第755–759頁)上發表了題為《當生成模型在遞歸生成的數據上訓練時會發生模型崩潰》的論文。實驗設置部分值得精確理解,因為該結果的流行總結比實際結果更為寬泛。
研究人員訓練了一個模型,用該模型生成數據,再用生成的數據訓練下一代模型,並重復此過程。在連續的幾代中,輸出分佈逐漸變窄。低概率事件——即分佈的尾部——最先消失,因為它們在任何有限樣本中都代表性不足,因此下一代模型所學習的內容中也缺乏代表性。隨著代數的增加,分佈最終收斂到一個遠比原始數據方差更小的狀態。作者的結論是:如果在真實數據和生成數據的混合體上無差別地訓練生成式人工智能,例如在從互聯網上抓取數據時發生的情況,就會導致模型生成多樣化、高質量輸出的能力崩潰。
模型崩潰很難察覺,因為它始於尾部。模型失去生成罕見但有效輸出的能力,仍然在平均表現、常見案例和整體基準測試中表現良好。直到一個主要指標發生變化時,大量的多樣性早已喪失——這說明我們應專門評估罕見案例,而不是依賴平均值。
該結果也受到了批判性審視,這是正常且有益的。一篇發佈在 arXiv 上的筆記(預印本 2410.12954,2024年10月,未經同行評審)指出,原始實驗設置中的某些假設會影響結論的普遍性。誠實實踐者的立場是:這一機制是真實且有充分動機的,其在任何具體流程中的嚴重程度取決於該流程如何管理數據,而適當的應對措施是加強數據管理,而非恐慌或全盤否定。
在什麼情況下合成數據是合適的選擇?
合成數據並非在所有應用場景中都是真實數據的退化替代品。在某些情況下,它直接更優,將崩潰結果視為普遍禁令並放棄這些情況,是毫無益處的。
| 用例 | 合成數據為何有效 | 條件 |
|---|---|---|
| 罕見事件 — 事故、故障、危險 | 真實案例稀少,危險或不道德去收集 | 必須與現有的真實案例進行驗證;絕不允許僅憑合成數據定義類別 |
| 涉及隱私的領域 | 從訓練集中移除個人記錄 | 驗證合成數據不會從其源中洩露可識別屬性 |
| 類別平衡 | 以低成本擴充少數類樣本 | 限制合成數據的份額,並檢查少數類行為是否真正得到改善 |
| 用於感知與機器人領域的模擬 | 真實基準、無限變化、可控條件 | 明確測量仿真與現實之間的差距,並通過真實驗證數據加以縮小 |
| 從更強模型中蒸餾 | 有意地從已知的高質量教師模型中遷移 | 並非遞歸自訓練——教師模型優於學生模型,且模型傳承路徑是已知的 |
| 格式與結構 | 模板和結構化變體正確生成的成本較低 | 內容仍需人類參與錨定;結構並不等同於實質內容 |
右側列中的規律:當合成數據的傳承路徑已知且與真實數據錨定時,它是安全的;當它未經標註、被大量積累,並僅通過其他合成數據進行驗證時,它是危險的
在此處值得放棄的一個假設:合成數據並不自動意味著私密性。NIST已強調,許多合成數據技術並未提供正式的隱私保障,因此當隱私是目標時,必須評估生成方法及其殘留風險,而不是簡單地因為數據是人工生成的就將其忽略。
沒有人選擇的暴露
大多數閱讀關於模型崩潰的組織認為這不適用於他們,因為他們並不訓練基礎模型。這種暴露是間接的,且比人們想像的更為普遍。
- 爬取語料庫。 任何在2023年之後從開放網絡收集的數據集,都包含未知比例的機器生成文本,且未標註。即使沒有這個意圖,對其進行微調也會形成遞歸訓練。
- 在自身輸出上進行微調。 那些發佈AI輔助內容並隨後在其已發佈語料庫上進行微調的團隊,已經建立了一個沒有外部錨點的微小遞歸循環。
- 被生成內容汙染的評估集。 從網絡文本構建的基準測試中可能包含生成內容,這會偏袒那些生成相似文本的模型。
- 標註錨定於模型建議。 在沒有獨立控制批次的情況下接受模型輔助標註,將預標註模型的分佈編碼進數據集——這與從另一方向達到的機制相同。
- 檢索語料庫。 一個檢索增強系統,其索引中充滿了機器撰寫的頁面,會檢索到機器撰寫的答案,而完全不需要任何訓練。
共同的因素是缺乏來源追溯。如果知道哪些項目是人工撰寫的、哪些不是,那麼這些情況都不會危險,因為可以對它們進行加權、過濾或排除。一旦這種信息從未被記錄,所有這些情況都會變得危險——這從實踐角度提出了與法律層面完全獨立的來源追溯必要性。
一個相關的陷阱存在於評估環節:如果同一類模型既生成數據又評判數據,系統就會獎勵其自身的假設,而這種循環性在內部評分中是不可見的。
在不降低模型性能的前提下使用合成數據
目標是進行有意識的、具有明確來源的組合,而不是要麼完全避免使用合成數據,要麼在不知情的情況下積累合成數據。
- 為每個項目標註其來源。 人工編寫、模型生成、模型輔助或未知。‘未知’是一個合理且重要的類別——必須記錄它,而不是默認將其視為人工內容而沉默處理。
- 將混合數據錨定在已驗證的人類數據上。 保持一個規模可觀、精心篩選的人類編寫且人類驗證的核心數據集,即使合成數據量增加也不縮減。這正是防止分佈偏移的關鍵,且隨著開放網絡作為數據來源的可靠性下降,其價值會不斷提升。
- 設定並強制執行合成數據比例。 每次訓練運行和每個領域都應明確決定該比例,並予以記錄。一個未經選擇的混合數據,一旦行為發生變化,就無法被調試。
- 以質量而非僅有效性為篩選標準。 生成內容雖然結構正確但內容泛泛的,正是這些內容導致了分佈範圍的收縮。相比僅過濾正確性,過濾多樣性和信息量更為重要。
- 在尾部情況上進行評估。 專門構建評估集,涵蓋罕見案例、少數類別和邊緣條件。聚合指標在系統早期階段的崩潰中保持穩定;而罕見案例的表現則不會。
- 保持一個未受干擾的真實數據留存集。 一個由人工編寫的評估集,僅收集一次,從未用於訓練,也未被重新生成或增強。它是跨越模型迭代的所有穩定參考點。
- 對數據進行版本控制,而不僅僅是模型。 記錄每種數據混合生成了哪個檢查點。當行為退化時,數據構成通常是原因,如果未記錄下來,這種退化是無法恢復的。
合成數據佔比 = 機器生成數據項數 ÷ 混合訓練數據項總數
正確的比例是針對目標任務通過實驗確定的,而不是由普遍規則決定——並且應在合成數據添加到的各個段落上報告其段級性能。如果這些段落沒有變化,那麼增強操作除了改變數據分佈外,實際上什麼也沒做。
這對大規模發佈內容的任何人意味著什麼
存在一個二級含義,這對內容產業尤其令人不適。如果開放網絡充斥著機器生成的內容,那麼模型學習的語料庫將退化,而生產這些內容的組織正成為退化問題的一部分。大規模發佈流暢、通用且未經驗證的內容,不僅是一種薄弱的營銷資產,更是對集體問題的微小貢獻。
積極解讀是,這提升了兩類由生產者控制的內容的價值。第一,人工驗證的內容:原創數據、一手經驗、真實專業知識、真實市場語言工作——這些內容之所以有價值,正是因為它不是對已有內容的簡單複製。第二,來源標記,它允許下游整理者幾乎無需額外成本,在導出時區分哪些內容是機器生成的,哪些是人工撰寫的。
Lifewood的應對方式
Lifewood 位於這一問題的兩個方面:它收集並標註人工編寫的訓練數據,同時也根據人工指導生成人工智能內容。在兩個方向上都應用的規則是——來源被記錄而非被假設,人工驗證是錨點,經過雙重人工參與閉環審查,其準確率保持在 95%以上。這一錨點之所以能夠實現,是因為其背後網絡的支持:50多種語言,覆蓋30多個國家的40多個交付中心,以及 56,788 名貢獻者,這正是生成真正原創人類內容而非簡單重用網絡文本所必需的規模。
參見 全球AI數據,AI數據驗證,購買指南:RLHF、SFT或蒸餾(針對有明確教師的情況),以及 AIGC治理、披露與來源追溯。
資料與進一步閱讀
- Shumailov, I., Shumaylov, Z., Zhao, Y., Papernot, N., Anderson, R. 和 Gal, Y.,《AI模型在遞歸生成數據上訓練時會發生崩潰》,Nature 631, 755–759, 2024年7月。
- 《關於Shumailov等人(2024)的說明》,arXiv預印本 2410.12954,2024年10月 —— 一種批判性評論,未經同行評審。
- NIST,差分隱私合成數據 —— 說明合成記錄在本質上並非隱私保護的。