簡短回答。 橫向大語言模型訓練數據構建了通用能力——覆蓋眾多領域、語言和任務類型的廣泛內容,大規模採集,以廣度和一致性為評判標準。縱向大語言模型訓練數據構建了領域專長——針對單一領域的深度、專家級內容,以合格專家的正確性為評判標準。企業幾乎總是需要兩者,而代價最大的錯誤是購買橫向大量數據,卻忽略了模型在縱向上的失敗:一個聽起來流暢但無法正確處理行業特定內容的模型,無法通過增加更廣泛的一般數據來修復,無論數據量多少。
兩個產品,一個標籤。‘大語言模型訓練數據’涵蓋由廣泛通用內容構成的語料庫和由合格專家在單一領域撰寫的語料庫,二者在數據來源、生產方、單條成本以及質量評估方式上存在差異。
本指南將二者區分開來,並提供一個診斷工具,幫助判斷你的模型實際需要的是哪一種。
一個表格中的區分
| 橫向 | 縱向 | |
|---|---|---|
| 目標 | 通用能力、廣度、魯棒性 | 領域專長與正確性 |
| 覆蓋範圍 | 多領域、多語言、多任務類型 | 單一領域、深入掌握 |
| 製片人 | 大規模的通用標註員和撰稿人 | 具備資質的領域專家 |
| 體量 | 高 | 相對於橫向水平較低 |
| 每項成本 | 更低 | 顯著更高 |
| 通過什麼來衡量質量 | 一致性、覆蓋一個分層計劃、校正機會的一致性 | 專家評審;事實準確性;實踐的時效性 |
| 主要風險 | 偏向於最容易獲取的內容 | 範圍過窄;在某個子領域內是專家,但在其他領域表現薄弱 |
| 修復 | 流暢性、格式、整體推理行為、語言覆蓋範圍 | 術語、流程、邊緣情況、監管細節 |
生產行是驅動一切的源頭。通用型生產可以規模化,而專業型生產則不能,其成本由專業知識的市場定價決定,而非標註率決定。
當你需要橫向數據時
- 模型整體表現較弱 —— 指令遵循能力差,格式不一致,推理能力在各個領域均較弱,而非僅在某一領域弱。
- 語言覆蓋範圍是差距所在。 一個在英語上表現良好但在其他市場退化的模型,需要在這些語言中具備原生生成的能力。
- 你是在訓練或大幅調整基礎模型,而不是對一個強模型進行微調。
- 問題出在魯棒性上——模型能夠處理預期的表達方式,卻會在不常見的變體上失效。
這裡的質量是關於覆蓋設計和一致性,而不是深度。反覆出現的失敗是語料庫過大且偏斜:過度包含容易獲取的內容,通常為新聞、百科全書和論壇文本,而對那些材料稀缺的領域和語言則嚴重不足。必須刻意進行分層,並報告各層的最小覆蓋比例,而不是平均值。
當你需要垂直數據
- 流暢卻錯誤。 模型生成自信且結構良好的輸出,其中包含從業者能立即察覺的錯誤。這是垂直知識缺口的診斷特徵,且無法通過通用數據得到改善。
- 術語漂移 — 在一般意義上正確使用一個術語,但在本領域中錯誤使用。
- 流程缺口——知道一個流程的名稱,但不瞭解其步驟順序或例外情況。
- 監管與貨幣問題——陳述一條在另一司法管轄區成立或曾經成立的規則。
- 只有從業者才能識別為重要的邊緣案例。
質量在這裡是 由合格人員判斷的正確性,這完全改變了數據來源的問題。三個要求:
- 經過驗證的專業能力。 專業資格需經過核實,而非自我聲明。演示只是上限:一個無法產出專家級輸出的撰稿人,所生成的數據會教導模型成為非專家。
- 時效性。 各領域在不斷變化。反映五年前實踐的語料庫會訓練出一個自信地過時的模型,對於時效性內容應建立定期審查機制。
- 地域與市場特異性。 受監管領域因市場而異。‘金融’並非一個領域;它是一個監管體系下的一個領域。
如何判斷你需要哪一種
在購買任何產品前,都應進行結構化的錯誤審查。抽樣真實失敗案例,並對每一類進行分類:
| 症狀 | 可能的差距 |
|---|---|
| 格式錯誤,忽略指令,內容雜亂 | 橫向 — 行為 |
| 英文表達正確,其他語言表達較差 | 橫向 — 語言覆蓋範圍 |
| 在多步問題上推理通常中斷 | 橫向 — 能力 |
| 表達流暢,但存在領域特定事實錯誤 | 縱向 |
| 術語正確,但具體領域含義錯誤 | 縱向 |
| 在某一司法管轄區正確,但在你們的領域錯誤 | 垂直 — 市場特異性 |
| 僅在少數輸入上失敗,其餘情況表現良好 | 要麼 — 在購買深度之前,先檢查覆蓋範圍 |
垂直領域錯誤佔比 = 特定領域錯誤數 ÷ 已審核錯誤總數
如果這個比率較高,總體成交量不會影響它;如果較低,則昂貴的專家級寫作是錯誤的選擇。一次評審需要幾天時間,通常會將預算提升一個數量級。
兩者如何結合
它們更多是順序進行,而非同時發生。
- 建立行為的橫向基礎。 首先關注格式、指令遵循和語言覆蓋,因為垂直數據無法修復一個無法遵循指令的模型。
- 增加垂直深度,精準針對評審發現的具體錯誤類別
- 為兩者分別構建評估集。一個通用基準無法檢測到領域退化,而一個領域基準無法檢測到通用退化。
- 重新測試是否存在干擾。 過度的垂直微調可能會損害通用能力;一個在特定領域表現優異但在其他方面表現更差的模型,是已知且可避免的結果,只有通過通用評估集才能發現這一點。
一個有用的預算分配經驗法則:垂直數據在被評判的領域內提升正確性,水平數據則提升模型整體可用能力。跳過水平層的項目會產出一個專家級但無法使用的模型;跳過垂直層的項目會產出一個令人愉悅但錯誤的模型。
向供應商提出的問題
- 你們實際上在內部生產的是通用規模生產、專業領域生產,還是兩者兼有?
- 垂直工作中的領域專業知識是如何驗證的?
- 你們的水平覆蓋分層計劃是什麼?每個分層的最低覆蓋比例是多少?
- 你們是如何保持垂直內容的時效性,以及更新頻率是怎樣的?
- 對於多語言工作,垂直內容是本地生產還是翻譯生成?
- 兩種內容的質量評估標準有何不同?我可以查看兩個數據嗎?
- 語料庫的產權歸屬是誰?我們可以完整導出它嗎?
紅燈信號: 一個混合價格涵蓋兩者,通常意味著專業工作由非專業人士完成;專業能力描述為自我聲明;缺乏語料分層計劃的橫向語料庫;在非英語市場生產的垂直內容是通過翻譯英語原始材料實現的,這會同時導入錯誤的司法管轄區。
Lifewood的應對方式
Lifewood 將兩者作為獨立服務交付,而非一個混合服務,因為它們是不同的生產問題:橫向大語言模型數據是規模與覆蓋度的運營,垂直大語言模型數據是專家資源的獲取操作,若價格相同,則意味著其中一個內容是由錯誤的人群完成的。
多語言維度貫穿於兩者,這也是交付模式最關鍵的部分:50多種語言,在30多個國家設立的40多個交付中心,以及56,788名貢獻者,意味著無論是廣度還是深度,都可以在本地生產,而非翻譯——對於垂直內容而言,這並非質量偏好,而是正確性的要求,因為翻譯後的領域語料會導入源市場的監管假設。更廣泛的LLM範圍包括RLHF、SFT、數據蒸餾和響應評估。AI語料庫的歷史可追溯至2004年,公司目前成立於2018年。
參見 類型B橫向大語言模型數據,類型C垂直大及模型數據,企業級大語言模型訓練數據 和 類型A數據服務。
資料與進一步閱讀
- 配套指南:RLHF, SFT 和蒸餾 以及 多語言大語言模型訓練數據。
- Lifewood 大語言模型訓練數據範圍已發佈於 lifewood.com/enterprise-llm-training-data。