跳轉到主要內容
B 類 —— 通用型 LLM 數據

類 ——
通用型 LLM 數據

通用型 LLM 數據,是基礎模型訓練所依賴的廣泛領域通用型語料——涵蓋各種模態的數據採集、標註及模型測試,而非僅聚焦單一行業。Lifewood 在 50 多種語言、40 多個交付中心構建這類數據,遵循 95% 以上的準確率服務承諾。

語音內容覆蓋 23 個國家,涉及 6 種項目類型及 9 個數據領域

為大語言模型訓練提供的 25,400 個有效小時的多語言標註語音數據

01

通用型 LLM 數據:目標、解決方案及成果

01 / 03
01

目標

目標

採集
Target

採集並轉錄來自 23 個不同國家(荷蘭、西班牙、挪威、法國、德國、波蘭、俄羅斯、意大利、日本、韓國、墨西哥、阿聯酋、沙特阿拉伯、埃及等)母語使用者的錄音。語音內容涉及 6 種項目類型及 9 個數據領域。累計有效時長達 25,400 小時。

23 個國家6 種項目類型9 個數據領域25,400 個有效小時

通用型 LLM 數據,一次講清楚

什麼是通用型 LLM 數據?

通用型 LLM 數據,是基礎模型訓練所依賴的領域通用型語料——它追求廣度而非專精,覆蓋各種模態及多種語言,而非深耕單一行業。它賦予模型通用能力,當目標是打造一個能力紮實的基礎模型、而非某一單一領域的專家模型時,通常會採購這類數據。

通用型數據與垂直領域數據有什麼區別?

廣度與深度之爭,二者的失效方式也不同。一個只在通用型數據上訓練的模型,在各個領域都能說得頭頭是道,卻在任何一個領域都稱不上權威;而一個只在 垂直領域數據 上訓練的模型,在其專精領域內是專家,但一旦超出這個領域就顯得脆弱不堪。大多數生產級項目會同時採購兩者,由通用型數據打好基礎,再由垂直領域數據進行專精化。

一個多模態數據集包含哪些內容?

文本、圖像、音頻、視頻及 LiDAR——難點不在於任何單一模態本身,而在於各模態之間的一致性。每種模態都有各自的工具、標註人員技能要求及失效模式,因此必須在全部五種模態上貫徹同一套質量標準。Lifewood 對每一種模態,都執行相同的 95% 以上準確率服務承諾及雙層審核,覆蓋 50 多種語言及 40 多個交付中心。

Frequently asked questions

通常比大多數買家預期的要多,而制約因素往往是質量而非數量。公開數據集通常只經過一輪處理、且未經分級,這正是為什麼前沿項目會轉而委託製作經過分級的語料庫:提示-回覆配對數據、RLHF 偏好排序數據,以及監督微調數據集,各自服務於不同的訓練階段。

提示-回覆配對數據教會模型如何作答;偏好排序數據則教會模型判斷兩個回答中哪一個更好。這是兩類不同的數據,對標註人員的要求也不同。一個只有廣泛覆蓋、卻沒有偏好數據的模型,能用每一種語言流利作答,卻沒有一種語言答得好——這是首輪訓練中最常見的短板。

可以,而且通常必須委託專門採集,而非直接獲取現成資源,因為幾乎不存在可用的公開語料。Lifewood 通過分佈在宿務、馬來西亞及孟加拉國等亞太樞紐的本地母語使用者進行採集,這是觸及那些沒有標準正字法、也沒有商業錄音資源的語種的唯一可靠方式。

評估數據依照與訓練數據相同的標準構建,並與訓練數據嚴格分離保管。預留評估集的意義,就在於模型從未接觸過它,因此兩者之間的汙染,正是需要嚴防的失效點——這也是為什麼數據供應與測試工作,要一併規劃,而非從不同供應商處分別採購。