簡短回答。 它經過七個階段,幾乎每個階段都需要人類參與。一句話語被說出並經同意後錄製,依據選定的正字法進行轉錄,由另一名說話者進行驗證,當評審者意見不一致時進行裁決,附上其來源追溯信息,與成千上萬的其他記錄混合進入訓練語料庫,最終以模型能夠理解他人以相同方式說話的能力形式迴歸世界。大多數開始旅程的錄音最終都未能完成這一旅程。
AI訓練數據實際上是從哪裡開始的?
是從一個人說出從未被記錄下來過的普通話語開始的,而不是從數據集、網絡爬蟲或API開始的。
從一句話開始。一位六十多歲的女性,在孟加拉國東北部錫爾赫特市外的一間廚房裡,被問到如何告訴別人最近的藥房的路線。她用她一生中一直使用的錫爾赫特語回答,大約用了八秒鐘,中間因為問題奇怪而發出一個小小的笑聲。
這八秒的片段就是AI訓練數據實際的起點,值得停下來思考為什麼它不可能來自其他地方。
錫爾赫特語在孟加拉國東北部、印度巴拉克谷地以及英國、美國和海灣地區的海外社群中大約有1100萬使用者。語言學家將其描述為邊緣化、政治上未被承認且研究不足,儘管互 intelligibility 有限,它仍普遍被視為孟加拉語的一種方言,這種狀況嚴重阻礙了對它的記錄和保護工作。孟加拉語本身在AI領域也處於資源不足的狀態,其地方變體則更進一步被忽視。
現有資源的規模很容易說明。一份已發表的錫爾赫特語、奇塔貢尼亞語和巴里薩利語的平行語料庫,每個方言大約包含1500個詞彙、130個句子結構和980個句子。後來的一項研究將錫爾赫特語和英語部分精煉為1500個句子對,每個句子均由母語者翻譯並相互校對。與英語中數萬億個標記相比,這種差距顯而易見。對於這種語言來說,互聯網並不是一個來源,人們才是。
在按下錄音按鈕之前,必須發生什麼?
需要一份規範說明、一個篩選流程、一次知情同意對話以及一個錄音設置。這八秒是容易實現的部分。
在那位女性被問到任何問題之前,已經由她從未見過的人們做出了幾項決定。
已制定規範。有人確定該項目需要的是自然口語而非朗讀句子,來自特定年齡段的說話者,在普通房間而非錄音室中,使用人們實際擁有的手機,涵蓋日常話題如方向、健康和金錢。
她已被找到並篩選。並非通過招聘網站。對於這種語言,貢獻者是通過本地網絡、社區組織以及已在該地區存在的交付團隊來接觸的。她已被檢查是否具備正確的方言,因為一個地區內的蘇萊蒂方言並不等同於另一個地區內的蘇萊蒂方言。
已獲得適當的同意。她已被告知錄音將如何使用、由誰保管以及如何撤回。這並非只是紙質文件。能夠識別說話者的語音錄音在多個監管框架下被視為生物識別數據,因此必須獲得明確的知情同意,才能使用這些數據。她的報酬事先已達成一致。
已設計好提示語。提示語是開放式的,以便她自然地交談,而不是按照一個會生成無停頓、無笑聲且缺乏真實語境特徵的朗讀式腳本的提示。
只有在那時,才會有人按下錄音鍵。而這正是第一次損失發生的時刻。門突然關上。文件被截斷。連接在上傳中途斷開。她中途切換到孟加拉語,這完全是自然的,可能滿足也可能不滿足規範要求。
當語音轉化為文本的那一刻發生了什麼?
必須做出關於該語言書寫方式的決定,而對許多語言而言,這一決定實際上存在真正的爭議。
該片段現在交由一名轉錄員處理,項目立即面臨一種在英語中從未出現的情況。
世界上約有7000種語言,其中大約3000種擁有已確立的書寫系統,這意味著大量語言以口頭形式為主:言語幾乎完全取代了書寫,承載了知識。蘇萊蒂語在此處處於一個特殊位置:它擁有自己的歷史書寫系統——蘇萊蒂納格里,可追溯至數個世紀前,同時它也用東納格里文字書寫,偶爾也使用拉丁字母書寫。存在三種選擇,不同社區各自偏愛其一,卻沒有統一的官方標準。
因此,在任何一個字被輸入之前,項目必須決定採用哪種規範,記錄這一決定,並始終如一地執行。若處理不當,數據集將自行製造不一致性:兩名轉錄員對同一個詞使用不同的拼寫,兩者都正確,模型卻學習到噪聲。
接著是日常的判斷問題,這些都無法由軟件做出。笑聲是否被標記?錯誤開頭是記錄還是被清理?當她為三個詞切換到孟加拉語時,是標記為語言切換,還是被默默標準化?一種地方性發音是寫成標準形式,還是如實記錄她說的發音?
每一個這樣的決定,都是關於模型將學習什麼的內容。在一個管理良好的項目中,這些問題的答案會提前寫下來,而複雜案例則交由資深母語者處理,而不是由十名不同的轉錄員以十種不同方式逐一解決。
誰來檢查工作,以及以什麼為標準?
由第二位母語者審查,當前兩位意見不一致時,再由第三位審查。這是成本主要所在、價值主要創造的階段。
轉錄文本現在進入審核環節。一位同一種語言的另一位母語者聽取音頻並閱讀文本,而有趣之處在於他們正在尋找什麼。
自動化檢查已經運行並通過。文件長度正確、格式正確、採樣率正確、不是重複的、不是靜音的。但這些都無法說明語音轉錄是否正確。
評審員只在說話者能察覺的方面進行檢查:是否正確聽出了一個詞、是否保留了地方方言或將其簡化為標準孟加拉語、是否按照指南處理了語言切換、說話者是否確實來自她被招募的地區。該領域的已發表研究恰好採用了這種模式。在前述的Sylheti基準測試中,翻譯由母語者完成並相互交叉驗證,兩名母語Sylheti說話者獨立評分,然後取平均值以減少個體差異。
當轉錄員和評審員意見不一致時,該案例將提交仲裁,且決策將附帶理由。這一細節正是區分一個項目持續改進與重複自身的關鍵。裁決會返回到指南中,因此接下來的百名轉錄員將繼承這一答案,而不是重新推導。
我們的八秒片段成功通過了這一流程。許多片段未能通過。在採集失敗、規格不匹配、知情同意缺失和評審失敗之間,大量錄製內容從未進入數據集。這種流失是正常的,為它預算就是區別一個項目能否交付與超支的關鍵。
一個單個片段攜帶了什麼?
遠不止音頻。錄音以元數據、知情同意記錄和自身質量歷史封裝後進入訓練流程,若缺少這些內容,幾乎無法使用。
當我們的片段被打包時,它攜帶了:
音頻本身,以及其技術屬性的記錄。經驗證的轉錄文本,使用了文檔化的正字法。
語音片段元數據:年齡組、性別、地區和語言變體,以便後續實現數據集的平衡與審計。
錄音條件:設備類型、環境、背景噪聲水平。知情同意記錄,將音頻片段與已記錄的許可和補償記錄關聯。其質量歷史:由誰進行轉錄、誰進行審核、是否經過裁定以及基於何種依據。
正是這個包使得音頻片段成為資產而非負債。購買訓練數據的買家越來越需要證明其來源,而不僅僅是聲稱其質量良好;即使音頻質量很高,缺乏可追溯的知情同意鏈條的數據集也存在風險。這些信息一旦形成,事後幾乎無法重建,因此必須在工作進行時立即記錄下來。
它還使得數據集後續可以被切分。當某個模型在某個地區對年長說話者表現不佳時,有人可以據此查明,因為元數據使這一問題變得可回答。
在像錫萊特這樣的地方可靠地建立這一體系,是一項物理層面的任務,而非軟件層面的任務。它需要實地人員,經過培訓、篩選和配備。自2021年起,Lifewood就在孟加拉國建立了語音AI數據運營和額外中心,正是出於這一原因:在地方語言中收集和驗證語音的工作無法從其他地方遠程完成。
模型實際上是如何使用這些數據的?
幾乎為零,單獨來看。它的價值是統計性的,而這正是整個數據集構成如此重要的原因。
我們的音頻片段現在加入了數百小時的類似錄音,並進入訓練階段。單獨來看,它不會產生任何可測量的變化。但與其他片段結合後,它實現了三項功能。
它教授語音模式:這些元音在該地區、該年齡段、通過電話、且風扇運行時的發音方式。
它有助於模型理解語言的構成方式,包括標準孟加拉語數據永遠無法提供的句法結構。
並且它微調了分詞器對‘普通’的定義,這影響了模型在整個生命週期中對語言的處理效率。
有兩個因素決定了這種貢獻是否有效。第一個是數量:當每種語言的token或小時數量低於某個閾值時,這種貢獻太薄弱而無法產生影響,語言最終會被列為支持但無法實際使用。
第二個是質量,而這裡的科研結果是積極的。多語言預訓練研究發現,經過質量篩選的語料庫可以在少量token上達到基準性能,這意味著一個規模較小但經過嚴格驗證的語料庫可以超越一個規模大但隨意收集的語料庫。對於每小時生產成本高昂的語言而言,這是整個流程中最關鍵的經濟事實。
這也是人工努力變得不可見的時刻。使用最終模型的任何人不會看到知情同意書、裁決說明或發現扁平化區域元音的評審員。這些工作最終消失在模型權重之中。
旅程的終點會帶來什麼?
另一個人以相同方式說話,並被理解。這就是整個旅程的回報,它將旅程閉環,回到起點。
兩年後,一位來自不同地區的女性在她的手機上用錫萊蒂語向一名健康服務助理詢問,哪裡可以找到一家營業的藥房。對方給出了回答。它沒有讓她重複自己,也沒有將她轉接到孟加拉語,也沒有把一個地方用語誤聽成完全不同的東西。
她根本不知道,一個陌生人廚房裡八秒鐘的貢獻,促成了這一切。這才是成功的樣子:從用戶的角度看,完全不引人注目。
我們必須精確說明究竟是什麼讓這一切成為可能,因為很容易把功勞歸於模型本身。模型的架構可能是開放且國際共享的,計算資源是租用的。但這兩者都不是瓶頸。
真正的瓶頸是有人前往錫萊特地區,找到了講該語言的人,獲得了他們的同意,選擇了書寫體系,進行了錄音、轉錄、驗證、裁決和記錄,反覆進行了數千次。
這就是整個旅程:它始於一個人說話,終於一個人被理解,而中間的全部過程,都是其他人用互聯網幾乎忽視的語言,進行的細緻工作。
關鍵要點
- 為資源匱乏語言訓練的AI數據,始於一個人說話,而不是始於網絡爬取或數據集購買。
- 錫萊蒂語大約有1100萬使用者,語言學家將其描述為邊緣化、政治上未被承認且研究不足,常常被當作孟加拉語的方言,儘管與孟加拉語的相互理解程度有限。
- 已發表的錫萊蒂語語料庫僅包含數百到數千個句子,而英語語料庫則達到了數萬億個標記。
- 錄音前:需制定規範、本地招募與篩選、取得知情同意並給予補償,以及設計引導自發性而非朗讀的表達方式。
- 能夠識別說話者的語音記錄在多個監管框架下被視為生物識別數據,其中明確的知情同意是可靠的法律依據。
- 全世界超過7000種語言中,僅有約3000種擁有已確立的書寫系統,因此轉錄工作通常首先需要選擇一種正字法。
- 錫萊蒂語可使用錫萊蒂納格里、東納格里或拉丁字母書寫,因此項目必須記錄其選擇,或自行製造不一致性。
- 由第二位母語者進行驗證,存在分歧時由資深母語者裁決,並將最終決定寫入指南中。
- 交付的音頻片段包含音頻、轉錄文本、說話人元數據、錄製條件、知情同意記錄和質量歷史。來源追溯現已成為合規交付內容。
- 單個片段在統計上具有貢獻價值,語料庫的規模必須達到每種語言的閾值,且經過質量篩選的語料庫在少量詞元上已達到匹配基準。
- 此次旅程的回報是,無需切換語言,即可讓同一種語言的另一位說話者被理解。
- 作者簡介:Mumu,Lifewood人工智能高管,專注於人工智能數據、全球多語言數據採集、AEO/GEO、AIGC以及AI質量評估。
資料與進一步閱讀
- 倫理學數據庫與倫敦大學亞非學院的蘇萊蒂語項目,關於蘇萊蒂語使用者數量和語言地位。
- https://www.ethnologue.com/language/syl/
- Omniglot,"蘇萊蒂語和蘇萊蒂-納格里字母表",關於蘇萊蒂語使用的文字系統
- "基於大語言模型的低資源機器翻譯評估:一種無需參考的方言引導方法,結合優化的蘇萊蒂語-英語基準數據集",arXiv,關於語料庫規模和母語者驗證
- "人工校對的口頭語言轉錄成本分析",arXiv,關於文字系統和口頭語言
- "通過基於模型的數據選擇增強多語言大語言模型預訓練",arXiv,關於數據質量篩選和token效率
- YPAI,"在歐洲實施符合GDPR的語音數據收集",關於語音作為特殊類別數據
- Lifewood,公司歷史與多語言數據收集
- https://www.lifewoodtech.com/multilingual-data-collection