簡短回答。 語音標註是為音頻文件添加標籤的過程,以便 AI 模型能夠從中學習。它並非單一任務,而是至少包含四項:轉錄將語音轉換為文本,說話人分離將每一句語音分配給特定說話人,時間戳將文本與音頻中的精確時間位置關聯,以及非語音事件標註標記一切其他內容,包括笑聲、沉默、背景噪音和咳嗽。每一項都有其獨立的規範,且在某一層做出錯誤決策將導致其他層的工作無效。
每一項標註任務會產生什麼?
四項獨立的輸出,每項都對不同的下游訓練任務至關重要。
轉錄、說話人分離、時間戳和非語音事件標註常被視作一個整體任務,並且常被相互混淆。它們相關但不同,各自具有獨特的失敗模式和質量標準。
轉錄將口頭語言轉換為書面文本。輸出是一個文本文件或附加在音頻上的文本層。它是所有其他工作的基礎,因為說話人分離無法驗證,且若未先轉錄,就無法為語音分配時間戳。
說話人分離回答了‘誰說了什麼’的問題。它識別說話段落,並將每個段落分配給說話人標籤,通常為‘說話人1’、‘說話人2’等,或在身份已知時分配給具體個人。輸出是說話人標註的時間線,而非一個簡單的文本文件。
時間戳將文本與時間關聯起來。這可以在語句層面實現,記錄語音段的開始和結束時間;也可以在詞層面實現,記錄每個詞的精確起止時間;還可以在音素層面實現,記錄構成每個聲音的聲學事件。所需的粒度完全取決於訓練任務。
非語音事件標註記錄音頻中所有非語音內容:靜音、笑聲、咳嗽、呼吸、背景噪音、音樂或無法理解的語音。當模型需要理解整個聲學環境而非僅語音內容時,這些標籤是必需的。
逐字稿和清理稿之間的區別是什麼?
區別在於說話內容與最終轉錄內容之間的材料發生了什麼變化。兩者都是合理的,服務於不同的模型。
這一決定是語音標註項目中最關鍵的決策之一,通常被描述得不夠充分。
逐字稿轉錄記錄了所有內容:停頓、填充音(如"um"和"uh")、錯誤開頭、重複、自我糾正以及語音中的非語音事件。一個逐字稿轉錄可能讀作:"Um, so, so the, uh, delivery was actually, [laughs] quite late." 當模型需要學習自然語音模式、不確定性的聲學特徵或非語音信號所攜帶的社會信號時,這種格式是必需的。
清理或標準化轉錄移除了停頓和修正,將語音呈現為編輯後的散文形式:"The delivery was quite late." 當模型需要學習語義和句法結構而非語音特徵時,這種格式是合適的。
智能逐字稿介於兩者之間:停頓被移除,但語句結構得以保留,而非被編輯成正式散文:"So the delivery was quite late." 這是商務會議和客戶服務轉錄中最常見的格式。
選擇錯誤的後果是顯著的。一個在乾淨轉錄文本上訓練的語音識別模型會學會期待乾淨的輸入,而在即興口語上表現不佳。一個在逐字轉錄文本上訓練的語言模型會繼承其本不該再現的猶豫模式。這一選擇在數據收集開始前就已確定在規格說明中。交付之後再更改,意味著需要重新標註整個語料庫。
什麼是說話人分離,為什麼它很難?
說話人分離是識別誰在何時說話。由於人類標註員和自動化工具都難以處理相同的邊緣情況,因此在多語言語料庫中,這些邊緣情況是常態,這使得該技術具有技術難度。
標準的自動化說話人分離採用說話人切換檢測,然後對聽起來像同一個人的段落進行聚類。當說話人數較少、條件受控且每次僅一人說話時,其準確性是合理的。但有四種情況會降低其準確性。
重疊說話。在對話中,兩人同時說話是正常現象,這會破壞大多數自動說話人分割模型,這些模型假設每個段落只由一個說話人組成。一個良好定義的說話人分離任務會明確標記重疊區域,而不是隨意將其分配給某一個說話人。
通道。多通道錄音,即每個說話人使用獨立的麥克風,使得說話人分離顯著更容易且更準確。而單通道錄音在實地採集中更為常見,需要聲學建模來分離被同時錄製的多個聲音。
語言切換。在多語言語音中,一個說話人可能在一句話內切換語言。在單語數據上訓練的聲學模型會錯誤地將這些段落歸類。必須在這些點上引入人工標註員,並且他們必須掌握兩種語言才能正確處理。
說話人重新進入。一個在對話中離開後,經過長時間暫停再返回的說話人,可能無法被自動化工具正確匹配到其之前的段落,尤其是在較長的錄音中。
自動語音分割是一種有效的初步處理方式,而非完整解決方案。語音段落的分配應由聽完了音頻的標註員進行核實。
時間戳的用途是什麼?
用於訓練強制對齊模型、字幕生成器以及任何以語音內容與時間關係作為訓練信號的應用場景。
語句級時間戳記錄每個語音段的開始和結束時間。單詞級時間戳記錄每個單獨單詞的起止時間,用於實時字幕生成和詞錯誤率計算。音素級時間戳則用於聲學建模和語音合成訓練。
強制對齊工具通過使用音素模型將字幕映射到音頻,可自動產生單詞級時間戳,但其具有語言特異性。將訓練於英語的對齊器應用於資源匱乏語言時,會產生錯位的時間戳,這些錯誤會傳播到基於該結果訓練的任何模型中。
這對多語言AI有何重要性?規範文件應包含哪些內容?
因為在英語中看似標準的標註決策在許多其他語言中實際上是存在爭議的,而在數據收集開始前未解決這些爭議的規範,會大規模製造不一致性。
有三個問題反覆出現。
在開始轉錄之前需要做出正交決策。一些語言擁有多個書寫系統或相互競爭的拼寫規範。如果規範未明確選擇其中一個,就會產生分裂語料庫,即同一詞語由不同標註員以不同拼寫呈現,模型會學習到噪聲。
語言切換標籤。當說話者在一句話中途從印地語切換到英語時,轉錄規範、語言識別標籤和說話人分離標籤都需要預先確定。將這些決策交由個體標註員決定,會產生不一致性。
非語音事件清單。需要明確列出需要標註的事件集合。對非語音事件進行開放式指令標註,會導致兩個標註員產生截然不同的數據集,因為一人可能標註呼吸,而另一人則可能不標註。
一個可行的標註規範至少應包含:轉錄規範;說話人標註方案;時間戳粒度;非語音事件清單;語言切換處理方式;不可理解段落的處理協議;以及如何處理重疊語音。
Lifewood的語音採集項目正是以這種具體程度運作,採集、轉錄和審核均由經過培訓的母語人士以書面方案在語言環境中完成。其結果是,數據集的構成可以被審計。
關鍵要點
- 語音標註包含四個獨立任務:轉錄、說話人分離、時間戳標註和非語音事件標註。
- 每個任務產生不同的輸出,並服務於不同的訓練目的。
- 逐字轉錄保留猶豫和修正;乾淨轉錄則移除這些內容;智能逐字轉錄介於兩者之間。這一選擇在規範中確定,交付後若不重新標註,不得更改。
- 語音分段為每個說話段落分配說話人標籤,會因語音重疊、單通道錄音、語言切換和說話人重新進入而退化。自動化工具需要人工審核。
- 語句級時間戳定位語音段落;單詞級時間戳定位單個單詞;音素級時間戳用於聲學建模和語音合成。
- 在一種語言上訓練的強制對齊工具在另一種語言上會產生錯位的時間戳,多語言項目中需要使用母語模型或人工驗證。
- 對於具有競爭性書寫系統的語言,必須在轉錄開始前做出正字法決策,否則語料庫將包含不一致性。
- 一份完整的規範應明確轉錄約定、說話人標籤方案、時間戳粒度、非語音事件清單、語言切換協議、不可理解段落處理方式以及語音重疊約定。