跳轉到主要內容
AI 數據

TTS語音數據的製作標準與配音演員選拔

簡短回答。第一場和第四十場錄音在聲學和表演層面必須完全不可區分,因為模型在學習語音的同時也會學習錄音的差異。也就是說……

Mumu D. · 2026年9月2日 · 閱讀約 12 分鐘

簡短回答。第一場和第四十場的錄音在聲學和表演上必須完全不可區分,因為模型在學習語音的同時也學習了錄音的差異。這就是為什麼眾包和家庭工作室錄製對文本到語音(TTS)無效:房間聲學、麥克風位置、發聲前的熱身以及發聲的音域都會成為模型所復現的內容的一部分。舊標準大約是24小時單人朗讀音頻,生成的語音通常被描述為可接受但平淡。現代系統則訓練一個模型覆蓋多個說話者,每個說話者被壓縮為一個說話者嵌入——這將語言與身份分離,因此一個語音可以講授其說話者從未學習過的語言。


語音合成是否需要錄製語音數據?

我在研究這個主題時找到的最出色的句子是一個生產要求,而不是技術規格:

"第一場會話和第四十場會話在聽覺和表演上必須完全不可區分。"

這就是整個學科。語音合成開發需要在相同條件下錄製數小時的語音,而同一來源明確指出:眾包錄製和自導自演的家用錄音室會引入房間聲學、麥克風位置、發聲前準備和發聲音域等方面的差異,模型會同時學習這些差異以及預期的語音特徵。

你的不一致性會成為語音的一部分。這正是語音合成數據採集與幾乎所有其他類型語音數據工作之間的區別所在。


發生了什麼變化,以及這對你需要多少數據意味著什麼

過去的問題很簡單。你有多少小時的乾淨單人語音數據?標準答案大約是24小時的LJSpeech風格朗讀音頻,這種音頻生成的模型聽起來在一位從業者看來是可接受但平淡無味的。

那個時代已經結束,原因在於架構設計。現代系統會同時訓練一個模型,針對多個說話人,每個說話人被簡化為一個說話人嵌入向量:一個由幾百個數字組成的向量,能夠捕捉該聲音本身的特徵。

使這一點擊成立的框架是:模型是工具,而嵌入告訴它應該成為怎樣的人。或者,正如同一來源所表述的那樣,tape archive(磁帶檔案)與一位天賦異稟的印象派畫家之間的區別。檔案只能回放已記錄的內容。而印象派畫家則只有一個聲帶,卻擁有無限多的身份,因為身份只是問題中的一小部分。

由此產生兩個具有商業意義的後果。聲音可以講其演員從未學習過的語言,因為語言與身份存在於模型的不同部分。而且聲音可以被混合,因為在任意兩個嵌入之間,都存在一個從未存在過的第三種聲音。

因此,你實際上需要多少音頻?這完全取決於所採用的方法,且已發表的範圍非常廣泛:

零樣本克隆僅需幾秒鐘的音頻即可實現。在強大的多說話人基礎模型上進行微調通常需要一到五小時。旗艦預設聲音仍需二十到四十小時的錄音室時間,其原因值得引用:數據中的每一個空白都會導致聲音中的一個空白。廣覆蓋的基礎模型,數據供應商報價為100到300小時或更多。

實際的解讀是,關於錄音時長的問題現在已退居到架構問題之後。在詢問需要多少錄音之前,應先明確到底在訓練什麼模型。


為什麼ASR數據不是TTS數據

這一點在規劃討論中常常被默認忽略,而它應當被明確指出。

使語料庫對語音識別具有價值的特徵,往往在語音合成中是不理想的。背景噪聲是最明顯的例子:對於ASR而言,它是訓練信號,教會模型應對真實環境。而對於TTS而言,它是一種汙染,模型會將其複製出來。

TTS同樣需要文本與對應語音錄製的配對數據,這些數據需對齊,並涵蓋不同說話人和表達風格的多樣化且具有代表性的樣本。ASR語料庫即使僅有近似的轉錄文本,也適用於語音識別,但無法用於語音合成。

對於任何擁有現有語音檔案的人來說,其實際意義是:該檔案很可能不是一個TTS數據集,將其當作TTS數據集使用會導致生成的聲音學會了你的錄音問題。


技術規範

已發佈的標準在很大程度上保持一致。

格式:WAV,無損。理由是,壓縮格式如MP3會削弱語調、停頓和情感語氣的細微差別,導致生成的語音顯得機械或表達力不足。

採樣率:48 kHz被描述為TTS數據集的公認標準,理由是它能夠完整捕捉人類語音的全頻譜,併為後續處理留出餘量。

這裡值得提出一個注意事項,因為已發佈語料庫的採樣率各不相同。LibriTTS-R,一個廣泛使用的多說話人英語語料庫,時長約585小時,其採樣率為24 kHz。因此,48 kHz是新委託採集數據的目標,而非TTS數據的普遍屬性;如果你將新採集的音頻與現有語料庫結合使用,那麼你將不得不進行重採樣處理。

與音頻一同交付的元數據,通常以JSON側文件形式提供。已發佈的元數據結構值得完整複製:

說話者檔案:年齡、性別、口音、音域。會話元數據:錄音會話日期。信號鏈:使用的麥克風和前置放大器鏈。房間聲學特徵。在語句和詞級上的對齊轉錄。音位標註。

信號鏈和房間特徵是最常被省略的條目,也是使數據集可復現的關鍵。如果第四十次會話需要與第一次會話匹配,你就必須記錄下第一次會話的實際內容。


音位覆蓋範圍,以及為何腳本不僅僅是腳本

將專業TTS採集與單純讓人讀幾天內容區分開來的細節。

在定義音位覆蓋範圍的地方,腳本應在錄製前對照覆蓋目標進行審查。原因與旗艦語音論點相同:數據中的每一個空白都會導致語音中的一個空白。腳本中從未出現的音素或音位環境將通過外推來合成,而外推正是產生瑕疵的地方。

這也是語言專長不可或缺的地方。為孟加拉語、約魯巴語或越南語設計音位平衡的腳本,需要了解該語言的音素庫存及其允許的序列。從英語音位平衡腳本翻譯而來的腳本,僅對英語是平衡的。

來自同一來源的一個實用建議:在簡要批准後五到七個工作日內交付五到十個已完成小時的試樣,是一個合理預期,而在正式啟動全規模項目前先運行這一試樣,是目前最便宜的質量控制手段。


演員選拔,這是一項真正的專業技能

TTS的語音演員選拔更接近長期劇目製作的演員選拔,而非僱傭一名標註員,其原因在於時長。一個時長為二十至四十小時的節目需要跨越數週時間進行錄製。

根據品牌需求進行試音。業界慣例是提供一份試音樣本列表,由客戶選定合適的語音,同時可針對特定人群、口音或發聲特質進行演員選拔。

整項節目的合同約定。有一家供應商明確指出:演員的合同是針對整個節目週期簽訂的。如果在第二十五小時時某位配音演員無法繼續工作,你將面臨一個未完成的語音,而非一個不完整的數據集,因為無法將另一位配音演員替換進同一角色身份中。

不僅要考慮音色,還要考慮耐力。四十小時的錄音室時長對聲線來說是相當大的負荷。一個聲音在前兩小時表現優美,但在第六小時就感到疲憊,其錄製數據中將呈現出明顯的音色變化。

需在前期明確考慮所需的情感範圍。表達性TTS必須真實錄制,而非推斷。一個商業數據集被描述為涵蓋8種語言、43種情感狀態,共計1000小時,由超過150名專業配音演員錄製,並附有情感與語調標籤。無論你的應用場景需要多少種情感狀態,這都是一項在首次錄製前就完成的演員選拔與腳本設計決策。


一致性管理,這才是真正的專業技藝

鑑於模型會學習到你的語音差異,業界實踐對此是如何應對的。

每次錄製前進行參考音頻回放。有一家服務商描述,每次錄製都會從上一次錄製中播放參考音頻,使表演者重新進入相同的語音狀態,而非僅憑記憶去模仿。

由音頻製作人員主導的定向會話。音頻製作人員在跨錄製天數的錄音過程中監控能量、節奏和發音的漂移,描述為那些細微的不一致,這些不一致會在合成輸出中產生偽影。

那個詞‘漂移’是正確的。並不是說表演者在第九天的聲音聽起來不同,而是說他們聲音的細微差異是累積性的,這種差異在房間內沒有人察覺,但模型能立即捕捉到。

固定的物理設置。麥克風位置、距離、房間處理和信號鏈被固定並記錄下來,不會在每次會話中重新組裝。

交付前的結構化質量保證。已發佈的實踐涵蓋音頻質量檢查、轉錄和標註審查,以及與技術規範的驗證。


知情同意,語音數據與其它類型數據的知情同意不同

語音身份以一種轉錄數據不具備的個人性存在,相關實踐也反映了這一點。

商業文獻中將爬取的音頻描述為風險高、不一致且法律上不確定,其替代方案是明確:通過明確知情同意獲取真實語音演員用於AI訓練。

值得采納的區別是某供應商將語音配音工作與語音數據分開。為語音配音製作的錄音僅用於該目的,語音數據則通過專門的、已獲知情同意的收集方式獲取。

這種分離很重要,因為一位錄製過廣告的表演者,並未同意將其聲音用於建模,將兩者混為一談是引發爭議的最快途徑。

同意應當明確涵蓋錄音、使用及授權用於AI訓練目的,而不同於同意被錄音。


我們自身工作的契合點

明確利益聲明:Lifewood自建立專用語音中心以來,一直開展語音AI數據收集工作,覆蓋50多種語言和方言。

我認為無論供應商如何,以下兩點觀察都具有參考價值。

第一點是,錄音室的一致性首先是一個物流問題,而非音頻問題。在專業錄音室資源有限的市場中,連續六週預訂同一間房間、同一套錄音室鏈條和同一名錶演者,才是實際的制約因素。在資源豐富的語言中,存在預訂市場;而對於錫萊提或沃洛夫語的語音來說,可能需要自行組建房間和表演者,而非租賃,而這種組建工作往往是項目延期的關鍵環節。

第二點是,音素腳本設計是多語言TTS項目中最常被不充分說明的部分。通常的項目需求說明會明確指定錄音時長、語音角色和交付格式,卻很少明確音素覆蓋範圍。對於已有平衡語料庫的語言,這種遺漏是可以容忍的;而對於沒有此類語料庫的語言,必須從音素表開始構建覆蓋目標,若無人完成,這些空白直到合成語音錯誤發音常見結構時才會顯現。

這兩點都說明應在預訂錄音室之前先明確語言學範圍,而這恰恰是這類項目通常的規劃方式所相反的。


規格檢查清單

架構先行。零樣本、微調或基礎模型決定了錄音時長需求,這在任何其他工作之前都必須確定。

音頻格式,需註明採樣率,新採集內容以48 kHz為目標,若需與現有語料庫合併,則需制定重採樣計劃。

語音覆蓋目標,基於目標語言的音位系統構建,錄音前需對腳本進行審核以確保符合該目標。

完整的元數據架構,包括信號鏈和房間特徵,而不僅限於說話人的人口統計信息。

語句和詞級時間對齊,以及語音學標註。

已簽約完整項目的人才資源。

參考音頻播放及有明確責任分工的定向會話,用於監控漂移現象。

若目標為表達性合成,需在初期明確指定情感範圍。

明確涵蓋用於AI訓練的知情同意,與任何配音活動的同意分開。

在投入完整項目之前,需要進行五到十小時的試點錄製。


關鍵要點

  • 第一場和第四十場的錄製在聲學和表演層面必須完全一致,因為模型在學習語音的同時也會學習錄音的差異。
  • 眾包錄製和家庭工作室的錄音會引入房間聲學、麥克風位置、發聲熱身和發聲音域等方面的差異,這些差異會成為訓練語音的一部分。
  • 過去的標準大約是24小時的單人朗讀音頻,生成的語音被描述為可接受但缺乏表現力。
  • 現代系統會用多個說話者的數據訓練一個模型,每個說話者被總結為一個說話者嵌入向量,該向量由幾百個數字組成。模型是樂器,嵌入向量則說明應該模仿哪個人的聲音。
  • 由於模型中語言和身份是分離的,一個聲音可以講其演員從未學習過的語言,且聲音可以被混合成從未存在過的聲音。
  • 所需時間取決於方法:零樣本克隆僅需幾秒,基於多說話人模型的微調需一到五小時,旗艦預設音色需二十到四十個錄音室小時,基礎模型則需一百到三百小時或更長時間。
  • 數據中的每一個空白都會在語音中形成空白,這就是為什麼旗艦聲音仍然需要大規模的錄音室錄製項目。
  • ASR數據不是TTS數據。背景噪聲是識別的訓練信號,卻是合成的汙染源,而TTS需要對齊的文本-語音對。
  • WAV無損是格式標準;壓縮格式會剝離語調和情感細微差別,導致輸出更機械化。
  • 48 kHz被描述為新TTS數據集的公認標準,儘管廣泛使用的語料庫如LibriTTS-R(約585小時)的採樣率僅為24 kHz。
  • 元數據應包括說話人檔案、會話日期、麥克風及前置放大器鏈路、房間聲學特徵、語句和詞級時間對齊以及音位標註。
  • 腳本在錄製前應根據音位覆蓋目標進行審查,應基於目標語言自身的音位庫存構建,而非從英語平衡語料集翻譯而來。
  • 應為整個項目週期簽約聲優,因為語音無法在數據集中間進行替換。
  • 一致性實踐包括播放上一階段的參考音頻,並在定向會話中監控能量、語速和發音的漂移情況。
  • 配音工作和語音數據應分開處理,知情同意書應明確涵蓋錄音、使用及用於AI訓練的授權。

資料與進一步閱讀

常見問題

這取決於具體方法。零樣本克隆可從幾秒開始,基於強多說話人基礎模型的微調通常需要一到五小時,而旗艦預設語音仍需二十到四十小時的錄音室錄音,因為數據中的每一個空白都會導致語音中的相應空白。

通常不行。有助於語音識別模型的背景噪聲會汙染合成效果,而TTS需要精確對齊的文本與語音配對,而非近似的轉錄文本。

WAV無損格式,因為壓縮格式會剝離語調和情感細微差別。48 kHz被描述為新數據收集的公認標準,儘管已有語料庫如LibriTTS-R的採樣率為24 kHz。

因為模型無法區分預期的語音特徵與錄音變化。不同會話之間房間聲學、麥克風位置、發聲前的熱身以及音域的變化都會被學習為語音的一部分。

發佈的實踐在每次會話開始時都會回放上一次的參考內容,並由音頻製作人員直接參與會話,同時監控能量、語速和發音方面的偏差。

未經單獨同意不行。良好的實踐是將配音工作與語音數據完全分開,明確的同意應涵蓋錄音、使用及授權用於AI訓練目的。

正在規劃 AI 項目或提升品牌可見度?

從 AI 評估、人工參與審核,到 GEO 與 AEO 策略,我們的團隊幫助你穩妥落地項目,在 AI 搜索時代獲得更多關注。

聯繫我們的團隊