簡要回答。應將其視為音頻製作工作,而非一次文本轉語音調用。如今,模型質量很少是主要限制;合成語音顯得不自然,通常源於幾類製作缺陷:姓名和術語讀錯、長句重音落在錯誤分句、節奏均勻且缺少呼吸、長篇朗讀情感平淡,以及未按交付目標統一響度。五項中有四項屬於腳本與流程問題,因此更換供應商往往無效,改寫腳本反而有用。解決方法包括建立發音詞典、編寫適合聽覺的文案、逐段指導韻律,並按照EBU R 128要求採用ITU-R BS.1770測量響度並進行標準化。
這是多語言語音項目背後的工藝層:當朗讀在技術上正確但仍不可用時,應如何修正,以及交付規範應如何表述,以避免在混音階段產生爭議。
究竟是什麼讓合成語音暴露出來
並非音色。在短句和中性內容上,當代合成語音往往難以與真人朗讀區分。在實際生產中,是長期內容中一系列微小缺陷的累積暴露了其合成屬性。
| 告知 | 原因 | 解決方案 |
|---|---|---|
| 名稱和術語發音錯誤 | 沒有詞典;模型根據拼寫進行猜測 | 每種語言的語音詞典,在合成階段應用,品牌術語固定 |
| 長句中的重音錯誤 | 模型無法推斷哪個從句是重點 | 短句;明確的重音標記;重構使重點詞自然突出 |
| 機械的語速,沒有呼吸 | 在整個閱讀內容中應用單一速率 | 按段落分別調整速率;在語義邊界處插入停頓,而不僅在標點處 |
| 長時間內容中情感平淡 | 在整個腳本上應用單一設置 | 每個段落都明確指定語調,如同指導配音演員一樣 |
| 音量錯誤或過度壓縮 | 未將最終混音歸一化到交付目標 | 根據ITU-R BS.1770測量標準,將最終混音標準化至公佈的靶值 |
只有第二條部分是模型能力問題。其餘都是某人未做決定的事項。
為耳朵寫作,而非為頁面寫作
合成語調更多地由句子結構驅動,而非任何語音設置。三個習慣帶來了大部分改進:
- 每句一個想法。 從屬句是強調出錯的地方,因為模型必須猜測句子中哪一半是重點。
- 將重讀詞放在自然停頓處 —— 通常位於句尾。為可讀性而寫的文本會把重讀詞放在開頭,這樣聽起來就平淡無味。
- 合成前要朗讀腳本。 人類在朗讀時遇到困難的地方,模型會表現得更差,因為人類可以在句子中間恢復,而模型則無法做到。
標點符號在這裡發揮著實際作用。逗號不僅是語法標記,更是停頓指令,為頁面撰寫的標點文本,最終讀出來也是為頁面設計的。
音量:終結爭論的標準
感知音量並非峰值電平,將混音調整至峰值電平,是導致一個資產聽起來很安靜,而另一個在目的地自動被降低的原因。兩份文件解決了這個問題,並且它們相互配合。
ITU-R BS.1770 定義了感知節目音量和真實峰值電平的測量算法。 EBU R 128 基於該測量方法定義了實踐:將節目音量歸一化到目標音量水平,具有明確的容差範圍和真實峰值限制,從而確保來自不同來源的素材在一致的音量水平下呈現,而無需逐項調整音量。
五個操作規則應包含在交付規範中,而不是由混音工程師主觀判斷:
- 歸一化到目的地公佈的靶值,而不是在房間內聽起來合適的任意值。廣播、流媒體平臺和播客分發商發佈的靶值各不相同。
- 在整個節目範圍內測量綜合音量。 短時測量會導致本應安靜的段落被過度壓縮。
- 尊重真實峰值上限。 超過採樣峰值檢測器的採樣間峰值,在有損編碼後仍可能產生削波——這是在上傳後才出現的最常見的失真原因。
- 在完整混音之後進行歸一化,在人聲、音樂和效果均已平衡之後進行。僅對人聲軌道進行歸一化後再添加音樂,將使測量無效。
- 按語言版本重新測量。 不同文本腳本具有不同的時長和動態特徵,因此本地化版本不會繼承母版的合規性。
生產流程
第二步和第三步解釋了兩個使用相同模型的團隊之間質量差異的大部分原因。
- 根據上述規則編寫耳部腳本,並大聲朗讀出來。
- 構建發音詞典。 每個產品名稱、人物、地點和技術術語,均需明確標註各語言的發音。這是可持續的品牌資產:只需構建一次,即可在所有資產和所有語言中複用,是本列表中回報最高的項目。
- 進行分段和定向。 將腳本分解為多個段落,併為每個段落設定方向——語速、強調、能量、前後停頓。將五分鐘的朗讀視為一次綜合通話,最終生成的五分鐘朗讀將聽起來像一次完整的場景呈現。
- 根據市場選擇聲音,而非一次性決定。 聲音的適宜性具有文化屬性:在某個市場聽起來溫暖且權威的朗讀,在另一個市場可能顯得隨意甚至錯誤。這是市場層面的判斷,而非中央層面的統一標準。
- 對每個段落合成多個版本並進行選擇。 選擇過程比參數調優更快,且效果更佳,這一點在圖像和視頻生成中同樣成立。
- 以音頻形式進行編輯,而非文本形式。 在數字音頻工作站(DAW)中進行拼接;調整停頓、修正呼吸、將聲音與音樂和效果進行匹配。這是普通的音頻後期處理,也正是合成朗讀變得自然的關鍵環節。
- 在最終混音完成後,按變體進行歸一化和檢查真實峰值。
- 附上同意記錄,進行標註和披露。 哪種語音模型、適用何種同意、有效期到何時,以及在導出時需具備機器可讀的標註信息。
同意與披露,簡要說明
兩項獨立職責,滿足其中一項並不等同於滿足另一項。
同意 出現於語音與可識別的真實個人相似時——無論該語音是基於其錄音克隆而來,還是僅是聽起來像他們。田納西州的《ELVIS法案》自2024年7月1日起生效,將語音確立為每個個體的受保護財產權,而不僅限於表演者,且涵蓋了用於複製語音的工具。在聯合制作中,SAG-AFTRA協議要求對合成語音和數字複製品分別取得書面同意,而非將原始合同視為涵蓋這些內容。
披露 是一項附著於輸出內容的標註義務。根據歐盟《人工智能法案》第50條,自2026年8月2日起生效,合成音頻必須以機器可讀格式進行標註,並披露深度偽造內容;中國自2025年9月1日起實施的標註措施,已要求對合成音頻進行明確和隱含的標註。
首先需解決的範圍問題:該語音是否與可識別的真實個人相似? 若是,則需有書面記錄的同意,涵蓋語音模型的創建及其使用,且需明確有效期、地域範圍以及模型過期後的處置方式。若否,則同意問題可被排除,僅需進行標註和披露即可。
何時仍需使用真人語音
合成語音使得廣泛的語言覆蓋在經濟上成為可能。明確指出在哪些情況下這是錯誤的選擇,比在任一方向上表現出熱情更為有用。
- 合成 用於高產量、事實性、以敘述為主且生命週期較短的內容:產品演示、培訓模塊、目錄視頻、經批准母版的本地化版本、內部溝通。
- 人工 當內容承載品牌調性時:旗艦影片、具有情感基調的推廣作品、以特定表演為核心的內容,以及生命週期長達數年的長篇內容。
- 人工 當說話者是真實存在的、有明確姓名的個人時。合成真實聲音的版本需滿足真實錄音所不具備的知情同意與披露義務。
- 混合 在常見中間狀態:在高收益市場和核心資產中使用人工聲音,在長尾內容中使用合成聲音,且對兩類內容使用相同的腳本、術語和音量規範,以確保整體內容的一致性。
Lifewood的應對方式
聲音是Lifewood在本地化工作中採用的‘主層與子層’架構中的一個層級:畫面固定,音軌分離,針對不同語言進行聲音替換,且保持固定時間點。上述所有環節均需正確執行——每種語言的詞彙表、各段落的指導語、市場內聲音選擇、各變體的標準化處理,以及每個資產的知情同意與披露記錄。
Lifewood在50多種語言中提供人工與合成聲音,由區域本地化評審員對每個變體進行雙重人工參與閉環審核,準確率控制在95%以上,通過30多個國家的40多個交付中心交付。最常被推薦的方案即上述混合模式,因為它通常比完全投入人工或合成聲音更經濟且更高效。
參見AIGC視頻製作。
資料與進一步閱讀
- EBU R 128,音頻信號的音量標準化及允許的最大電平——歐洲廣播聯盟。
- 推薦ITU-R BS.1770標準,用於測量音頻節目音量和真實峰值音頻水平。
- 田納西州的ELVIS法案(HB 2091 / SB 2及2096),自2024年7月1日起生效——將聲音視為受保護的財產權。
- SAG-AFTRA,關於人工智能的規定及會員資源——合成語音和數字複製品的同意要求。
- 歐盟人工智能法案,第50條;中國《人工智能生成合成內容標識措施》,自2025年9月1日起施行。
- 配套指南:多語言AI語音生產——四個服務等級、時長漂移及母語者審核。