簡要回答。至少包括:為所有預錄音頻內容提供字幕,提供文字稿或音頻替代形式,併為預錄視頻提供音頻描述。這些是WCAG 2.2在A級與AA級中針對視頻的要求,大多數採購標準與法規參照AA級。在歐洲,《歐洲無障礙法案》(指令(EU) 2019/882)自2025年6月28日起適用於規定範圍內的產品和服務,EN 301 549作為協調標準,通過採用WCAG將要求落實到操作層面。AI確實有幫助:語音識別可生成字幕草稿,語音合成可製作描述音軌。但兩者都不能獨立成為最終交付成果,因為準確性、說話人識別、非語音信息和時間同步仍需人工審核。
無障礙工作在可預測的地方失敗,而幾乎這些失敗都與技術無關。失敗原因包括:將翻譯後的字幕文件誤作為字幕軌道提交,音頻描述被省略,或字面準確的字幕播放過快導致無法閱讀。
這是一份實踐者對適用標準的總結,而非法律建議——特別是歐洲無障礙法案的適用範圍,取決於具體產品或服務以及各國實施法律,應由專業律師確認。
視頻實際上需要提供什麼?
WCAG——由W3C發佈的網頁內容無障礙指南,當前版本為2.2——是實質性的標準。大多數立法和採購活動都指向它,而非制定自身標準,這非常便利:只要滿足WCAG所規定的等級,就基本滿足了各法規在內容方面的要求。
| 需求 | 層級 | 在生產環節中的具體含義 |
|---|---|---|
| 同步媒體中預先錄製音頻的字幕 | A | 準確且同步的字幕,包含對話內容、說話者身份以及有意義的非語音音頻信息 |
| 時間相關媒體的替代方案 | A | 一段字幕或等效的文本替代內容,涵蓋媒體中的全部信息 |
| 預錄製視頻的音頻描述 | A 和 AA | 一條旁白軌道,描述現有音頻未傳達的視覺信息 |
| 直播音頻的字幕 | AA | 直播流的實時字幕——一個具有自身供應商的不同製作領域 |
| 對比與視覺呈現 | AA | 適用於任何渲染到畫面中的文本,包括內嵌標題和屏幕圖形 |
| 音頻控制和背景音頻 | A 和 AAA | 控制任何自動播放的內容;限制語音背後背景音頻的使用 |
AA 級是實際目標,因為大多數法規和採購文件都以此為基準。單獨的 A 級很少能滿足公共部門或受監管買家的需求。
字幕不是字幕。 字幕是為聽不到音頻的觀眾設計的:它們包含說話者身份標識以及具有意義的非語音聲音——如門被關上的聲音、電話鈴聲、具有語義的音樂。字幕是為無法理解語言的觀眾設計的:它們翻譯對白,並假設觀眾能聽到其他所有內容。一個翻譯後的字幕文件無法滿足字幕要求,這種替代是圖書館中最常見的失敗之一。
歐洲發生了什麼變化?
《歐洲無障礙法案》——指令 (EU) 2019/882——為特定產品和服務設定了無障礙要求,並自2025年6月28日起生效。其對內容生產者的意義不在於它創造了技術要求,而在於它將無障礙從採購中的偏好轉變為覆蓋類別的市場準入條件。
EN 301 549 是歐洲關於信息和通信技術產品和服務無障礙要求的協調標準,它包含了 WCAG 對網頁內容和文檔的要求。在實際操作中,如果生產者在其媒體內容上滿足 WCAG 2.2 AA 級要求,就已完成了標準在內容方面要求的實質性工作;EN 301 549 還涵蓋了軟件、硬件和文檔,這些內容超出了內容團隊的職責範圍。
某個特定組織是否在適用範圍內,取決於其產品或服務以及各國實施法規,這些法規各不相同。對於內容團隊而言,安全的假設是:無障礙是交付要求而非附加功能,而對圖書館進行事後改造的成本,遠高於從一開始就生產無障礙內容。
你們是如何生產真正可用的字幕的?
自動語音識別改變了字幕製作的經濟模式,但並未改變行業標準。ASR在乾淨的單人語音輸入上能生成一個良好的初稿,但在最需要無障礙支持的地方——專有名詞、技術術語、重疊語音、口音以及一切非語音內容——其表現會顯著下降。
以下流程將ASR的機械性工作交由機器完成,而將判斷結果是否真正可用的工作交給人工完成。
1. 使用ASR轉錄,然後根據術語列表進行校對。 輸入製作方的發音和術語列表,優先修正專有名詞、產品名稱和技術術語——這些是錯誤率最高且信息最關鍵的內容。
2. 增加說話人標識。 當畫面無法明確顯示說話人時,要明確指出是誰在說話。這是字幕的重要組成部分,而所有原始ASR輸出都缺少這一信息。
3. 增加有意義的非語音音頻。 能傳遞信息的聲音——敲擊聲、警報聲、笑聲、表示場景變化的音樂等。描述每一個環境音效就像不描述一樣無用;關鍵在於聽障觀眾是否能從中獲取意義。
4. 按語義邊界進行分段,而非按語法結構。 在語義完整處斷開,確保每條字幕都能獨立理解。Netflix發佈的英文定時文本風格指南是行業可參考的實用標準:每行不超過42個字符,屏幕最多顯示兩行,成人閱讀速度為每秒20個字符。
5. 與音頻對齊並尊重最小和最大時長。 字幕與語音同步出現,並持續足夠長的時間以便閱讀——設定最小事件時長和最大時長,避免字幕閃現或過長停留。時序錯誤是使技術上正確但實際不可用字幕的最快原因。
6. 在重要畫面內容周圍的位置安排。 將字幕移出嵌入式標題、人臉和下部三行信息。這是自動工具無法做出的佈局決策。
7. 以側文件形式交付。 採用 SRT、WebVTT 或 TTML 格式,而非嵌入式字幕,只要平臺支持——可編輯、可索引且由觀眾可切換。
8. 在上下文環境中進行審核。 觀看視頻時開啟字幕。字幕文件中不可見的錯誤——覆蓋正在討論內容的字幕、剪輯後字幕行延遲出現——在播放三十秒內就會變得明顯。
音頻描述:被所有人低估的需求
音頻描述是一種敘述軌道,傳遞現有音頻中沒有的視覺信息:屏幕上的人物是誰、他們在做什麼、屏幕上寫了什麼、發生了什麼變化。它是預錄視頻的 WCAG 要求,也是最常被悄然跳過的部分,因為它需要真實的製作投入。
問題的根源在於結構而非技術。描述內容必須嵌入對話之間的間隙,而大多數商業視頻的腳本都是全程敘述,沒有空隙。若視頻沒有間隙,則無法描述,除非製作一個暫停畫面的擴展描述版本,或進行重新剪輯。
- 在腳本階段就為描述進行設計。 在編寫腳本時留出故意的空白既無成本又可實現,而事後創建則代價高昂。這是整個領域中最具槓桿效應的決策。
- 按優先級描述重要事項。 首先描述動作和屏幕文字,然後是場景,最後是細節。描述內容與節目音頻爭奪時間,而時間總是不夠。
- 朗讀屏幕上的文字。 標題、圖注、統計數據以及任何以圖像形式呈現的文本。這是最容易被遺漏的內容,通常信息密度最高。
- 此處適合進行綜合生成。 描述的音頻屬於功能性敘述,正是合成語音表現優異的領域——這也是使其在多種語言中實現可負擔描述的關鍵所在。
- 根據各平臺能力,以獨立軌道或版本形式交付,以便觀眾可自行選擇。
這在多種語言中是如何實現的?
無障礙性和本地化是同一個生產問題從兩個角度的觀察,將二者視為一個工作流程,正是使兩者都變得可負擔的關鍵。二者均基於固定畫面進行操作,均生成側邊文本文件,均需要市場中的人員審核,並共享相同的術語資產。
- 一個時間文本源,多種衍生內容。 圖註文件是基礎產物;其他語言的字幕和字幕文本均由此衍生,獨立生產這些內容會重複時間對齊工作,而這部分是成本最高的環節。
- 在所有語言的合成描述音頻軌道中重用發音詞典,與語音旁白完全一致——參見 多語言AI語音生成。
- 按語言檢查閱讀速度。 相同句子在不同語言中會擴展不同,因此在一種語言中舒適的字幕時間在另一種語言中可能無法閱讀。這是一個劇本適配的決策,而非字幕製作的決策。
- 安排市場評審員進行觀看。 標註文件中無法體現註冊、術語時效性和文化可讀性,這些因素正是決定內容是否合規且可用的關鍵差異。
閱讀速度 = 字幕字符數 ÷ 字幕在屏幕上顯示的秒數
Netflix 英語指南中成人閱讀的字符上限為每秒20個。應按不同語言重新計算,而非直接套用英語標準:即使文件通過了每行字符的規則,仍可能因語速過快而難以閱讀。
Lifewood的應對方式
Lifewood 將字幕、字幕、轉錄文本和描述性音頻均在同一個本地化流程中生產,而非作為獨立服務,因此時間對齊工作僅需一次完成,即可推導至所有語言版本。每個語言版本均接受本地區域的評審,因為註冊和術語時效性在字幕文件中是不可見的。
覆蓋範圍達到 50多種語言,覆蓋 30多個國家的40多個交付中心,在人類評審下達到 95%以上準確率 —— 這在ASR校正環節尤為重要,因為錯誤往往集中出現在觀眾依賴字幕來識別的名稱上。
參見 AIGC視頻製作、AIGC服務、多語言數據採集 和 質量保證流程。
資料與進一步閱讀
- W3C,網頁內容可訪問性指南(WCAG)2.2,2023年10月,以及W3C網頁可訪問性倡議對合規等級的概述。
- 指令(EU)2019/882 — 歐洲可訪問性法案,EUR-Lex,歐盟官方期刊,2019年;自2025年6月28日起生效。
- ETSI / CEN / CENELEC,EN 301 549 — 信息通信技術產品和服務的可訪問性要求(協調標準)
- Netflix合作伙伴幫助中心,英文定時文本風格指南 — 行長度、閱讀速度和時長限制。