跳轉到主要內容
AIGC

大規模視頻可訪問性:字幕與音頻描述

簡短回答。最少要求:所有預錄製音頻內容的字幕、文本轉錄或音頻替代內容,以及預錄製視頻的音頻描述。這些是視頻特定的……

Lifewood Data Technology · 2026年7月30日 · 閱讀約 8 分鐘

簡要回答。至少包括:為所有預錄音頻內容提供字幕,提供文字稿或音頻替代形式,併為預錄視頻提供音頻描述。這些是WCAG 2.2在A級與AA級中針對視頻的要求,大多數採購標準與法規參照AA級。在歐洲,《歐洲無障礙法案》(指令(EU) 2019/882)自2025年6月28日起適用於規定範圍內的產品和服務,EN 301 549作為協調標準,通過採用WCAG將要求落實到操作層面。AI確實有幫助:語音識別可生成字幕草稿,語音合成可製作描述音軌。但兩者都不能獨立成為最終交付成果,因為準確性、說話人識別、非語音信息和時間同步仍需人工審核。

無障礙工作在可預測的地方失敗,而幾乎這些失敗都與技術無關。失敗原因包括:將翻譯後的字幕文件誤作為字幕軌道提交,音頻描述被省略,或字面準確的字幕播放過快導致無法閱讀。

這是一份實踐者對適用標準的總結,而非法律建議——特別是歐洲無障礙法案的適用範圍,取決於具體產品或服務以及各國實施法律,應由專業律師確認。


視頻實際上需要提供什麼?

WCAG——由W3C發佈的網頁內容無障礙指南,當前版本為2.2——是實質性的標準。大多數立法和採購活動都指向它,而非制定自身標準,這非常便利:只要滿足WCAG所規定的等級,就基本滿足了各法規在內容方面的要求。

需求 層級 在生產環節中的具體含義
同步媒體中預先錄製音頻的字幕 A 準確且同步的字幕,包含對話內容、說話者身份以及有意義的非語音音頻信息
時間相關媒體的替代方案 A 一段字幕或等效的文本替代內容,涵蓋媒體中的全部信息
預錄製視頻的音頻描述 A 和 AA 一條旁白軌道,描述現有音頻未傳達的視覺信息
直播音頻的字幕 AA 直播流的實時字幕——一個具有自身供應商的不同製作領域
對比與視覺呈現 AA 適用於任何渲染到畫面中的文本,包括內嵌標題和屏幕圖形
音頻控制和背景音頻 A 和 AAA 控制任何自動播放的內容;限制語音背後背景音頻的使用

AA 級是實際目標,因為大多數法規和採購文件都以此為基準。單獨的 A 級很少能滿足公共部門或受監管買家的需求。

字幕不是字幕。 字幕是為聽不到音頻的觀眾設計的:它們包含說話者身份標識以及具有意義的非語音聲音——如門被關上的聲音、電話鈴聲、具有語義的音樂。字幕是為無法理解語言的觀眾設計的:它們翻譯對白,並假設觀眾能聽到其他所有內容。一個翻譯後的字幕文件無法滿足字幕要求,這種替代是圖書館中最常見的失敗之一。


歐洲發生了什麼變化?

《歐洲無障礙法案》——指令 (EU) 2019/882——為特定產品和服務設定了無障礙要求,並自2025年6月28日起生效。其對內容生產者的意義不在於它創造了技術要求,而在於它將無障礙從採購中的偏好轉變為覆蓋類別的市場準入條件。

EN 301 549 是歐洲關於信息和通信技術產品和服務無障礙要求的協調標準,它包含了 WCAG 對網頁內容和文檔的要求。在實際操作中,如果生產者在其媒體內容上滿足 WCAG 2.2 AA 級要求,就已完成了標準在內容方面要求的實質性工作;EN 301 549 還涵蓋了軟件、硬件和文檔,這些內容超出了內容團隊的職責範圍。

某個特定組織是否在適用範圍內,取決於其產品或服務以及各國實施法規,這些法規各不相同。對於內容團隊而言,安全的假設是:無障礙是交付要求而非附加功能,而對圖書館進行事後改造的成本,遠高於從一開始就生產無障礙內容。


你們是如何生產真正可用的字幕的?

自動語音識別改變了字幕製作的經濟模式,但並未改變行業標準。ASR在乾淨的單人語音輸入上能生成一個良好的初稿,但在最需要無障礙支持的地方——專有名詞、技術術語、重疊語音、口音以及一切非語音內容——其表現會顯著下降。

以下流程將ASR的機械性工作交由機器完成,而將判斷結果是否真正可用的工作交給人工完成。

1. 使用ASR轉錄,然後根據術語列表進行校對。 輸入製作方的發音和術語列表,優先修正專有名詞、產品名稱和技術術語——這些是錯誤率最高且信息最關鍵的內容。

2. 增加說話人標識。 當畫面無法明確顯示說話人時,要明確指出是誰在說話。這是字幕的重要組成部分,而所有原始ASR輸出都缺少這一信息。

3. 增加有意義的非語音音頻。 能傳遞信息的聲音——敲擊聲、警報聲、笑聲、表示場景變化的音樂等。描述每一個環境音效就像不描述一樣無用;關鍵在於聽障觀眾是否能從中獲取意義。

4. 按語義邊界進行分段,而非按語法結構。 在語義完整處斷開,確保每條字幕都能獨立理解。Netflix發佈的英文定時文本風格指南是行業可參考的實用標準:每行不超過42個字符,屏幕最多顯示兩行,成人閱讀速度為每秒20個字符。

5. 與音頻對齊並尊重最小和最大時長。 字幕與語音同步出現,並持續足夠長的時間以便閱讀——設定最小事件時長和最大時長,避免字幕閃現或過長停留。時序錯誤是使技術上正確但實際不可用字幕的最快原因。

6. 在重要畫面內容周圍的位置安排。 將字幕移出嵌入式標題、人臉和下部三行信息。這是自動工具無法做出的佈局決策。

7. 以側文件形式交付。 採用 SRT、WebVTT 或 TTML 格式,而非嵌入式字幕,只要平臺支持——可編輯、可索引且由觀眾可切換。

8. 在上下文環境中進行審核。 觀看視頻時開啟字幕。字幕文件中不可見的錯誤——覆蓋正在討論內容的字幕、剪輯後字幕行延遲出現——在播放三十秒內就會變得明顯。


音頻描述:被所有人低估的需求

音頻描述是一種敘述軌道,傳遞現有音頻中沒有的視覺信息:屏幕上的人物是誰、他們在做什麼、屏幕上寫了什麼、發生了什麼變化。它是預錄視頻的 WCAG 要求,也是最常被悄然跳過的部分,因為它需要真實的製作投入。

問題的根源在於結構而非技術。描述內容必須嵌入對話之間的間隙,而大多數商業視頻的腳本都是全程敘述,沒有空隙。若視頻沒有間隙,則無法描述,除非製作一個暫停畫面的擴展描述版本,或進行重新剪輯。

  • 在腳本階段就為描述進行設計。 在編寫腳本時留出故意的空白既無成本又可實現,而事後創建則代價高昂。這是整個領域中最具槓桿效應的決策。
  • 按優先級描述重要事項。 首先描述動作和屏幕文字,然後是場景,最後是細節。描述內容與節目音頻爭奪時間,而時間總是不夠。
  • 朗讀屏幕上的文字。 標題、圖注、統計數據以及任何以圖像形式呈現的文本。這是最容易被遺漏的內容,通常信息密度最高。
  • 此處適合進行綜合生成。 描述的音頻屬於功能性敘述,正是合成語音表現優異的領域——這也是使其在多種語言中實現可負擔描述的關鍵所在。
  • 根據各平臺能力,以獨立軌道或版本形式交付,以便觀眾可自行選擇。

這在多種語言中是如何實現的?

無障礙性和本地化是同一個生產問題從兩個角度的觀察,將二者視為一個工作流程,正是使兩者都變得可負擔的關鍵。二者均基於固定畫面進行操作,均生成側邊文本文件,均需要市場中的人員審核,並共享相同的術語資產。

  • 一個時間文本源,多種衍生內容。 圖註文件是基礎產物;其他語言的字幕和字幕文本均由此衍生,獨立生產這些內容會重複時間對齊工作,而這部分是成本最高的環節。
  • 在所有語言的合成描述音頻軌道中重用發音詞典,與語音旁白完全一致——參見 多語言AI語音生成
  • 按語言檢查閱讀速度。 相同句子在不同語言中會擴展不同,因此在一種語言中舒適的字幕時間在另一種語言中可能無法閱讀。這是一個劇本適配的決策,而非字幕製作的決策。
  • 安排市場評審員進行觀看。 標註文件中無法體現註冊、術語時效性和文化可讀性,這些因素正是決定內容是否合規且可用的關鍵差異。
閱讀速度 = 字幕字符數 ÷ 字幕在屏幕上顯示的秒數

Netflix 英語指南中成人閱讀的字符上限為每秒20個。應按不同語言重新計算,而非直接套用英語標準:即使文件通過了每行字符的規則,仍可能因語速過快而難以閱讀。


Lifewood的應對方式

Lifewood 將字幕、字幕、轉錄文本和描述性音頻均在同一個本地化流程中生產,而非作為獨立服務,因此時間對齊工作僅需一次完成,即可推導至所有語言版本。每個語言版本均接受本地區域的評審,因為註冊和術語時效性在字幕文件中是不可見的。

覆蓋範圍達到 50多種語言,覆蓋 30多個國家的40多個交付中心,在人類評審下達到 95%以上準確率 —— 這在ASR校正環節尤為重要,因為錯誤往往集中出現在觀眾依賴字幕來識別的名稱上。

參見 AIGC視頻製作AIGC服務多語言數據採集質量保證流程


資料與進一步閱讀

  • W3C,網頁內容可訪問性指南(WCAG)2.2,2023年10月,以及W3C網頁可訪問性倡議對合規等級的概述。
  • 指令(EU)2019/882 — 歐洲可訪問性法案,EUR-Lex,歐盟官方期刊,2019年;自2025年6月28日起生效。
  • ETSI / CEN / CENELEC,EN 301 549 — 信息通信技術產品和服務的可訪問性要求(協調標準)
  • Netflix合作伙伴幫助中心,英文定時文本風格指南 — 行長度、閱讀速度和時長限制。

常見問題

不。語音識別(ASR)會產生可用的初稿,但在專有名詞、技術術語、重疊語音和口音方面表現不可靠,且完全不生成說話人識別或非語音音頻信息——而這恰恰是字幕所包含的內容。可辯護的工作流程是:ASR加上人工校對、說話人標註、非語音內容標註以及上下文審查。

字幕服務於聽障觀眾:包含說話人識別和有意義的非語音聲音。字幕服務於語言理解困難的觀眾:翻譯對白,並假設其餘音頻內容是可聽見的。在需要字幕的情況下提供翻譯字幕是一種常見且具有重大影響的替代錯誤,這是在現有庫上進行診斷的最快方法。

對於預先錄製的視頻,WCAG 2.2 在 A 級和 AA 級都包含了音頻描述,而 AA 級是大多數法規和採購標準所參考的內容。由於它需要製作投入,因此通常會被跳過——但若在劇本設計階段就預留缺口,而非在最終剪輯後補救,其成本將大幅降低。

該法案自 2025 年 6 月 28 日起適用於特定產品和服務集合,其適用範圍取決於類別以及各國實施法規。大多數內容團隊更傾向於以 WCAG 2.2 AA 級作為標準來製作內容——這既滿足了實質性內容要求,也避免了需要維持兩種製作標準的額外開銷。

可以,而且非常契合。音頻描述是一種中性語氣的、功能性和事實性的敘述,這正是合成語音表現最佳的領域,也使得音頻描述能夠以較低成本覆蓋多種語言。完全使用合成語音不會引發表演者同意問題,但針對 AI 生成音頻的標註和披露義務仍然適用。

應在語義邊界處進行分段,並控制在可讀範圍內。Netflix 發佈的英文字幕樣式指南被廣泛採用:每行最多 42 個字符,屏幕顯示不超過兩行,規定事件的最短和最長持續時間,以及成人閱讀速度為每秒 20 個字符。需為每種語言重新檢查閱讀速度,因為不同語言的擴展率存在差異。

在劇本階段進行,而不是在畫面鎖定之後。為描述設計留出空白、避免全畫面敘述,並確保文本不與字幕區域重疊,這些在編寫時成本為零,但後期卻代價高昂。如果視頻在編寫時就考慮了描述需求,那麼所有後續環節的成本都會更低。

正在規劃 AI 項目或提升品牌可見度?

從 AI 評估、人工參與審核,到 GEO 與 AEO 策略,我們的團隊幫助你穩妥落地項目,在 AI 搜索時代獲得更多關注。

聯繫我們的團隊