簡短回答。 在生成式視頻製作中,最具決定性的工藝決策是:你選擇通過重新生成來修復哪些缺陷,以及選擇在後期處理中修復哪些缺陷——而規則是:生成是隨機的,而後期處理是確定性的。重新提示一個鏡頭以糾正一個問題,會產生一個新鏡頭,其中除該問題外,其他所有內容也會發生輕微變化,因此必須重新全面審查,且可能破壞與前後鏡頭的連貫性。而後期處理只改變你明確指定的內容,其他一切都不變。這使得後期處理成為處理局部且精確內容的正確場所——如標誌、字體、法律文本、色彩匹配、時間軸、穩定、字幕、音頻等;而生成僅適用於幀內容本身存在的缺陷。那些試圖通過提示語直接完成成品資產的團隊,往往將大部分預算花在重新審查他們已經批准過的鏡頭上。
關於規模化AI視頻製作的已發佈指導,主要集中在供應鏈層面:關卡、吞吐量、品牌鎖定、本地化經濟。本文關注的是其底層環節——單個序列是如何實際被製作、審查和修復的——而這正是決定單個資產成本的關鍵所在。
在任何生成之前,必須鎖定什麼?
生成是昂貴且不可逆的步驟。所有可以在生成前決定的內容都應提前決定,因為後期更改意味著需要重新生成鏡頭而非進行編輯。
- 溝通目標、受眾、時長、畫面比例和傳播渠道。 這些因素限制了鏡頭數量和節奏,生成之後再修改整個序列將變得無效。
- 視覺風格和強制性品牌元素,應以參考鏡頭而非形容詞的形式存在。用文字描述的風格指南在每次生成時都會產生不同的解讀。
- 已批准的聲明集。 視頻被允許做出的斷言,必須在任何人撰寫旁白之前就達成一致。
- 分鏡頭腳本或鏡頭列表。 不可省略。在沒有鏡頭列表的情況下就開始生成,是導致製作團隊在剪輯階段才發現自己擁有四十個美麗的片段卻無序可言的根源。
- 連貫性協議——明確列出在不同鏡頭中必須保持一致的內容:角色身份、產品外觀、服裝、配色、環境、鏡頭語言、照明方向以及任何屏幕上的文字。
連貫性協議是大多數製作團隊所跳過的關鍵要素,也是決定審查負擔的核心因素。協議中列出的內容在審查時成為可驗證的屬性;未列入的內容則在審查時成為主觀判斷,這會顯著降低效率並導致不一致。
此外,還存在一個結構性約束,使得基於鏡頭的製作成為必要:生成式視頻是以一個連貫的整體塊形式生產的,而隨著塊的變長,連貫性會逐漸下降,因此長時長視頻是通過拼接而非單次生成實現的。拼接本質上是拼接而非記憶,身份、照明和鏡頭行為在每個接縫處都會發生漂移。其後果——在鏡頭中寫明內容,每個鏡頭單獨生成並以鎖定的參考鏡頭為基準,最終在編輯器中組裝——詳見 為何AI視頻片段有長度限制。
哪些內容始終屬於後期處理?
| 元素 | 為何它不應在生成階段包含? | 後期處理 |
|---|---|---|
| 標誌和品牌標識 | 生成器是近似處理;對商標的近似處理是不可用的 | 由資產文件合成 |
| 精確的字體和標題 | 字符級準確性不可靠,可讀性是設計決策 | 在編輯中以文本圖層命名 |
| 法律文本和免責聲明 | 必須精確且通常具有市場特定性 | 按市場合成 |
| 各鏡頭間的色彩匹配 | 每次生成均處於其自身等級 | 按序列進行分級 |
| 時序與節奏 | 僅能以剪輯版本為基準進行評判,而非單個片段 | 在編輯中裁剪並重新排序 |
| 穩定處理與輕微清理 | 可確定性的修復 | 標準後期工具 |
| 字幕和標題 | 必須精確時序、準確且按市場可替換 | 獨立圖層 |
| 音頻、語音與混音 | 發音、情感、權利和品牌契合屬於各自的工作流程 | 獨立的聲音設計 |
桌底規則:任何必須精確的內容,以及任何必須按市場可替換的內容,都應置於圖層而非像素中。 內嵌文本是本地化版本需要從頭重建的最常見原因。
真正需要重新生成的內容
一些缺陷存在於鏡頭內容之中,無法通過合成消除:
- 主體解剖結構 — 手部、面部、肢體數量、視線方向
- 物體幾何結構與物理合理性
- 動作看起來錯誤:滑動的腳、不可能的關節運動、不自然的重量分佈
- 照明方向與場景或相鄰鏡頭不一致
- 場景構圖與前一鏡頭不銜接
- 鏡頭內部的時間不一致:某個物體形狀變化,衣物發生位移
在重新生成之前,先問一個更便宜的問題:是否可以縮短鏡頭或重新構圖? 佔據最後八幀的缺陷可通過裁剪解決,角落的缺陷可通過推近鏡頭解決。這兩種方法都是確定性的,且不會影響鏡頭其餘部分。裁剪、重新構圖,然後重新生成 —— 順序如此,因為每一步的成本都比下一步低一個數量級。
當重新生成不可避免時,如果模型支持,保持參考素材和種子不變,只改變一個變量,然後完整地重新審查鏡頭,對照連續性協議,而不是僅僅檢查你修改過的部分。改變的變量並不是唯一發生變化的東西。
如何選擇鏡頭
團隊為每個鏡頭生成多個候選鏡頭,並選擇最強的,這是正確的做法。錯誤出在選擇的方式上。
不要孤立地評判鏡頭。 一個單獨看起來美麗的鏡頭,可能在序列中是不可用的 —— 光線來自錯誤的一側,主體在剪輯後朝向錯誤方向,能量與它落下的節奏不匹配,產品在顏色上看起來與前一鏡頭不同。選擇應在包含鄰近鏡頭的時序線上進行,即使只是粗略的佔位符。
選擇應基於協議,而非個人審美。 連續性協議使選擇成為一個可驗證的過程,兩個人會以相同方式執行。沒有它,選擇就變成一系列個人偏好,序列會逐漸偏離。
保留次優方案。 當後續鏡頭髮生變化而首選鏡頭不再銜接時,次優方案就是你所選擇的。為了節省存儲空間而捨棄候選方案是一種錯誤的經濟行為,因為每次再生的成本都非常高。
鏡頭級審查清單
按缺陷類別而非整體印象進行審查,因為整體印象會發現顯著問題,卻會遺漏系統性問題。
| 類別 | 檢查項 |
|---|---|
| 主體完整性 | 手部、面部、解剖結構、視線方向,與參考一致 |
| 物體與場景 | 產品準確性、幾何結構、反光、物理合理性 |
| 時間一致性 | 鏡頭內是否有任何物體在無原因的情況下發生形狀、顏色或位置的變化 |
| 文本 | 幀內任何文本要麼正確,要麼不存在——絕不會是近似值 |
| 連續性 | 相鄰鏡頭之間的光照方向、配色方案、服裝、環境一致性 |
| 運動 | 重量、接觸、關節運動、攝像機行為 |
| 音頻同步 | 適用情況下需實現唇形同步;特效需落在正確的幀上 |
| 品牌 | 配色方案、留白空間、產品呈現、禁止元素 |
| 聲明與文化背景 | 任何被陳述的內容,以及特定市場會理解不同的內容 |
然後對最終資產進行一次獨立的交付檢查:分辨率、幀率、音量、色彩空間、安全區域、字幕時間、文件格式和平臺規範。這些是確定性的,應被自動化;上述類別不是,也不應被自動化。
高風險內容——受監管的聲明、肖像相似性、任何具有法律暴露的內容——需要來自法務、合規或專業領域的指定審批人,且需在上述基礎上額外增加審批。
語言層的模塊化設計
一個視頻通常會演變為多個版本。將視覺主文件與語言層分離,以便市場可以被添加而無需重新生成任何內容:
- 字幕、字幕、旁白、屏幕文字和結尾卡片均存在於可替換的層中。 如果其中任何一層被固化到渲染結果中,每個市場都將需要重新渲染。
- 設計主文件時包含彈性區域。 旁白時長因語言而異,若主文件以某一語言的幀對幀時間進行鎖定,則其他語言都需要重新調整時間。
- 每個層級均需本地原生審核。 包括髮音、時間、術語、語體、文化暗示,以及視覺內容本身是否適合該市場,而這些是任何翻譯步驟都不會提出的問題。
- 能夠貫穿整個營銷活動的版本命名規則。 一個概念在多個畫幅、時長、語言和產品組合下展開,形成矩陣,而資產管理正是防止該矩陣變成無法導航的文件夾的關鍵。
該層級的經濟性在 大規模生產AI營銷視頻 中有詳細說明。
Lifewood的應對方式
Lifewood 以基於鏡頭的架構提供 AIGC 視頻作為託管服務:在生成前鎖定連續性合同和參考幀,候選鏡頭按時間線選擇而非孤立選擇,精確元素在後期合成而非通過提示生成,且每個鏡頭層面的審核按缺陷類別進行,由指定審核員記錄在資產文件中。
本地化處理方式是從已批准的母版進行適配,語言保留在可替換層中,交付規模決定了實際可行性: 50多種語言, 30多個國家的40多個交付中心 和 56,788 名註冊貢獻者在各市場提供本地原生審核,而其他市場則依賴機器翻譯並輔以抽查。合作項目涵蓋前沿模型實驗室、語音AI開發者、AI計算供應商、計算機視覺供應商以及自動駕駛項目,客戶身份根據協議予以保密。AI數據遺產始於2004年,當前公司成立於2018年。
資料與進一步閱讀
- Google 搜索中心,關於 AI 生成內容的指導。
- NIST,降低合成內容帶來的風險 —— 關於生成媒體的來源追溯與透明度。
- 陪伴指南:為什麼AI視頻片段有長度限制 和 規模化生產AI營銷視頻。