簡短回答。 有三個不同的職位使用同一個名稱:驗證(這是否屬實,依據什麼來源),合規性(我們是否被允許這樣說,這裡),和編輯判斷(這是否值得發佈)。這三個職位需要不同的人,而將它們合併為一個角色的程序,會削弱驗證,並悄悄丟失另外兩個環節。使這一環節具有辯護力而非裝飾性的關鍵,是書面的準則、生產者與審核者的分離、按風險設定的樣本率、通過偶然正確一致性統計測量審核者校準、預先設定的失敗規則,以及保留完整的記錄。沒有這些要素,‘人工參與閉環’僅描述某人點擊‘通過’的行為。
流利性本質上已解決,這正是當前錯誤難以察覺的原因:最終發表的缺陷並非語句混亂,而是結構完整但內容錯誤、不被允許或無意義的句子。一個被要求檢查寫作質量的審核者會全部通過這三類問題。
三個職位,三種不同的發現
| 任務 | 回答的問題 | 它所捕捉到的,而其他環節所遺漏的 |
|---|---|---|
| 驗證 | 這是否屬實,依據什麼來源? | 可信度高的虛構內容 — 偽造的統計數據、誤歸因的引述、看似合理但最終指向空無的引用 |
| 合規 | 我們在這裡是否被允許這樣說? | 受監管的聲明、未經許可的資產、缺失的披露、特定市場的禁止條款、法律紅線 |
| 編輯判斷 | 這是否值得發佈? | 流暢、準確、允許的內容是通用的、偏離策略的,或沒有為讀者提供任何新信息,讀者在其他地方也能獲得 |
主題領域驗證者不是合規審查員,編輯也不是。這三個角色在低風險內容上可以由同一個人擔任,但必須分別明確其檢查要求,因為每個角色都有不同的通過條件和相應的資格要求。
可辯護流程所規定的內容
每一步的存在,都是因為其缺失會產生特定且已被觀察到的失敗。
- 在第一批次之前編寫評分標準。 列出對這種內容類型重要的錯誤維度,並通過示例定義嚴重程度等級。在首次交付之後編寫評分標準,只是對供應商已執行內容的描述,這種標準永遠不會對供應商構成挑戰。
- 分離生產者與評審者。 評審者不能是生成草稿的那個人,也不能是生成草稿的模型。這是ISO 17100關於翻譯的核心流程要求,且這一原則具有普遍性:自我評審會可靠地遺漏由生產者自身假設所導致的錯誤。
- 根據風險設定抽樣率,而不是根據便利性。 對受監管的聲明、關鍵事實內容以及任何提及真實人物的內容,必須進行完整審查。高產量、低風險的內容則在整個批次中進行隨機抽樣。對每個文件的前幾項內容進行抽樣,可以衡量文件的起始部分。
- 讓評審者彼此校準。 有兩個或更多評審者獨立地對同一樣本進行評分,並測量其一致性。一致性低意味著評分標準模糊,而不是某個評審者出錯——一個模糊的評分標準會導致批次之間無法比較的質量數據。
- 預先定義失敗規則。 明確設定錯誤閾值,當批次達到該閾值時予以拒收,並明確拒收將返回 整個批次 進行重做,而非僅返回抽樣項目。否則,抽樣將僅用於發現並修復被抽中的缺陷。
- 保留記錄。 誰在何時、依據哪個版本的評分標準進行了審核,以及發生了哪些變更。這是能夠回應客戶審計或權利爭議的證據,也是整個流程中幾乎無法事後重建的唯一部分。
能夠經受供應商接觸的指標
兩個框架將主觀的對話轉化為可論證的內容。這兩個框架均早於生成式AI的出現,這是它們的優勢——它們最初是為將外包的語言處理過程標準化而設計的。
MQM — 評估錯誤,而非情緒。 多維度質量指標(MQM)源自歐盟資助的QTLaunchPad項目,提供了一個層級化的錯誤類型目錄,實施者可根據內容選擇合適的子集。錯誤按維度分類——準確性、流暢性、術語、風格、地域慣例——並按嚴重程度劃分,最終通過錯誤數量計算得出分數。‘質量較差’變為‘每千詞包含11個重大準確性錯誤和4個關鍵術語錯誤’,供應商可以逐項提出異議,從而達成可協商的解決。
標註員間一致性 — 測量評分標準是否真實有效。 僅當兩名具備資質的評審員使用相同的評分標準對相同內容進行評審時,得出的評分結果相似,該質量分數才具有意義。Cohen's kappa 通過校正因隨機一致而產生的預期一致率來衡量這一情況。Landis 和 Koch 1977年的論文 提出了至今仍被廣泛使用的解釋尺度——0.61 到 0.及 0.80 被描述為‘實質性一致’,高於 0.80 被描述為‘幾乎完美一致’。作者將這些視為任意的基準而非統計學閾值,至今仍是行業標準參考點。若評審員無法達成實質性一致,則應先修改評分標準,再質疑評審員的能力。
陷阱: 一個沒有明確說明評分標準、抽樣率或嚴重程度模型的準確率百分比,並不是一個有效的指標。‘99%準確’可能描述的是字符級匹配、對十個項目的抽查,或一次完整的MQM通過——這三者在成本和意義方面相差數個數量級。必須明確其分母是什麼。
人工參與不僅具有質量功能,更具有法律功能
2025年1月,美國版權局發佈了其關於版權與人工智能報告的第二部分,涉及可版權性問題。其結論較為狹窄且具有深遠影響:人類創作仍為必要條件;完全由人工智能生成的作品不具備可版權性;並且,基於當前可用技術,僅靠提示詞並不能賦予用戶對輸出表達元素的充分控制,從而使其成為作者。可受保護的是結果中可感知的人類貢獻——包括對人工智能生成內容的創造性選擇、協調與編排,以及對輸出結果的創造性修改。
這重新定義了內容操作中的審核環節。編輯不僅關乎草稿如何變為可發佈內容,更是構成最終作品可歸屬性的關鍵部分。一個僅在合規框前打勾即完成生成與發佈的流程,會產出版權地位薄弱的資產。而一個由人類真正進行選擇、編排和修訂的流程,則能產生具有可追溯人類貢獻的資產——前提是該貢獻被記錄下來,而非僅僅完成即可,而這正是團隊常被忽視的部分。
版權局拒絕設立專門針對人工智能輔助作品的註冊制度,因此普通規則和普通舉證責任仍然適用。保留編輯歷史是目前應對這一舉證責任最經濟的保險措施。
成本構成及其去向
審核通常在AIGC項目中是生產之後最大的一項支出,而壓縮審核的傾向也十分強烈,這恰恰是因為生成成本大幅降低。一個有用的框架是:生成成本顯著下降,而審核成本卻完全沒有下降——人類閱讀速度始終不變——因此,審核在總成本中的份額即使總成本下降,也持續上升。將審核預算設定為生產成本的固定百分比,將系統性地導致其被低估。
- 產出數量以線性方式驅動審核成本;風險以陡峭方式驅動審核成本。 輸出量翻倍,閱讀時間也翻倍。引入受監管市場會顯著提高單個項目的成本,因為合格的審核人員池會縮小至僅限於該司法管轄區的人員。
- 語言數量會放大審核人員問題,而非審核本身的問題。 每種語言都需找到一名合格的審核員並確保其可隨時調用,這一約束成為大多數多語言項目規模的上限。
- 返工是隱藏的成本線。 一個失敗批次必須重新生成並重新審核。僅衡量首次通過成本的項目,會嚴重低估那些需求不明確的項目的真實成本。
- 校準是一項真實且低廉的成本。 每個季度半天的評審校準,其成本遠低於不可比擬的高質量數據指標的四分之一。
需求側並非投機性:Grand View Research 預測,到2026年全球數據採集與標註市場將達到 63億美元,在2030年前以 28.4% 的複合年增長率持續增長——這一市場存在,是因為模型構建者已經得出結論:經過人工驗證的數據是值得付費的。市場規模數據是研究機構的估算,並非審計總值,應理解為方向性指引。
Lifewood的應對方式
Lifewood 採用雙層流程——生產評審後接獨立質量保證環節——在 95%+ 準確性閾值下,覆蓋 50多種語言,並配備來自 30多個國家的40多個交付中心的本地化評審員。該結構源自其AI訓練數據工作,當時交付物即為標註本身,不存在未經評審的錯誤藏身之處;同樣的雙層分離機制也應用於生成內容。
這是一個主張,而對任何此類主張的恰當回應——包括本主張——是追問:誰進行評審(明確職位、資質、市場情況),依據何種書面評分標準,樣本率如何選擇,以及在失敗時會怎樣處理。能夠清晰作答的供應商通常正在執行工作;而使用形容詞作答的供應商通常並未真正執行,這一區別可在一次會議中明確呈現。
參見 AIGC服務。
資料與進一步閱讀
- MQM委員會,MQM錯誤分類體系——源自歐盟資助的QTLaunchPad項目。
- Landis和Koch(1977年),《對分類數據的觀察者一致性測量》——κ值解釋尺度。
- ISO 17100:2015,翻譯服務——生產方與評審方分離的要求。
- 美國版權局,《版權與人工智能,第 2 部分:作品的版權保護資格》,2025 年 1 月。
- 格蘭德視研究公司,數據採集與標註市場規模——一家研究機構的估算,屬於方向性估計而非審計結果。