簡短回答。 沒有單一公平費率,公開實踐差異很大:NaijaS2ST為大約250句錄製語句支付了15美元,每句翻譯支付0.50美元,總計超過11,000美元;IndicVoices根據參與者所在地區現行日薪水平進行補償;學術眾包研究報告的有效費率分別為每小時15英鎊和8美元,符合平臺公平支付標準。目前有三種模型在使用——本地工資基準、任務費率定價、以及與已發佈標準對比的有效小時費率——每種模型回答了關於‘公平’含義的不同問題。
是否已獲得同意並獲得報酬?
關於這一主題的大多數寫作停留在原則層面:同意應是知情的,補償應是公平的。沒有人會反對,但沒有人能據此採取行動。
因此,這一部分以已發表項目中的數據為開頭,因為有趣的問題並不是是否應公平支付,而是‘公平’在實踐中究竟意味著什麼。
NaijaS2ST項目是尼日利亞的一個語音到語音翻譯項目,從超過250名參與者中收集數據。每位參與者錄製了大約250個句子,並獲得15美元,作者將其描述為尼日利亞的公平費率。翻譯員每句獲得0.50美元,總翻譯成本超過11,000美元。團隊明確表示,鑑於項目規模,他們並未依賴志願者錄製數據,並且在必要時允許協商空間。
IndicVoices項目在構建印度語言的包容性多語言數據集方面採取了不同方法:參與者獲得的報酬與各自地區現行的日工資水平相一致。
學術眾包則處於另一個位置。一項2026年的研究為一份問卷支付了1.25英鎊,平均完成時間為4.5分鐘,相當於每小時15英鎊的有效費率,超過了英國最低工資標準以及該平臺自身9美元的公平支付底線。另一項研究則按每小時8.00美元支付,符合同一平臺的標準。
這四個答案是對同一個問題的合理回應,且彼此之間相差甚遠。理解其背後的原因才是真正有價值的部分。
三種補償模式及其各自所基於的假設
本地工資基準化。IndicVoices將報酬與各地區現行的日工資水平掛鉤。其邏輯是,補償應在貢獻者自身經濟環境中具有實際意義,其實際優勢在於本地可辯護且行政操作簡便。
我此前在本系列中已詳細闡述的批評是,肯尼亞2026年草案人工智能政策提議以國際費率作為基準,而非國內最低工資標準,正是因為本地基準化會固化數據工作執行地與價值獲取地之間的工資差距。
任務單價制。NaijaS2ST的每句翻譯收費0.50美元。透明、可預測、並允許貢獻者自行計算其有效小時費率。風險在於,若缺乏質量門控,該機制會獎勵速度而非細緻,且基於外部估算任務時長設定的費率可能嚴重偏離實際。
相對於已公佈標準的有效小時費率。Prolific的方法,即平臺設定一個基準,研究團隊報告其實際有效費率相對於該基準。這是最可審計的模型,也是最易於公開辯護的,但它要求掌握實際完成時間,這意味著在設定費率前必須進行試點。
誠實地說,這些並非相互競爭的哲學,而更多是針對‘與什麼相比?’這一問題的不同答案。而這個問題的答案應作為一項政策決策被審慎制定,而非簡單繼承上一個項目的做法。
知情同意實際上需要的內容
在各種倫理框架中反覆出現的四項原則是知情同意、透明度、公平性和問責性,這些原則體現在諸如歐盟的GDPR、南非的POPIA以及美國的HIPAA制度等工具中。
操作層面的細節是項目間差異所在,且已有若干已發表的最佳實踐值得借鑑。
以參與者母語提供說明。IndicVoices倫理委員會明確推薦了這一點,團隊也已實施。這看似顯而易見,卻常常被忽略:以國家通用語言向說地方語言的用戶傳達知情同意,實際上屬於第二語言,嚴重削弱了‘知情’的部分。
分別獲得參與同意和數據發佈同意。RedVox項目獨立獲取了數據發佈同意與參與同意,使參與者能夠在不同意其聲音被公開的前提下仍可參與貢獻。這是一種真正優良的設計。它尊重了有人願意幫助構建模型卻不願其聲音被公開的情況,也避免了將所有內容捆綁為‘全或無’的強制性同意形式。
一段預先錄製的介紹環節,留出提問空間。AfriVoices-KE 在入駐時向參與者進行了介紹,並提供了提問和澄清的機會,以便在創建個人資料前獲得理解。通過滾動瀏覽大量文字來表示同意,其有效性遠弱於在充分對話後達成的同意。
明確的撤回權利,且無任何後果。這一權利在多個項目倫理聲明中被提及,值得以貢獻者自己語言的形式明確表達,而非僅出現在條款文檔中。
將支付身份與數據信息分離。AfriVo及KE 僅收集電話號碼和身份證信息用於支付處理,而未將其與數據集一同披露。這是對一個現實矛盾的實際解決:你無法匿名支付人們,但他們的支付身份並不需要隨其語音數據一同流動。
可獲得的機構審查。IndicVoices 經過機構倫理委員會審核;AfriVoices-KE 獲得了主辦機構審查委員會的批准以及國家級研究許可。商業項目很少能獲得IRB(機構審查委員會)的批准,但其核心功能——即由項目團隊之外的第三方在執行前審查協議——是可以被複制的。
沒有人真正解決的矛盾
貫穿整個主題的核心論點,我認為更誠實的做法是直接陳述它,而不是迴避它。
一份2026年的報告直接指出:AI系統依賴於價值數十億美元的無償勞動,即使以保守的低費率向數據貢獻者支付,也會使當前規模的LLM訓練對除最富資源的組織之外的所有機構變得不可行。
這就是矛盾所在。在現代預訓練所需規模下實現公平報酬顯然不具可行性,而行業當前的立場正是建立在這一差距之上。
存在兩個結構問題,且同一篇論文中都提到了這一點。
誰應當獲得補償?對於委託採集的數據,答案是明確的:是記錄該句子的人。而對於網絡爬取訓練數據,這個問題則沒有明確答案。在萬億級token的跨域歸因問題上,目前尚未解決。
同意機制假設了錯誤的默認值。robots.txt系統默認認為網站所有者未明確拒絕的情況下,即表示同意爬取,而越來越多的域名已使用該機制來阻止大型大語言模型(LLM)提供商,但證據表明這些拒絕請求通常被忽視。正如論文所指出的,如果提供商要對貢獻者進行補償,這一範式就必須改變,因為任何交易都需要所有相關方明確且可執行的同意。
人們引用的先例案例是:發現LAION中大量圖像源自DeviantArt,並被用於訓練Stable Diffusion,而這些內容在未經創作者知情或許可的情況下被學習並複製,最終用於牟利。
存在明確的同意模型,這些模型值得作為反例瞭解:OpenAssistant Conversations、WildChat和Mozilla Common Voice均基於用戶明確同意的數據收集機制運行。
這對委託採集項目的意義在於:正是這一點使得委託採集數據具有可辯護性,而爬取數據則不具備。當客戶詢問數據來源以及數據生產者是否同意並獲得報酬時,委託數據集能夠給出明確答案。
那些容易被跳過的細節,卻絕不能被忽略
如果項目發生變更,會怎樣?針對‘語音識別研究’獲得的同意,並不顯然涵蓋後續向第三方授予商業許可的情況。要麼將同意範圍廣泛明確地界定並清晰說明,要麼建立重新獲得同意的路徑。
說明數據保留期限。錄音會被保存多久?結束時會怎樣處理?大多數知情同意書對此問題都保持沉默。
通過不收集敏感內容來處理敏感信息。NaijaS2ST明確表示,他們不會收集個人、私密或敏感內容,也不會要求參與者閱讀此類材料。通過設計提示語來避免敏感信息的披露,比事後治理敏感數據要容易得多。
將接待視為協議的一部分。IndicVoices努力提供茶、咖啡、水和餅乾,以確保一個友好的環境。這在倫理部分看起來只是一個細節,卻是決定參與者是否願意忍受一次會話,還是願意再次參與的關鍵差異。正如我此前所寫,數據保留是低資源語言工作中的一個質量機制。
及時付款。由於系統無法對賬而導致付款延遲,屬於設計缺陷;在實地數據採集中,這會損害下一個項目所依賴的社區關係。
我們在此問題上的立場
聲明利益:Lifewood在超過30個國家的交付中心僱傭並外包數據採集工作,因此這並非一個抽象問題,而是我們日常運營的現實。
我堅持的兩個觀點。
其一,知情同意與補償的質量正逐漸演變為採購問題,而非價值聲明。受歐盟文件要求約束的買家越來越被要求說明貢獻者是如何被對待的,而不僅僅是交付了什麼內容。無法提供知情同意記錄、付款條款和數據保留政策的供應商,將面臨風險,這些風險最終會轉嫁給客戶。
第二個是與倫理論點並行的運營論點。在貢獻者群體規模較小的語言中,貢獻者是整個供應鏈中的稀缺資源。公平的條款、及時的付款和良好的體驗,是交付運營能夠確保下個季度繼續為該語言提供服務的關鍵。在稀有語言項目中出現的人員流失,並非人力資源指標,而是一種能力損失,需要通過基於關係的招聘渠道耗費數月時間才能重建。
這兩個論點指向同一個方向,這雖然方便,但我認為,正是這個原因使得實踐的改善速度超過了理論討論所表明的水平。
一份實用的檢查清單
有意識地確定你的基準。採用當地現行工資、任務費率或針對已發佈標準的有效小時費率。
明確記錄具體標準及其依據。
在設定任務費率之前進行試點,從而明確有效小時費率,而非憑空假設。
以貢獻者母語提供同意聲明,並附帶說明和提問空間。
將參與同意與發佈同意分開。
將支付身份與數據集分離。
明確說明數據保留範圍、使用權限及撤回權利,包括項目目的變更時的情況。
在設計提示時就避免敏感信息洩露,而不是在事後進行管控。
獲取協議的外部評審,如有正式評審則採用正式方式,如無則採用非正式方式。
及時付款,並將會話體驗視為交付內容的一部分。
關鍵要點
- 公開實踐差異很大:NaijaS2ST為大約250個錄製句子支付了15美元,每個翻譯句子支付0.50美元,尼日利亞250多名參與者總計翻譯成本超過11,000美元。
- IndicVoices根據各自地區現行日薪標準向參與者提供補償。
- 學術眾包研究報告的有效報酬率為每小時15英鎊和每小時8美元,符合平臺公平薪酬標準。
- 三種補償模式:本地工資基準定價、任務定價以及相對於已發佈標準的有效小時費率。每種模式對‘公平相對於什麼?’的回答各不相同。
- 肯尼亞2026年草案人工智能政策建議參照國際而非國內標準進行基準比對,理由是本地基準會固化工資差距。
- 四個反覆出現的倫理原則是知情同意、透明度、公平性和問責性,這些原則體現在GDPR、POPIA和HIPAA中。
- IndicVoices根據倫理委員會的建議,以參與者母語完成了所有指令的傳達。
- RedVox將數據發佈同意與參與同意分開獲取,使人們可以在不同意公開發布的情況下參與貢獻。
- AfriVoices-KE在創建個人資料前向參與者進行了說明,並留出提問時間,且僅將電話號碼和ID用於支付處理,未披露這些信息。
- Afri- Voices-KE獲得了機構審查委員會批准和國家研究許可;IndicVoices通過了院級倫理委員會審查。
- 一份2026年的立場文件指出,人工智能系統依賴於數十億美元的未補償勞動,即使以保守的費率支付貢獻者,對於大多數組織而言,當前規模的訓練也變得不可行。
- robots.txt範式假設默認同意,除非所有者明確退出;退出請求據報道經常被忽視,而任何實際交易都需要所有相關方主動且可執行的同意。
- 從DeviantArt複製LAION圖像並用於訓練Stable Diffusion,是訓練未獲同意、未獲署名或未獲補償的作品的先例案例。
- 明確同意的反例包括OpenAssistant Conversations、WildChat和Mozilla Common Voice。
- 實際操作中需要關注的細節:數據保留與範圍變更、設計提示以避免敏感信息洩露、會話期間提供接待服務,以及及時付款。
- 同意與補償的質量正逐漸成為採購問題,而在小語種群體中,公平條款也是維持交付能力的關鍵機制。
資料與進一步閱讀
- arXiv 論文《NaijaS2ST:面向尼日利亞低資源語言語音到語音翻譯的多口音基準》,介紹參與人數、每 250 句支付 15 美元的標準、每個翻譯句子 0.50 美元的費用、翻譯總成本,以及不依賴志願者的決定
- "IndicVoices: 為印度語言構建包容性多語言語音數據集", arXiv, 經倫理委員會批准, 使用母語指令, 依據地區日工資基準進行評估, 並提供參與者接待服務
- "AfriVoices-KE: 為肯尼亞語言構建多語言語音數據集", arXiv, 經審查委員會和國家許可批准, 新成員入職培訓及將支付身份與數據分離
- "RedVox: 語音模型在不同語言中的安全與公平性差距", ar及, 在獲取數據發佈同意與參與同意之間實現分離
- "觀點:大語言模型中最昂貴的部分應是其訓練數據", arXiv, 關於未補償勞動, 大規模場景下的可負擔性, robots.txt隱含同意範式及自願參與倡議
- "A Pathway Towards Responsible AI Generated Content", arXiv, 關於 LAION 和 DeviantArt 在無同意、無信用或無補償情況下訓練的先例
- Way With Words, "Ethical Speech Data: Navigating Voice Data Collection", 圍繞四大核心原則及適用框架,包括 GDPR、POPIA 和 HIPAA
- Lifewood, 多語言數據採集與交付網絡