跳轉到主要內容
AI 數據

知情同意、隱私與報酬:AI數據貢獻者應如何被對待

簡答。作為擁有知情且可撤銷同意的專業人員,其個人數據受到與客戶同等的保護,薪酬公平、按小時計算且穩定——的……

Mumu D. · 2026年7月9日 · 閱讀約 8 分鐘

簡短回答。 作為專業人員,我們獲得知情且可撤銷的同意,個人數據的保護與客戶數據同等嚴謹,薪酬公平、按小時計算且穩定——這是我們運營交付中心所遵循的標準。這不僅是道德問題:研究顯示,更好的薪酬和穩定的工作直接提升標註準確性,而已記錄的替代方案——中位數眾包薪酬接近每小時2美元,無報酬的隱形勞動和不穩定的小工制——恰恰導致數據集的波動和不一致性。


調查實際上記錄了什麼?

一個龐大、關鍵且大多隱形的工作隊伍,在工作條件上堪比任何其他供應鏈的羞辱,同時行業存在一個責任缺口,該缺口已無法再聲稱看不見。

數據非常明確。對主要眾包平臺的調查顯示,平均時薪在1至5.50美元之間,中位數約為2美元,僅有約4%的工人達到美國最低時薪7.25美元;對於每一個有報酬的小時,工人還要花費大約18分鐘的無償勞動——尋找任務、資格審核、申訴被拒——當將這部分隱形勞動計入後,實際測量的中位時薪還會進一步下降。SOMO在2026年的調查追蹤了科技巨頭數據工作所涉及的至少30家中間公司,其中多家被指控支付低於最低時薪、不合理解僱員工、阻止集體組織以及不提供任何社會保障——而來自上層鏈條的定價壓力和合同變更,為這些惡劣條件提供了結構性基礎。工人正在做出回應:肯尼亞數據標註協會、數據工作者調查、Turkopticon——這些組織活動由布魯金斯學會記錄,部分行動也遭遇了報復。

研究社區自身的情況是:對使用眾包人員的機器學習論文進行系統性回顧,發現沒有任何一篇報告了眾包人員的薪酬。在大多數文獻中,生產現代AI真實基準的勞動力甚至沒有被列為一項支出。這種沉默,正是任何關於負責任AI數據工作的主張應被檢驗的基準——這也是為什麼以下標準值得公開記錄下來。

已記錄的基準——以及其成本為美國聯邦最低時薪(參考線)

$7.25/小時 典型調查眾包平臺範圍 $1–$5.50/小時 調查中眾包工人的中位時薪 加上每小時18分鐘的無償勞動——尋找任務、資格審核、申訴——在計入隱形勞動前約為 ~$2/小時 超過最低時薪的工人比例 30家以上中間公司,科技巨頭通過這些公司獲取數據工作,根據SOMO 2026年調查結果 約4% 0篇系統性機器學習研究回顧中報告了眾包人員薪酬的論文 數據來源包括CrowdWorkSheets平臺薪酬調查彙編、SOMO調查以及訓練數據報告審查,如下文所引用。


在數據工作中,真正的知情同意是什麼樣子的?

知情、具體、有記錄且可撤銷——依據研究倫理標準,因為數據工作本質上是對人類貢獻的研究。

倫理文獻對此有明確依據:人類計算任務應達到與人類受試者行為科學研究相同的倫理標準,其基礎是貝爾蒙特原則——尊重個人、有益性、公正性。在操作層面,‘尊重個人’意味著知情同意必須是真正知情的:在貢獻之前,個人必須清楚知道收集了什麼(他們的聲音、判斷、人口統計信息)、用途是什麼、誰會接收、數據保留多久、以及他們將獲得什麼報酬——這些信息必須以他們自己的語言、符合閱讀水平呈現,而不是通過點擊同意。具體意味著新用途需要新的同意:為語音識別錄製的聲音,並不因此獲得用於語音克隆的許可。有記錄意味著同意記錄會隨數據集一起流轉,作為其來源追溯的一部分——這是我們收集流程中視為交付內容的一部分。可撤銷意味著存在可操作的撤回路徑,並且在最初階段就誠實地說明其實際限制(已發貨的內容、仍可排除的內容),而不是在後期才被發現。

同意也涵蓋工作本身,而不僅僅是數據。在參與者選擇參與前,會告知其內容性質——這對涉及敏感或令人不安內容的任務尤為重要——並且對敏感工作的同意是自願的,並配有支持,絕不是僱傭條件的一部分。貝爾蒙特框架中的第三個原則‘公正性’,與接下來兩節所指出的方向一致:承擔工作的人應公平分享其成果的收益。


如何保護貢獻者的隱私?

貢獻者是數據主體,而不僅僅是數據生產者——他們的身份、人口統計信息和聲音,應受到與任何客戶數據集同等的保護紀律。

將身份與貢獻分離。操作原則是分離:身份和驗證記錄應與工作成果分開,交付給客戶的內容僅包含貢獻本身以及數據集合法主張的元數據——如年齡區間、地區、方言——絕不能包含身份記錄。人口統計信息在獲得同意的前提下進行收集,僅用於平衡報告,其他地方儘可能最小化;像CrowdWorkSheets這樣的框架之所以存在,正是因為誰標註了數據集會影響數據集本身,而負責任地記錄這一點意味著使用聚合數據和保護措施,而不是暴露信息。

聲音和內容需要特殊處理。在所有司法管轄區,語音都被視為個人數據,並在多個地區被視作生物識別數據,因此語音數據集具有最嚴格的等級:必須明確說明用途的知情同意,禁止未經重新同意的再利用,並在整個處理流程中實施安全措施。當貢獻者處理他人數據——如文檔、錄音和截圖中的個人身份信息(PII)時,保護措施是雙向的:去標識化流程(我們之前在臨床數據工作中描述的兩階段、人工審核模式,由自動化工具觸發,僅達到95–98%的召回率)保護數據中的受試者,而訪問控制、清潔室環境和保密培訓則保護貢獻者免受他們從未選擇承擔的風險。數據工作中的隱私是一個學科,其受益方有三個:客戶、數據主體和貢獻者。


為什麼公平薪酬是一項高質量決策——我們該如何設計它?

因為證據表明,合理支付員工才能獲得準確的數據——員工留存能夠建立指南無法涵蓋的專業能力。

證據指向一個方向。牛津互聯網研究所的研究顯示,清晰的指導和更好的薪酬能直接提升標註準確性;行業分析指出,穩定的工作崗位能讓貢獻者逐步構建指南所要求的特定任務技能體系,而公平對待能減少人員流動,而人員流動會悄悄引入錯誤,因為新員工在重新學習每一個邊緣案例時都會出錯;Fairwork的報告也證實了這些原則在實踐中的應用。甚至現在發佈數據集的研究團隊也開始宣傳其勞動標準——一個對齊數據集明確指出,全職標註員的時薪約為8至9美元,而當地最低工資接近3.69美元,且在受監管的八小時工作日內——因為評審人員已經開始提出這類問題。實踐層面的質量保證文獻也在同一賬本上添加了一條直白的結論:按任務付費而非按小時付費,被列為‘失敗案例’之一。

我們如何設計它。我們的答案就是交付中心模式本身:貢獻者在30多個國家的中心內以就業形態的角色工作——接受培訓,以時薪為導向,而非按件計酬,以當地勞動法為底線而非上限,晉升與質量記錄掛鉤,從塞杜到貝寧,核心標準保持一致,因為一個隨地理變化而變化的價值,本質上是一種政策,而非一種價值。這一模式正是我們‘AI為善’定位的體現:我們在貝寧等地設立的GPT中心,其目的不是利用勞動力短缺,而是創造可持續的高技能工作。而且,這種模式以一種自利的方式運作——使我們的質量系統成為可能的56,788名貢獻者網絡,只有在人們願意長期留下時才存在,而人們願意留下,是因為這份工作本身是值得為之堅守的。

關於數字的警示。薪酬調查針對特定平臺和時間段,調查結果來自所引用機構的公開發布,而我們自身的做法是基於我們公開披露的層面進行的第一手描述——我們在此刻意引用原則而非內部薪酬數據。請核實具體數字的原始來源,且將本內容視為非法律建議。

貢獻者標準 1 2 3 4 有知情同意 具體、有記錄、可撤銷——以貢獻者母語表述,新用途需獲得新同意 雙向隱私 保障公平、穩定的薪酬 身份與貢獻分離;聲音被視為生物識別級別的數據;對受試者和工作者的個人身份信息(PII)均予以保護 以時薪為導向,以勞動法為底線,晉升基於質量記錄——因為留存是質量系統的基石 全球統一標準 所有中心均遵循相同的知情同意、隱私和待遇規則——有記錄、可審計、可追溯 倫理與準確性指向同一方向:尊重貢獻者的條件,正是產生可靠數據的條件。


關鍵要點

    • 已記錄的基準情況令人擔憂:眾包平臺調查數據顯示,時薪中位數接近2美元/小時,略高於美國最低工資水平約4%,每小時工作需承擔18分鐘的無償勞動,且數據工作需通過30多箇中間環節由科技巨頭獲取——其中多個被指控存在低於最低工資和反工會行為。
    • 研究界也反映了這種可見性缺失:一項系統性綜述發現,零篇機器學習論文報告了眾包工作者的薪酬情況。
    • 真正的知情同意是研究級別的:明確且具體(新用途需要新的同意——語音識別不等於語音克隆),以數據集來源追溯的形式記錄,可在誠實的邊界內撤銷,並涵蓋工作本身的性質。
    • 貢獻者隱私意味著將身份與貢獻分離,僅將人口統計學數據用於平衡報告,且僅在存在時使用,對語音數據採用生物識別級別的處理,並對個人身份信息(PII)進行保護,以同時保障數據主體和貢獻者。
    • 公平報酬是基於證據的質量決策:更高的報酬和穩定性可顯著提升準確性,人員流動會引入錯誤,而按任務計件的報酬模式是已記錄的失敗模式。
    • 我們的結構是交付中心模式:以僱傭關係為基礎、經過培訓、按小時計酬的工作,以當地法律為底線,而在30多個國家實行統一標準——這正是支撐著一個由56,788名貢獻者組成的網絡的現實基礎,而這個網絡的存在,正是因為人們願意留下來。
    • 倫理與數據質量在這裡是同等的投資,這是最不浪漫卻最持久的論據,說明為何必須把這件事做對。
    • 薪資數據是平臺和時期特定的;請在引用的來源中核實,且不得將任何內容視為法律建議。

資料與進一步閱讀

常見問題

有據可查的三點理由:質量(薪酬與穩定性可顯著提升準確性)、風險(供應鏈中的勞動與同意失敗問題現已被調查並報告)、以及來源追溯(監管機構和客戶越來越關注訓練數據的生成方式)。最便宜的標註往往並非最便宜的數據集。

貢獻者如何被參與(是按僱傭關係還是按任務計酬)、薪酬與當地最低工資標準的關係、同意涵蓋的內容及其如何被記錄、身份如何被保護,以及是否是通過質量記錄而非人員流失來決定誰參與工作。具體答案存在與否,取決於實際情況。

在誠實的範圍內,是的:撤回同意將停止未來使用,並移除仍可被移除的內容,同時同意文件會事先明確說明已交付數據的含義。假裝擁有無限可撤銷性,就如同不提供任何同意一樣,都是不誠實的。

在用戶同意前進行披露,絕不會作為僱傭條件,通過輪換機制併為選擇該方式的人提供支持——這是內容審核記錄顯示行業最差的領域,也是明確政策最為關鍵的地方。

它改變了成本的分佈位置:經驗豐富的、被保留的貢獻者能夠以更少的返工產生更高初始質量的內容,而替代方案中隱藏的成本——人員流失、不一致性、聲譽和法律風險——會延遲並變得更大。證據表明,只有在公平條件下,才能產生高質量內容。

正在規劃 AI 項目或提升品牌可見度?

從 AI 評估、人工參與審核,到 GEO 與 AEO 策略,我們的團隊幫助你穩妥落地項目,在 AI 搜索時代獲得更多關注。

聯繫我們的團隊