跳轉到主要內容
AIGC

在生成式AI供應商處你的數據會如何處理

簡短回答。這取決於買家幾乎從不閱讀的條款,且答案在模型提供商和直接面對你的生產供應商之間有所不同。三個問題通常就能解決大部分疑問…

Lifewood Data Technology · 2026年7月14日 · 閱讀約 8 分鐘

簡短回答。 這取決於買家從未真正閱讀的條款,且答案因模型提供商與生產方的不同而異。三個問題可解決大部分風險:你的輸入是否被保留,以及保留多久;是否用於訓練或優化任何模型;以及數據處理和存儲的位置。根據GDPR,任何代表你處理個人數據的供應商都是數據處理者,第28條要求籤訂書面合同,明確條款——包括僅依據書面指令操作,且未經授權不得委託任何子處理者。超出法律最低要求,真正能降低風險的控制措施往往並不華麗:儘量減少發送的內容,隔離客戶材料,明確子處理者,記錄具體模型版本所接收的輸入內容。

評估AI供應商風險的團隊通常只關注輸出,而忽視了輸入。在內容流程中,跨越邊界的數據通常比最終成品更敏感,並且在任何人判斷輸出質量之前就已經發生了傳輸。

這是一份從業者總結,而非法律建議;數據保護義務取決於具體的處理活動、涉及的司法管轄區以及各方角色,應由法律顧問和您的數據保護官確認。


實際上什麼離開了你的邊界?

六個類別,其中大多數從未出現在安全問卷中:

  • 項目需求說明,其中常包含未提前通知的產品、價格、發佈日期和策略。
  • 原始素材——視頻、圖片、文檔、錄音——可能包含可識別的個人、第三方知識產權和機密設置。
  • 客戶數據,當內容被個性化或基於記錄生成時。
  • 參考與品牌資產,包括尚未發佈的身份設計作品。
  • 評審意見,通常比鏈條中的其他內容更為直接,且會與資產一同保留。
  • 提示本身,它們編碼了方法,通常會被記錄的時間遠長於內容本身。

第二個結構要點是,鏈條中通常至少有兩個供應商,且它們的義務各不相同。生產供應商持有關係和物料,而其背後的模型提供商則接收通過API傳遞的內容。僅綁定第一方的合同無法覆蓋數據實際流動的路徑。


三個問題,以及由此衍生的三個問題

問題 一個良好的回答 為何重要
我們的輸入是否被保留,以及保留多久? 一個具體的保留期限,對於我們所使用的API層級,零保留選項是可用的 保留是區分臨時暴露與持續暴露的關鍵,它決定了洩露會披露什麼內容
它是否被用於訓練或優化模型? 否,根據合同,對於我們所處的層級——明確指出該層級 訓練用途本質上是不可逆的;一旦內容被用於訓練,便無法從模型中撤回
數據在何處被處理和存儲? 明確的區域名稱,以及在需要時提供地域選擇選項 決定了是否需要傳輸機制,以及是否滿足行業規則
有哪些子處理方? 一份已發佈清單,並承諾在變更時通知 第28條要求對子處理方進行授權;未列入清單的子處理方屬於未經評估的方
刪除機制是什麼? 一個明確的流程、時間框架和確認——包括備份 若刪除操作未覆蓋備份,則不構成真正的刪除
哪些模型版本曾處理過我們的數據? 按每個任務記錄 用於事件響應,且事後無法重建

回答應基於合同而非當前實踐的描述。文檔可能隨時變更;合同條款則不會。


GDPR對內容管道有什麼要求?

當涉及個人數據——包括可識別人員的影像、語音記錄和客戶記錄——時,任何以你的名義處理這些數據的供應商都是數據處理者,而你則是數據控制者。第28條明確了這種關係的要求,其核心條款直接對應於AI供應商的安排。

  • 必須簽訂書面合同,明確說明處理事項、期限、性質和目的、個人數據的類型以及數據主體的類別。
  • 僅根據已記錄的指令進行處理。 如果供應商使用你的輸入來改進其自身模型,則屬於為自身目的進行處理,除非你事先同意,否則這並不屬於你的指令範圍。
  • 未經事先授權不得使用任何子處理者,無論是特定還是普遍授權,且需提前通知變更,以便控制者可以提出異議。在AI管道中,模型提供商即為子處理者。
  • 人員需作出保密承諾,並輔以適當的技術和組織安全措施。
  • 在合作結束時,必須刪除或歸還數據,由控制者自行決定。
  • 需配合審計工作,包括數據主體權利的響應以及對數據洩露的通報。

此外,將個人數據移出歐洲經濟區將觸發第五章的傳輸規則,這些規則要求有獨立的合法機制。這是AI安排中常見的一個缺口,因為推斷通常發生在供應商所在地以外的司法管轄區,而買家往往誤以為供應商的所在地即為數據處理所在地,實際上並非如此。

最常見的缺口是:已與生產供應商簽署數據處理協議,但對供應商調用的模型API、所在區域、數據保留期限均無可見性。數據處理協議的效力取決於其附帶的子處理者清單——請要求提供該清單,並詢問當清單變更時會發生什麼。


哪些控制措施實際上能降低風險?

按有效性而非投入成本排序。前兩項消除風險,其餘措施則用於管理風險。

  1. 儘量減少發送的數據。 大多數項目需求說明包含超出實際工作所需的內容。應剝離客戶標識、未宣佈的產品細節以及不影響輸出的內部策略。從未發送的數據無法被保留、用於訓練或被洩露——這是唯一一個沒有殘留風險的控制措施。
  2. 對原始材料進行脫敏和匿名化處理。 去除可識別的面部特徵和個人數據,且這些數據並非工作主題本身;在任務允許的情況下,用代表性等效數據替代真實客戶記錄。
  3. 對內容進行分類並相應路由。 通常三類足夠——公開、內部、受限——並規定哪些供應商以及哪些模型層級可以訪問每一類內容。受限材料可能需要專用租戶路徑,或根本不應作為生成式生產的內容候選。
  4. 合同約定零保留和不用於訓練。 當供應商和層級支持時,應將其作為合同條款而非依賴設置頁面,且需明確指定層級,因為同一產品不同層級的保留行為往往不同。
  5. 明確並監控子處理者。 要求提供公開發布的清單,提前通知變更,並賦予異議權。當清單變更時應重新評估,而非僅在年度審查時進行;清單才是決定你的數據流向的關鍵因素。
  6. 隔離客戶材料。 不允許共享包含客戶特定信息的提示庫,不允許跨客戶參考集,不允許在一個客戶材料上進行微調以服務於另一個客戶的利益。這是最可能導致合作關係終止的保密失敗。
  7. 記錄每個任務所使用的模型版本
  8. 進行刪除測試。 要求供應商刪除一個特定測試資產,然後詢問備份和日誌的處理情況。如果供應商無法描述其操作機制,很可能並未真正實施這些機制。

應該如何解讀供應商的保證材料?

認證和框架對齊是很有用的證據,但通常會被過度解讀。瞭解每個認證和框架具體建立了什麼以及沒有建立什麼,可以避免大量不必要的信心誤判。

成果物 它建立了什麼 它沒有建立什麼
ISO/IEC 27001 證書 存在一個信息安全管理系統,並且在特定範圍內經過標準審計 關於你具體輸入數據的保留或培訓使用情況——且該範圍可能不包括你正在購買的服務
SOC 2 報告 針對定義的信任標準的控制措施;類型II覆蓋一段時間,類型I是某時點的設計評估 對你方的義務;它描述的是供應商整體情況,而非你具體的合作項目
NIST AI RMF 對齊 採納了一個被認可的風險管理框架,涵蓋治理、度量和文檔記錄 獨立驗證——這是自願且自我聲明的,除非另有獨立評估
數據處理協議 對你方具有可執行的義務 除非附帶子處理方清單,否則對鏈條下游的供應商沒有任何說明

實際層級結構:首先閱讀數據處理協議和子處理方清單,其次閱讀保留和培訓使用條款,最後閱讀認證內容,以佐證存在一個能夠履行前兩項義務的組織。頁腳上的徽標是一種聲明;請要求證書、範圍說明和審計週期,並將未出具的證書視為不存在。


Lifewood的應對方式

Lifewood 處理客戶項目需求說明、原始資料,在其標註工作中處理大量客戶數據——這使其成為上述安排中定義的‘處理方’,而非僅作為這些數據的評論者。對於任何處於該位置的供應商(包括本供應商),買方應當要求的承諾,正是本文所列舉的:一份簽署的處理協議,包含明確列出的子處理方名單,針對具體項目層級的保留和培訓使用條款,每項任務記錄所使用模型版本及處理內容,客戶數據與共享參考集分離,以及一個可應要求演示的刪除流程。

一個供應商用文件回答,說明其在做工作。一個僅用認證回答的供應商,實際上回答的是一個不同的問題——關於其組織整體而非關於你具體數據的特定問題。參見 AIGC 服務交付方法,以及關於 AI 內容治理、披露和來源追溯 的配套指南,以瞭解使模型版本日誌可實際使用的單個資產記錄。


資料與進一步閱讀

  • GDPR 第28條(處理方——義務與合同條款)和第44條(向第三國轉移)—— 歐盟第2016/679號條例
  • ISO/IEC 27001,信息安全管理系統—— 國際標準化組織
  • 人工智能風險管理框架(AI RMF 1.0) —— 美國國家標準與技術研究院,2023年1月。
  • 第 50 條,透明度義務 — 歐盟人工智能法案(整合文本)。

常見問題

這完全取決於供應商和層級。許多企業層級在合同中明確排除了訓練用途,而消費層級則沒有,且同一產品在不同層級下表現可能不同。務必在合同中明確列出層級名稱,而不是依賴文檔頁面或賬戶設置,因為這些內容都可能隨時更改。

這是必要但不充分的。數據處理協議(DPA)僅約束你的直接供應商;而模型提供商屬於次級處理方,根據第28條,需要獲得其授權。請要求提供次級處理方名單、變更通知承諾以及反對權——DPA的強度取決於這份名單。

應詢問數據處理發生的位置,而非供應商的註冊地,因為推理過程通常在不同司法管轄區運行。當個人數據離開歐洲經濟區(EEA)時,GDPR的轉移規則要求必須有獨立的合法機制,無論供應商的安全性如何。一些提供商提供區域處理選項;需要確認這些選項是否覆蓋你所使用的具體模型,而不是簡單假設。

有時,前提是具備合法基礎、合規的處理安排以及適當的最小化措施。更關鍵的問題通常是:是否真的需要?代表性的或合成的數據在大多數內容任務中能產生可比結果,且從未發送的數據不會留下任何殘留風險。應將真實客戶數據保留用於真正需要它的任務。

這意味著在特定範圍內存在經過審計的信息安全管理體系。請閱讀該範圍說明,因為其可能不涵蓋你實際購買的服務,並注意該證書關注的是安全管理體系,而非數據保留或訓練用途。認證只是佐證;真正約束你的是數據處理協議和數據保留條款。

發送更少的內容。大多數項目需求說明(brief)中包含內部策略、未公開的產品細節和個人數據,而這些數據工作本身並不需要。移除這些內容僅需一次審核即可。列表中其他任何控制措施,都是在最小化措施本應消除的風險上進行管理。

因為事件響應需要它。如果發現數據保留或訓練使用條款被違反,或模型提供商披露了暴露窗口,那麼要確定哪些資產受到影響,唯一的方法是每項任務都記錄下所使用的模型和版本。這份記錄無法在事後重建。

正在規劃 AI 項目或提升品牌可見度?

從 AI 評估、人工參與審核,到 GEO 與 AEO 策略,我們的團隊幫助你穩妥落地項目,在 AI 搜索時代獲得更多關注。

聯繫我們的團隊