如何保護訓練資料以防範 AI 資料外洩

生成式人工智慧 (GenAI) 訓練資料外洩是由攻擊和意外事故造成的。瞭解如何防止資料外洩並減輕其影響。

學習目標

閱讀本文後,您將能夠:

  • 瞭解常見的 AI 訓練資料安全風險
  • 瞭解保護生成式 AI 訓練資料的最佳方法
  • 套用保護 AI 訓練資料、模型、應用程式及工作負載的關鍵原則

複製文章連結

文章摘要:

  • 防止 AI 資料外洩,可透過實施對使用情況的可視化、識別「影子 AI」,以及進行全面的風險評估,來偵測整個人工智慧環境中的漏洞。
  • 降低資料外洩風險,可透過嚴密無漏洞的存取控制,採用最低權限的角色型存取 (RBAC) 與資料分級機制,確保僅授權人員可處理敏感的訓練資料集。
  • 於流程中落實資料最小化、匿名化與輸出篩選,防止生成式模型在回應中產出敏感內容,以保護 AI 管線免於資料外洩。

如何保護訓練資料以防範 AI 資料外洩

生成式人工智慧 (GenAI) 可協助組織提升生產力、做出更佳決策,並大幅加快進度,但前提是他們所使用的大型語言模型 (LLM) 必須經過大量高品質且相關性高的資料訓練。對大多數企業而言,這些訓練資料正是他們最珍貴的智慧財產之一。若要安全地將這些資料導入內部或外部的 GenAI 模型中,就必須採取全面性的方法來辨識與降低風險。

什麼是生成式 AI 訓練資料?

GenAI 使用深度學習模型來產出內容,主要包括文字、影像、音訊、影片或電腦程式碼。為了達到這個目的,這些模型會在大量原始訓練資料上進行訓練,這些資料通常與模型最終輸出的資料形式相同。換句話說,文字產生模型是以文字進行訓練,影片產生器則是以影片進行訓練,以此類推。

在演算法的引導下,模型會逐一檢視訓練資料,分析其中的相關概念、影像或模式。經過多輪訓練與調校後,模型會運用從分析中學到的知識,快速根據使用者輸入的提示,產出新的、相關的內容。

音樂是一個很貼切的比喻:音階、和弦結構以及既有的歌曲或作品就是訓練資料。一位音樂家(就像一個 GenAI 模型)會研究這些資料,以辨識有效的模式,並合成新的獨奏、和弦進行與歌曲(也就是 GenAI 的輸出)。

在企業 IT 領域,組織通常會使用自己的訓練資料來建立 GenAI 模型,或是微調現有模型以執行特定工作。訓練資料可能來自:

  • 內部文件(例如:技術報告、設計文件、使用者手冊)
  • 客戶通訊、支援記錄、電子郵件
  • 公開可用的文字、程式碼存放庫、開放資料集
  • 專有知識庫、智慧財產權封存
  • 透過網路爬行、API 或第三方資料集擷取的外部來源

由於生成式模型依賴大規模資料訓練,許多組織會同時納入內部與外部資料。但從安全角度來看,這種混合方式具有風險。內部資料通常經過較嚴格的審核,而將敏感性或專有資訊與外部資料混在一起,可能透過現代的反演 (inversion) 攻擊或基於提示的攻擊,創造出新的下游資料外洩途徑。

什麼是訓練資料外洩?

當模型訓練資料中的敏感、私人或專有內容透過模型輸出、推斷查詢、記錄或輔助產物(例如嵌入向量)直接或間接被揭露時,就發生了「訓練資料外洩」。其中,「記憶外洩」是一種訓練資料外洩的類型,指的是模型的輸出重現了其訓練資料中的部分內容。

GenAI 生命週期的多個階段都可能發生洩漏:

  • 訓練階段的外洩:敏感內容或受保護的資訊在不經意間進入了訓練資料集,之後模型將其洩露。
  • 推斷階段外洩:攻擊者製作提示哄騙模型,使其洩露內部或私人資料。
  • 梯度或參數外洩:在分散式訓練中,當大型模型的訓練任務被分配到多個處理器上執行時,參數更新可能會在不經意間洩露訓練資料。

為什麼保護 AI 訓練資料很重要?

有幾個相互關聯的原因,說明為什麼組織(特別是那些處理敏感或受監管資料的組織)必須以與其他 IT 資產相同的嚴謹程度,來保障其 AI 流程的安全

訓練資料對組織和攻擊者都很有價值

AI 專案經常仰賴內部、專有或受監管的資料,例如客戶資料、財務記錄、法律合約、商業機密、原始碼等等。如果模型洩露了個人識別資訊 (PII) 或商業機密,可能造成嚴重後果。這類洩露可能導致身分盜用、競爭優勢外流、監管罰款、聲譽受損,以及 IP 遭竊。

即使只是片段資訊(例如姓名、地址、小段程式碼)外洩,這些資訊仍可能被彙整或與外部資料相互關聯,進而引發更大規模的資料外洩事件。

隱私權保護失敗往往代價高昂

資料隱私權法律,包括歐洲的《一般資料保護規定》(GDPR)、美國《加州消費者隱私法案》(CCPA),以及美國的《健康保險可攜性與責任法案》(HIPAA) 等產業特定法規,對個人資料的處理、縮製、取得同意及資料外洩通報等方面,皆設有嚴格的義務規定。若模型外洩了個人識別資訊或個人屬性,可能使組織違反這些法規,從而引發罰款、報告要求、稽核和集體訴訟責任。

主要的訓練資料安全性風險有哪些?

模型訓練資料的主要威脅分為三大類:惡意攻擊、因缺乏 AI 使用情況可見度而產生的威脅,以及 API 和端點漏洞。

來自惡意行為者的攻擊

內部人員攻擊:內部人員威脅是一個長期存在的問題:擁有特殊權限的開發人員、機器學習工程師或資料科學家,可能會蓄意外洩訓練資料,或在資料集中插入敏感樣本。他們可能存取訓練記錄、參數傾印、提示記錄或中繼產物,以提取或重建敏感內容。由於這些團隊成員通常擁有正當的存取權限,因此要偵測惡意行為,就需要強大的監控機制、詳細的紀錄留存,以及職責分離等防護措施。

模型反演攻擊:模型反演(以及成員推斷)攻擊旨在重建或確認某些資料點是否曾屬於訓練資料集的一部分。攻擊者透過精心設計的查詢,或探測模型的信心分布,可能從模型本身重建出私人的像素層級資料(針對視覺模型)或文字資料(針對 LLM)。

換句話說,這個「黑箱」模型成了攻擊者用來還原私人資料的視窗。

除了反演攻擊之外,敵對性查詢攻擊、模型萃取,或是透過持續查詢來「竊取」模型,也都是潛在的威脅。

AI 風險與漏洞

這些風險源於團隊採用和使用生成式 AI 工具的方式——而這些使用方式往往缺乏管控。

影子 AI:「影子 AI」是指在沒有監督、審核或與中央控管機制整合的情況下使用 AI 工具。這些 AI 工具可能會將內部文件或資料上傳至第三方模型(例如公開的大型語言模型),進而產生安全團隊無從得知的安全盲點與資料外洩風險。

存取控制不足:如果對訓練資料、嵌入向量、提示記錄、中繼表示或模型權重的權限過於寬鬆,那麼不需要完整存取權的使用者或系統,可能會在不經意間看到或洩漏敏感內容。權限過高的角色設定,或是鬆散的角色型存取控制 (RBAC),通常是常見的根本原因。

因生成式 GenAI 輸入與輸出造成的非故意外洩:有時候,資料外洩會非故意地透過模型的輸入或輸出管道發生。用於訓練的內部提示可能包含敏感文字,或者使用者可能在不知情的情況下,將專有內容輸入互動式模型中。模型可能會試圖「協助」使用者,而在其輸出中回顯部分該敏感輸入內容,進而將其暴露給下游系統。同樣地,提示與回應的記錄或封存檔,也可能在不經意間成為私人資料的存放庫。

API 和端點漏洞

當模型透過 API 對外開放時,也會對服務基礎架構帶來額外的風險。如果驗證機制限速、端點清理或輸入篩選等措施不夠嚴謹,攻擊者可能會發動以下類型的攻擊:

  • 提示插入攻擊:攻擊者誘騙 AI 模型無視其指令並產生有害或非預期的回應。
  • 鏈結或探測攻擊:網路犯罪分子會傳送一系列精心設計的問題,逐步挖掘出訓練資料或其他與模型行為相關的敏感資訊。
  • 參數或模型竊取:攻擊者透過反覆向模型傳送查詢,嘗試在不直接存取的情況下複製其底層邏輯或訓練資料。
  • 中間人攻擊或側信道攻擊:網路犯罪分子會攔截或竊聽 API 流量,以竊取資料或操縱結果。
  • API 邊界中斷:API 防禦中的任何弱點都可能導致敏感性資料外洩或被濫用。

如何降低訓練資料外洩的風險

要降低訓練資料風險,組織需要採取更全面的安全方法,將技術、政策和組織解決方案整合起來。這些解決方案應提供:

對 AI 使用情況(模型、工具和應用程式)的可見性

瞭解您的團隊使用的 AI 模型、工具和應用程式,是降低其中某個工具可能外洩訓練資料風險的第一步。

  • AI 清查與探索:使用掃描工具、問卷調查或基於智慧體的監控,來識別哪些團隊、專案或服務正在使用人 AI 具(包括公開工具或內部工具)。標示出未經核准的使用情況。
  • 影子 AI 偵測:監控 SaaS 的使用情況、異常的輸出流量,或與 AI 相關的網域連線,以偵測未經批准的模型上傳或 API 呼叫
  • 治理監督:將 AI 的使用與風險、合規與治理政策連結起來,以保障員工安全。要求所有新模型提案或資料流程在部署前,都必須經過安全或隱私團隊的審核。

全面評估 AI 環境的風險

在您完整掌握團隊所使用的工具後,下一步就是分析其中潛在的弱點與可能的攻擊途徑。

  • 資料分類與標記:嚴格依照敏感程度(例如 PII、受限資料、公開資料)對訓練資料進行標記。利用這些標籤來執行相關政策。
  • 資料來源追溯與歷程追蹤:完整記錄資料的擷取、轉換、分割、擴增與篩選等過程。如此一來,您就能清楚知道哪些上游資料來源餵入了哪些模型。
  • 風險評分:針對每個資料集或模型,評估其資料外洩風險的嚴重性與可能性。採取深層保護措施優先保護高風險資產。
  • 威脅建模:針對每個模型或 AI 服務,模擬潛在的攻擊者路徑、資料外洩途徑及其可能造成的後果。

嚴密的存取控制

確保只有經過授權的正確使用者,能在適當的時間存取適當的資訊。

  • 基於最低權限原則的角色型存取控制 (RBAC):僅對需要存取的使用者或系統授權。不要讓模型開發人員擁有檢視所有原始資料、提示記錄或嵌入向量的無限制權限。
  • 職責分離:將不同職能(例如資料擷取、模型訓練、提示管理、推斷部署)分開,確保沒有任何單一角色能掌握所有環節。
  • 屬性型存取控制 (ABAC):根據使用者屬性、使用情境、時間或用途,實施細緻的存取控制。
  • 存取請求稽核與即時佈建:在可能情況下,對於敏感資料的存取要求,需進行臨時權限提升或核准程序,並記錄所有存取行為。
  • 稽核追蹤與監控:擷取並審查誰查詢了模型、返回了哪些輸出和異常偵測(例如不尋常的提示模式)等記錄。
  • 紅隊演練與滲透測試定期模擬敵對者試圖存取或擷取資料的行為,以測試您現有的防護措施是否有效。

在您的 AI 管道中採用最佳資料安全做法

從訓練、驗證到推斷,請在整個 AI 開發生命週期中層層設定防護措施,以確保資料的隱私與完整性。

  • 資料縮製與匿名化/假名化:僅納入訓練目標絕對必要的資料。移除個人識別資訊或對其進行標記化處理,並盡可能運用差分隱私技術或合成資料。
  • 清理和篩選:使用模式比對或啟發式方法,掃描擷取到的資料,在訓練前偵測並移除敏感或不需要的內容。
  • 雜訊插入:引入經過精細調校的雜訊或模糊化處理,以降低模型記住極其特定執行個體的能力。
  • 模型輸出篩選與防護機制:透過篩選器或政策對模型輸出進行後處理,以封鎖或清理敏感內容。
  • 提示清理和內容控制:仔細構建提示結構,以最大程度地降低反映私人背景資訊的風險。對於檢索增強生成 (RAG) 系統,在將擷取的上下文傳遞到模型之前,請先審查並清理

Cloudflare 如何助您一臂之力

保護 AI 訓練資料最有效的解決方案,能協助團隊落實最佳做法,同時不增加現有系統的複雜度。Cloudflare AI Security Suite 提供可見度與安全控管功能,幫助企業標準化並簡化其保護生成式與自主式 AI 的方式。這個統一平台將連線性、網路和應用程式安全性等安全存取服務邊緣 (SASE) 功能以及開發人員工具整合為單一解決方案,讓您能夠自信地應對 AI 安全挑戰

深入瞭解如何使用 Cloudflare AI Security Suite 保護 AI 系統。

常見問題集

什麼是生成式人工智慧 (GenAI) 訓練資料?

GenAI 模型是在大量原始資料(例如文字、影像或影片)上進行訓練的。這些訓練資料可能來自內部文件、客戶通訊、專有知識庫,或外部的公開來源。

在 GenAI 模型中,訓練資料外洩是如何發生的?

當模型訓練資料中的敏感、私人或專有內容透過模型輸出、記錄、推斷查詢或輔助產物直接或間接被揭露時,就發生了「訓練資料外洩」。這種外洩可能發生在訓練階段、推論階段,或是在分散式訓練中因梯度或參數外洩而導致。

為什麼保護 AI 訓練資料對組織至關重要?

保護 AI 訓練資料至關重要,因為這些資料通常包含具有價值、專有或受法規管制的資訊,例如商業機密、客戶資料及財務記錄。一旦這類資料外洩,可能造成嚴重後果,包括身分盜用、競爭優勢外流、法規罰則(如違反 GDPR 或 HIPAA)、聲譽損害,以及 IP 遭竊。

AI 訓練資料面臨哪三大主要安全風險?

針對模型訓練資料的主要安全風險,大致可分為三大類:惡意攻擊、因缺乏對 AI 使用情況的可見度而產生的威脅,以及 API 和端點漏洞。具體範例包括內部人員攻擊、「影子 AI」(即未受控制地使用 AI 工具),以及針對透過 API 開放的模型所發起的提示插入攻擊。

什麼是「模型反演攻擊」?它如何危害訓練資料?

模型反演攻擊試圖重建或確認某些特定的資料點是否包含在訓練集中。攻擊者會透過精心設計的查詢或探測模型的信心分佈來達成此目的,本質上是將這個「黑箱模型」當作一個透鏡,來還原私密資料,例如私人文字內容或像素層級的資訊。

什麼是「影子 AI」?它如何造成資料外洩風險?

「影子 AI」指的是在沒有中央監督、審核或與安全控管機制整合的情況下使用 AI 工具。這會給安全團隊帶來安全盲點,因為員工可能會將內部文件或資料上傳至未經授權的第三方模型,進而導致敏感或專屬資訊外洩。

降低訓練資料風險的四大關鍵緩解領域是哪些?

為了降低訓練資料的風險,組織應實施能提供以下功能的解決方案:(1) 對 AI 使用情況的可見度;(2) 對 AI 環境的全面性風險評估;(3) 嚴密的存取控制;以及 (4) 在整個 AI 流程中遵循資料安全最佳做法。

在 AI 流程中,可以採用哪些資料安全技術來保護資料隱私?

資料安全的最佳做法可以貫穿整個 AI 生命週期,並包括以下措施:資料縮製與匿名化、資料清理與篩選、雜訊插入,以及模型輸出篩選,用以封鎖或清理敏感內容。

---