生成式人工智慧 (GenAI) 訓練資料外洩是由攻擊和意外事故造成的。瞭解如何防止資料外洩並減輕其影響。
閱讀本文後,您將能夠:
複製文章連結
生成式人工智慧 (GenAI) 可協助組織提升生產力、做出更佳決策,並大幅加快進度,但前提是他們所使用的大型語言模型 (LLM) 必須經過大量高品質且相關性高的資料訓練。對大多數企業而言,這些訓練資料正是他們最珍貴的智慧財產之一。若要安全地將這些資料導入內部或外部的 GenAI 模型中,就必須採取全面性的方法來辨識與降低風險。
GenAI 使用深度學習模型來產出內容,主要包括文字、影像、音訊、影片或電腦程式碼。為了達到這個目的,這些模型會在大量原始訓練資料上進行訓練,這些資料通常與模型最終輸出的資料形式相同。換句話說,文字產生模型是以文字進行訓練,影片產生器則是以影片進行訓練,以此類推。
在演算法的引導下,模型會逐一檢視訓練資料,分析其中的相關概念、影像或模式。經過多輪訓練與調校後,模型會運用從分析中學到的知識,快速根據使用者輸入的提示,產出新的、相關的內容。
音樂是一個很貼切的比喻:音階、和弦結構以及既有的歌曲或作品就是訓練資料。一位音樂家(就像一個 GenAI 模型)會研究這些資料,以辨識有效的模式,並合成新的獨奏、和弦進行與歌曲(也就是 GenAI 的輸出)。
在企業 IT 領域,組織通常會使用自己的訓練資料來建立 GenAI 模型,或是微調現有模型以執行特定工作。訓練資料可能來自:
由於生成式模型依賴大規模資料訓練,許多組織會同時納入內部與外部資料。但從安全角度來看,這種混合方式具有風險。內部資料通常經過較嚴格的審核,而將敏感性或專有資訊與外部資料混在一起,可能透過現代的反演 (inversion) 攻擊或基於提示的攻擊,創造出新的下游資料外洩途徑。
當模型訓練資料中的敏感、私人或專有內容透過模型輸出、推斷查詢、記錄或輔助產物(例如嵌入向量)直接或間接被揭露時,就發生了「訓練資料外洩」。其中,「記憶外洩」是一種訓練資料外洩的類型,指的是模型的輸出重現了其訓練資料中的部分內容。
GenAI 生命週期的多個階段都可能發生洩漏:
有幾個相互關聯的原因,說明為什麼組織(特別是那些處理敏感或受監管資料的組織)必須以與其他 IT 資產相同的嚴謹程度,來保障其 AI 流程的安全。
AI 專案經常仰賴內部、專有或受監管的資料,例如客戶資料、財務記錄、法律合約、商業機密、原始碼等等。如果模型洩露了個人識別資訊 (PII) 或商業機密,可能造成嚴重後果。這類洩露可能導致身分盜用、競爭優勢外流、監管罰款、聲譽受損,以及 IP 遭竊。
即使只是片段資訊(例如姓名、地址、小段程式碼)外洩,這些資訊仍可能被彙整或與外部資料相互關聯,進而引發更大規模的資料外洩事件。
資料隱私權法律,包括歐洲的《一般資料保護規定》(GDPR)、美國《加州消費者隱私法案》(CCPA),以及美國的《健康保險可攜性與責任法案》(HIPAA) 等產業特定法規,對個人資料的處理、縮製、取得同意及資料外洩通報等方面,皆設有嚴格的義務規定。若模型外洩了個人識別資訊或個人屬性,可能使組織違反這些法規,從而引發罰款、報告要求、稽核和集體訴訟責任。
模型訓練資料的主要威脅分為三大類:惡意攻擊、因缺乏 AI 使用情況可見度而產生的威脅,以及 API 和端點漏洞。
內部人員攻擊:內部人員威脅是一個長期存在的問題:擁有特殊權限的開發人員、機器學習工程師或資料科學家,可能會蓄意外洩訓練資料,或在資料集中插入敏感樣本。他們可能存取訓練記錄、參數傾印、提示記錄或中繼產物,以提取或重建敏感內容。由於這些團隊成員通常擁有正當的存取權限,因此要偵測惡意行為,就需要強大的監控機制、詳細的紀錄留存,以及職責分離等防護措施。
模型反演攻擊:模型反演(以及成員推斷)攻擊旨在重建或確認某些資料點是否曾屬於訓練資料集的一部分。攻擊者透過精心設計的查詢,或探測模型的信心分布,可能從模型本身重建出私人的像素層級資料(針對視覺模型)或文字資料(針對 LLM)。
換句話說,這個「黑箱」模型成了攻擊者用來還原私人資料的視窗。
除了反演攻擊之外,敵對性查詢攻擊、模型萃取,或是透過持續查詢來「竊取」模型,也都是潛在的威脅。
這些風險源於團隊採用和使用生成式 AI 工具的方式——而這些使用方式往往缺乏管控。
影子 AI:「影子 AI」是指在沒有監督、審核或與中央控管機制整合的情況下使用 AI 工具。這些 AI 工具可能會將內部文件或資料上傳至第三方模型(例如公開的大型語言模型),進而產生安全團隊無從得知的安全盲點與資料外洩風險。
存取控制不足:如果對訓練資料、嵌入向量、提示記錄、中繼表示或模型權重的權限過於寬鬆,那麼不需要完整存取權的使用者或系統,可能會在不經意間看到或洩漏敏感內容。權限過高的角色設定,或是鬆散的角色型存取控制 (RBAC),通常是常見的根本原因。
因生成式 GenAI 輸入與輸出造成的非故意外洩:有時候,資料外洩會非故意地透過模型的輸入或輸出管道發生。用於訓練的內部提示可能包含敏感文字,或者使用者可能在不知情的情況下,將專有內容輸入互動式模型中。模型可能會試圖「協助」使用者,而在其輸出中回顯部分該敏感輸入內容,進而將其暴露給下游系統。同樣地,提示與回應的記錄或封存檔,也可能在不經意間成為私人資料的存放庫。
當模型透過 API 對外開放時,也會對服務基礎架構帶來額外的風險。如果驗證機制、限速、端點清理或輸入篩選等措施不夠嚴謹,攻擊者可能會發動以下類型的攻擊:
要降低訓練資料風險,組織需要採取更全面的安全方法,將技術、政策和組織解決方案整合起來。這些解決方案應提供:
瞭解您的團隊使用的 AI 模型、工具和應用程式,是降低其中某個工具可能外洩訓練資料風險的第一步。
在您完整掌握團隊所使用的工具後,下一步就是分析其中潛在的弱點與可能的攻擊途徑。
確保只有經過授權的正確使用者,能在適當的時間存取適當的資訊。
從訓練、驗證到推斷,請在整個 AI 開發生命週期中層層設定防護措施,以確保資料的隱私與完整性。
保護 AI 訓練資料最有效的解決方案,能協助團隊落實最佳做法,同時不增加現有系統的複雜度。Cloudflare AI Security Suite 提供可見度與安全控管功能,幫助企業標準化並簡化其保護生成式與自主式 AI 的方式。這個統一平台將連線性、網路和應用程式安全性等安全存取服務邊緣 (SASE) 功能以及開發人員工具整合為單一解決方案,讓您能夠自信地應對 AI 安全挑戰。
深入瞭解如何使用 Cloudflare AI Security Suite 保護 AI 系統。
GenAI 模型是在大量原始資料(例如文字、影像或影片)上進行訓練的。這些訓練資料可能來自內部文件、客戶通訊、專有知識庫,或外部的公開來源。
當模型訓練資料中的敏感、私人或專有內容透過模型輸出、記錄、推斷查詢或輔助產物直接或間接被揭露時,就發生了「訓練資料外洩」。這種外洩可能發生在訓練階段、推論階段,或是在分散式訓練中因梯度或參數外洩而導致。
保護 AI 訓練資料至關重要,因為這些資料通常包含具有價值、專有或受法規管制的資訊,例如商業機密、客戶資料及財務記錄。一旦這類資料外洩,可能造成嚴重後果,包括身分盜用、競爭優勢外流、法規罰則(如違反 GDPR 或 HIPAA)、聲譽損害,以及 IP 遭竊。
針對模型訓練資料的主要安全風險,大致可分為三大類:惡意攻擊、因缺乏對 AI 使用情況的可見度而產生的威脅,以及 API 和端點漏洞。具體範例包括內部人員攻擊、「影子 AI」(即未受控制地使用 AI 工具),以及針對透過 API 開放的模型所發起的提示插入攻擊。
模型反演攻擊試圖重建或確認某些特定的資料點是否包含在訓練集中。攻擊者會透過精心設計的查詢或探測模型的信心分佈來達成此目的,本質上是將這個「黑箱模型」當作一個透鏡,來還原私密資料,例如私人文字內容或像素層級的資訊。
「影子 AI」指的是在沒有中央監督、審核或與安全控管機制整合的情況下使用 AI 工具。這會給安全團隊帶來安全盲點,因為員工可能會將內部文件或資料上傳至未經授權的第三方模型,進而導致敏感或專屬資訊外洩。
為了降低訓練資料的風險,組織應實施能提供以下功能的解決方案:(1) 對 AI 使用情況的可見度;(2) 對 AI 環境的全面性風險評估;(3) 嚴密的存取控制;以及 (4) 在整個 AI 流程中遵循資料安全最佳做法。
資料安全的最佳做法可以貫穿整個 AI 生命週期,並包括以下措施:資料縮製與匿名化、資料清理與篩選、雜訊插入,以及模型輸出篩選,用以封鎖或清理敏感內容。
---