Comment sécuriser les données d'entraînement contre les fuites de données liées à l'IA

Les fuites de données d'entraînement de l'IA générative (GenAI) sont les conséquences d'attaques et d'accidents. Apprenez à prévenir les fuites de données et à en atténuer les effets.

Objectifs d’apprentissage

Cet article s'articule autour des points suivants :

  • Comprendre les risques courants liés à la sécurité des données d'entraînement de l'IA
  • Identifier les meilleures façons de protéger les données d'entraînement de l'IA générative
  • Appliquer des principes essentiels pour protéger les données d’entraînement, les modèles, les applications et les charges de travail d’IA

Copier le lien de l'article

Résumé de l’article :

  • Empêchez les fuites de données d’IA en concrétisant une visibilité sur l’utilisation, en identifiant l’« IA clandestine » et en effectuant des évaluations complètes des risques pour détecter les vulnérabilités dans l’ensemble de votre environnement d’intelligence artificielle.
  • Atténuez les risques de fuites de données grâce à l’application rigoureuse des contrôles d’accès, en utilisant le principe du moindre privilège (RBAC pour Role-Based Access Control ou contrôle des accès basé sur les rôles) et la classification des données afin de garantir que seules les personnes autorisées peuvent manipuler les jeux de données d’entraînement sensibles.
  • Protégez le pipeline contre les fuites de données grâce à la minification et à l’anonymisation des données ainsi qu’au filtrage des résultats nécessaires pour empêcher l’apparition de contenus sensibles dans les réponses des modèles génératifs.

Comment sécuriser les données d'entraînement contre les fuites de données liées à l'IA

L'IA générative (GenAI) peut aider les entreprises à être plus productives, à prendre des décisions plus avisées et à agir bien plus rapidement ; toutefois cela n'est possible que si les grands modèles de langage (LLM) qu'elles utilisent sont entraînés sur de grandes quantités de données présentant un intérêt et de grande qualité. Pour la plupart des entreprises, ces données d'entraînement représentent une part importante de leur propriété intellectuelle. L'introduction sécurisée de ces données dans des modèles GenAI internes ou externes nécessite une approche holistique pour identifier et atténuer les risques.

Que sont les données d'entraînement de l'IA générative ?

L'IA générative utilise des modèles d'apprentissage en profondeur pour produire du contenu : principalement du texte, des images, de l'audio, de la vidéo ou du code informatique. Pour ce faire, ces modèles sont entraînés sur de grandes quantités de données brutes d'entraînement, qui prennent généralement la forme des données que le modèle produira. En d'autres termes, les modèles de génération de texte sont entraînés sur du texte, les générateurs vidéo sur de la vidéo, etc.

Guidé par des algorithmes, un modèle analyse les données d'entraînement pour y déceler les concepts, images ou schémas pertinents. Au fil des sessions d'entraînement et d'affinage, le modèle utilise ce qu'il apprend de cette analyse pour répondre rapidement aux invites des utilisateurs avec un contenu nouveau et adapté aux besoins.

La musique est une analogie utile : les gammes mélodiques, les formations d'accords et les chansons ou œuvres existantes sont les données d'entraînement. Un musicien (comme un modèle d'IA générative) les étudie afin d'identifier les schémas efficaces et de synthétiser de nouveaux solos, progressions et chansons (sorties de l'IA générative).

Dans l'informatique d'entreprise, les organisations utilisent souvent leurs propres données d'entraînement pour créer des modèles GenAI ou affiner les modèles existants afin d'effectuer des tâches spécifiques. Les données d'entraînement peuvent provenir de :

  • Documents internes (par exemple, rapports techniques, documents de conception, manuels d'utilisation)
  • Correspondance avec les clients, journaux d'assistance, e-mails
  • Texte accessible au public, référentiels de code et ensembles de données ouverts
  • Bases de connaissances propriétaires, archives de propriété intellectuelle
  • Sources externes ingérées par indexation web, API ou ensembles de données tiers

Étant donné que les modèles génératifs dépendent de l'échelle, de nombreuses organisations intègrent des données internes et externes. Toutefois, du point de vue de la sécurité, ce mélange est risqué. Les données internes font souvent l'objet d'un meilleur contrôle. Le fait d'associer des informations sensibles ou propriétaires avec des données externes peut créer de nouveaux vecteurs de fuites en aval par le biais d'inversions modernes ou d'attaques basées sur des invites.

Qu’est-ce qu’une fuite de données d’entraînement ?

Une fuite de données d’entraînement se produit lorsque des contenus sensibles,confidentiels ou propriétaires issus des données d’entraînement du modèle sont exposés, directement ou indirectement, via les sorties du modèle, les requêtes d’inférence, les journaux ou les artefacts auxiliaires (tels que les intégrations). La « fuite de mémorisation » est un type de fuite de données d’apprentissage qui survient lorsque les sorties d’un modèle reproduisent des parties de ses données d’entraînement.

Des fuites peuvent se produire à plusieurs stades du cycle de vie de l’IA générative :

  • Fuite lors de la phase d'entraînement : du contenu sensible ou des informations protégées sont introduits par inadvertance dans l'ensemble de données d'entraînement, et le modèle les révèle par la suite.
  • Fuite lors de l'étape d'inférence : des attaquants créent des invites pour inciter un modèle à révéler des données internes ou confidentielles.
  • Fuite de gradients ou de paramètres : dans l'entraînement distribué, lorsque l'entraînement d'un grand modèle est réparti sur plusieurs processeurs, les mises à jour des paramètres peuvent révéler par inadvertance des données d'entraînement.

Pourquoi est-il important de sécuriser les données d’entraînement de l’IA ?

Les entreprises (notamment celles qui traitent des données sensibles ou soumises à un règlement) doivent sécuriser leurs pipelines IA avec la même rigueur que leurs autres ressources informatiques.

Les données d’entraînement sont précieuses pour les organisations et les attaquants

Les projets d’IA reposent fréquemment sur des données internes, propriétaires ou réglementées : données clients, dossiers financiers, contrats juridiques, secrets commerciaux, code source, etc. Si le modèle divulgue des informations d’identification personnelle ou des secrets commerciaux, les conséquences peuvent être graves : vols d’identité, exposition à la concurrence, amendes réglementaires, atteinte à la réputation ou encore vol d’adresses IP.

Même si seuls des fragments (par exemple, des noms, des adresses ou de courts extraits de code) s'échappent, ils peuvent être agrégés ou corrélés à des données externes pour provoquer une violation de données plus importante.

Les failles de confidentialité coûtent très cher

Les lois sur la confidentialité des données, y compris le Règlement général sur la protection des données (RGPD) en Europe, la California Consumer Privacy Act (CCPA) et les règles spécifiques à l’industrie comme la Health Insurance Portability and Accountability Act (HIPAA) aux États-Unis, imposent des obligations strictes en matière de traitement des données personnelles, de minimisation, de consentement et de notification de violation. Un modèle qui divulgue des informations d’identification personnelle ou des attributs personnels peut exposer l’organisation à une violation de ces lois, entraînant des amendes, des obligations de déclaration, des audits et une responsabilité en cas de recours collectif.

Quels sont les principaux risques liés à la sécurité des données d'entraînement ?

Les principales menaces qui pèsent sur les données d'entraînement des modèles se répartissent en trois grandes catégories : les attaques malveillantes, les menaces liées à un manque de visibilité sur l'utilisation de l'IA, et les vulnérabilités des API et des points de terminaison.

Attaques par des acteurs malveillants

Attaques internes : les menaces internes sont un problème classique : un développeur privilégié, un ingénieur en apprentissage automatique ou un scientifique expert des données peut intentionnellement exfiltrer des données d'entraînement ou injecter des échantillons sensibles dans des ensembles de données. Il peut alors accéder aux journaux d'entraînement, aux vidages de paramètres, aux journaux d'invites ou aux artefacts intermédiaires pour extraire ou reconstruire du contenu sensible. Ces membres d'équipe bénéficiant souvent d'un accès légitime, la détection de comportements malveillants nécessite une surveillance précise, une journalisation rigoureuse et une séparation des tâches.

Attaques par inversion de modèle : les attaques par inversion de modèle (et inférence d'appartenance) visent à reconstruire ou à confirmer si certains points de données faisaient partie de l'ensemble d'entraînement. En créant des requêtes ou en sondant les attributions de confiance du modèle, les attaquants peuvent reconstruire des données confidentielles au niveau du pixel (dans les modèles visuels) ou des données textuelles (pour les LLM) à partir du modèle lui-même.

En d'autres termes, le modèle de la « boîte noire » devient un moyen par lequel les acteurs malveillants peuvent récupérer des données confidentielles.

En plus de l'inversion, les attaques par requêtes hostiles, l'extraction de modèles, voire le « vol » d'un modèle par interrogation continue, constituent des menaces supplémentaires.

Risques et vulnérabilités liés à l’IA

Ces risques découlent de la façon dont les équipes adoptent et utilisent les outils d'IA générative, souvent de manière non contrôlée.

IA fantôme : l’« IA fantôme » désigne l'utilisation d'outils d'IA sans supervision, ni évaluation, ni intégration aux contrôles centraux. Ces outils d'IA peuvent téléverser des documents ou des données internes vers des modèles tiers (par exemple, des LLM publics), ce qui crée des angles morts et provoque une exposition sans que l'équipe de sécurité en ait conscience.

Contrôles d'accès inadéquats : si les autorisations d'accès aux données d'entraînement, aux intégrations, aux journaux d'invites, aux représentations intermédiaires ou aux pondérations de modèle sont trop larges, il peut arriver que des utilisateurs ou les systèmes n'ayant pas besoin d'un accès complet consultent ou divulguent du contenu sensible par inadvertance. Les rôles trop privilégiés ou le laxisme en matière de contrôle des accès en fonction du rôle (RBAC) sont des causes fondamentales courantes.

Exposition accidentelle par les entrées et sorties d'IA générative : des fuites se produisent parfois involontairement via les canaux d'entrée ou de sortie du modèle. Une invite interne utilisée pour l'entraînement peut contenir du texte sensible, et un utilisateur peut introduire involontairement du contenu propriétaire dans un modèle interactif. La sortie du modèle peut renvoyer des portions de cette entrée sensible dans le but « d'aider », ce qui l'expose aux systèmes en aval. De même, les journaux ou archives des sessions d'invite/réponse peuvent devenir, par inadvertance, un référentiel de données privées.

Vulnérabilités des API et des points de terminaison

Lorsque les modèles sont exposés via des API, ils présentent un risque supplémentaire pour l'infrastructure de service. Si l'authentification, le contrôle du volume des requêtes, l'assainissement des points de terminaison ou le filtrage des entrées sont faibles, les adversaires peuvent lancer :

  • Attaques par injection d'invite : des attaquants incitent un modèle d'IA à ignorer ses instructions et à produire des réponses nuisibles ou non désirées.
  • Attaques par chaînage ou sondage : les cybercriminels envoient une série de questions pertinentes pour découvrir progressivement les données d'entraînement ou d'autres informations sensibles sur le comportement d'un modèle.
  • Vol de paramètres ou de modèles : les attaquants interrogent le modèle de manière répétée afin de copier sa logique sous-jacente ou ses données d'entraînement sans accès direct.
  • Attaques de l'homme du milieu (on-path) ou exploitations par canal auxiliaire : les cybercriminels interceptent ou écoutent le trafic lié aux API afin de dérober des données ou de manipuler les résultats.
  • Failles dans le périmètre de l'API : tout point faible dans les défenses d'une API peut laisser fuiter des données sensibles ou être utilisé à mauvais escient.

Comment atténuer les risques de fuites de données d'entraînement

Pour réduire les risques liés aux données d'entraînement, les organisations doivent envisager la sécurité de manière globale, en intégrant des solutions techniques, stratégiques et organisationnelles. Ces solutions doivent garantir :

Visibilité sur l'utilisation de l'IA (modèles, outils et applications)

Connaître les modèles, outils et applications d'IA que vos équipes utilisent est la première étape pour réduire le risque d'une exposition par l'un d'eux des données d'entraînement.

  • Inventaire et découverte de l'IA : utilisez des analyses, des questionnaires ou une surveillance basée sur des agents pour identifier les équipes, les projets ou les services qui utilisent des outils d'IA (publics ou internes). Signaler toute utilisation non autorisée.
  • Détection de l'IA fantôme (Shadow AI) : Surveillez l'utilisation de solutions SaaS, le trafic sortant inhabituel ou les connexions de domaines associées à l'IA, afin de détecter les chargements de modèles non approuvés ou les appels d'API.
  • Supervision de la gouvernance : intégrez l'utilisation de l'IA aux politiques de risque, de conformité et de gouvernance pour le personnel. Exiger que les nouvelles propositions de modèles ou les pipelines de données soient examinés par les équipes de sécurité ou de confidentialité avant le déploiement.

Évaluation complète des risques liés à votre environnement d’IA

Une fois que vous avez une vue d'ensemble de ce que vos équipes utilisent, analysez ces éléments pour identifier les vulnérabilités potentielles et les vecteurs d'attaque.

  • Classification et étiquetage des données : étiquetez rigoureusement les données d'entraînement en fonction de leur sensibilité (par ex. : informations d'identification personnelle, restreintes, publiques). Utilisez ces balises pour faire appliquer les politiques.
  • Traçabilité des données et suivi de la provenance : assurer la traçabilité complète de l'ingestion, des transformations, des divisions, des augmentations et des filtres de données. De cette façon, vous savez exactement quelles sources en amont alimentent quels modèles.
  • Évaluation des risques : pour chaque ensemble de données ou modèle, évaluez la gravité et la probabilité du risque de fuite. Prévoir une protection renforcée en priorité pour les actifs à haut risque.
  • Modélisation des menaces : pour chaque modèle ou service d’IA, modélisez les chemins potentiels des acteurs malveillants, les vecteurs de fuite et les conséquences.

Contrôle d’accès hermétique

Assurez-vous que seuls les utilisateurs autorisés accèdent aux informations appropriées au moment opportun.

  • Contrôle des accès basé sur les rôles (RBAC) et sur le moindre privilège : n'accordez l'accès qu'au personnel ou aux systèmes qui en ont besoin. N'autorisez pas les modélisateurs à inspecter librement toutes les données brutes, les journaux d'invites ou les intégrations.
  • Séparation des tâches : séparez les rôles (ingestion de données, entraînement du modèle, administration des invites, déploiement de l’inférence) afin qu’aucun rôle ne détienne tous les éléments.
  • Contrôle d'accès basé sur les attributs (ABAC) : utilisez des contrôles précis basés sur les attributs de l'utilisateur, le contexte, l'heure ou la finalité.
  • Audits des demandes d'accès et provisionnement juste-à-temps : dans la mesure du possible, exigez une élévation temporaire ou des approbations pour l'accès aux données sensibles. Consigner tous les accès.
  • Pistes d'audit et surveillance : capturez et examinez les journaux d'activité concernant les personnes ayant interrogé les modèles, les sorties renvoyées et la détection d'anomalies (par exemple, les logiques d'invites inhabituelles).
  • Red teaming et tests de pénétration : simulez régulièrement les tentatives indésirables d’accès ou d’extraction de données afin de tester vos mesures de contrôle.

Sécurité des données : meilleures pratiques tout au long de votre pipeline d'IA

De la formation à la validation et à l'inférence, des mesures de protection sont mises en place à chaque étape du cycle de vie du développement de l'IA pour garantir la confidentialité et l'intégrité des données.

  • Minimisation et anonymisation/pseudonymisation des données : seules les données absolument nécessaires à l’objectif d’entraînement doivent être ajoutées. Supprimez ou anonymisez les informations d’identification personnelle et utilisez des techniques de confidentialité différentielle ou des données synthétiques dès que possible.
  • Assainissement et filtrage : utilisez la correspondance de modèles ou les méthodes heuristiques pour analyser les données ingérées afin de détecter et de supprimer les contenus sensibles ou indésirables avant l'entraînement.
  • Injection de bruit : entrez un bruit ou une obfuscation soigneusement calibrés pour réduire la capacité du modèle à mémoriser des instances extrêmement spécifiques.
  • Filtrage des sorties de modèle et garde-fous : appliquez un post-traitement aux sorties de modèle à l'aide de filtres ou de politiques qui bloquent ou assainissent le contenu sensible.
  • Assainissement des invites et contrôle du contexte : structurez soigneusement les invites afin de limiter au minimum le risque d’évoquer un contexte confidentiel. Pour les systèmes de génération augmentée par récupération (RAG), vérifiez et assainissez le contexte récupéré avant de le transmettre au modèle.

Ce que Cloudflare peut vous apporter

Les solutions les plus efficaces pour protéger les données d’entraînement de l’IA permettent aux équipes d’adopter les pratiques recommandées sans complexifier les systèmes existants. La Cloudflare AI Security Suite offre une visibilité et des contrôles de sécurité grâce auxquels les organisations peuvent normaliser et simplifier leur approche de la protection de l’IA générative et agentique. Cette plateforme unifiée rassemble la connectivité, les fonctions Secure Access Service Edge (SASE) telles que la sécurité réseau et applicative, et les outils de développement en une solution unique grâce à laquelle vous pouvez, en toute confiance, faire face aux difficultés liées à la sécurité de l’IA.

Cliquez ici pour en savoir plus sur la sécurisation des systèmes d'IA avec Cloudflare AI Security Suite.

FAQ

Que sont les données d'entraînement de l'IA générative (GenAI) ?

Les modèles d'IA générative sont entraînés sur de grandes quantités de données brutes, telles que du texte, des images ou des vidéos. Ces données d'entraînement peuvent provenir de documents internes, de la correspondance client, de bases de connaissances propriétaires ou de sources publiques externes.

Comment les fuites de données d'entraînement se produisent-elles dans un modèle d'IA générative ?

Il y a fuite de données d'entraînement lorsque du contenu sensible, confidentiel ou propriétaire issu des données d'entraînement est exposé, directement ou indirectement, par le biais des sorties de modèles, des journaux, des requêtes d'inférence ou des artefacts auxiliaires. Des fuites peuvent se produire pendant la phase d'entraînement, la phase d'inférence, ou par le biais de fuites de gradients ou de paramètres lors d'un entraînement distribué.

Pourquoi la sécurisation des données d'apprentissage de l'IA est-elle essentielle pour les entreprises ?

La sécurisation des données d'entraînement de l'IA est essentielle, car ces données comprennent souvent des informations précieuses, exclusives ou réglementées, telles que des secrets commerciaux, des données client et des dossiers financiers. « Les fuites de ces données peuvent provoquer des dommages importants, notamment des usurpations d'identité, des expositions à la concurrence, des amendes réglementaires (comme dans le cadre du RGPD ou de la loi HIPAA), des atteintes à la réputation et des vols d'adresses IP. »

Quelles sont les trois principales catégories de risques liés à la sécurité pour les données d'entraînement de l'IA ?

Les principaux risques liés à la sécurité des données d'entraînement des modèles se répartissent en trois grandes catégories : les attaques malveillantes, les menaces résultant d'un manque de visibilité sur l'utilisation de l'IA, et les vulnérabilités des API et des points de terminaison. Les attaques internes, l'« IA fantôme » (utilisation non contrôlée d'outils d'IA) et les attaques par injection d'invites ciblant les modèles exposés aux API en sont quelques exemples.

Qu'est-ce qu'une « attaque par inversion de modèle » et comment compromet-elle les données d'entraînement ?

Une attaque par inversion de modèle tente de reconstruire ou de confirmer si des points de données spécifiques ont été inclus dans l'ensemble de données d'entraînement. Les attaquants procèdent en créant des requêtes ou en sondant la répartition de la confiance dans le modèle, essentiellement à l'aide du modèle de la « boîte noire » comme moyen de récupérer des données confidentielles, telles que des informations textuelles ou des informations au niveau du pixel.

Qu'est-ce que la « shadow AI (IA fantôme) » et comment fait-elle naître un risque de fuites de données ?

La « Shadow AI » désigne l'utilisation d'outils d'IA sans supervision, évaluation ni intégration centralisées aux contrôles de sécurité. Cela crée des angles morts pour les équipes de sécurité, car les employés peuvent télécharger des documents internes ou des données vers des modèles tiers non autorisés, et expose ainsi des informations sensibles ou exclusives.

Quels sont les quatre principaux domaines d'atténuation permettant de réduire les risques liés aux données d'entraînement ?

Pour atténuer les risques liés aux données d'apprentissage, les entreprises doivent déployer des solutions qui offrent : (1) une visibilité sur l'utilisation de l'IA ; (2) une évaluation complète des risques liés à l'environnement de l'IA ; (3) un contrôle d'accès hermétique ; et (4) de bonnes pratiques en matière de sécurité des données tout au long du pipeline d'IA.

Quelles techniques de sécurité des données peuvent être appliquées pendant le pipeline d'IA pour protéger la confidentialité des données ?

« Les bonnes pratiques en matière de sécurité des données peuvent être mises en œuvre à tous les stades du cycle de vie de l’IA et comprennent : la minimisation et l’anonymisation des données, l’assainissement et le filtrage des données, l’injection de bruit et le filtrage des résultats des modèles afin de bloquer ou d’assainir les contenus sensibles. »

---