Confidentialité 7 min de lecture

Utiliser l'IA générative sans exposer les données de sa PME

Les questions à poser à un prestataire, une échelle de sensibilité en quatre niveaux, ce que le RGPD impose vraiment, et une liste de contrôle à utiliser.

C’est la question qui bloque le plus de projets, et c’est une bonne question. Savoir où partent vos données quand un collaborateur ouvre un assistant conversationnel mérite une réponse précise, pas une promesse commerciale. Ce guide donne les questions à poser, une échelle pour classer vos données, et ce que la réglementation impose concrètement.

Le vrai risque n’est pas celui que l’on croit

La crainte la plus répandue est celle du modèle qui apprendrait vos secrets et les restituerait à un concurrent. C’est un risque réel mais devenu marginal chez les fournisseurs sérieux, parce qu’il est explicitement écarté par contrat dans les offres professionnelles.

Le risque courant, celui qui se produit réellement dans les entreprises, est beaucoup plus prosaïque. Un collaborateur, faute d’outil fourni par l’entreprise, ouvre un compte personnel sur un service grand public et y colle un contrat, un fichier client ou une fiche de paie pour se faire aider. Il n’a aucune mauvaise intention. Il n’a simplement rien d’autre à sa disposition.

Ce constat commande la stratégie. Interdire sans fournir d’alternative ne protège rien : cela déplace l’usage hors de votre vue. La protection réelle passe par la mise à disposition d’un outil autorisé, assorti d’une règle simple que chacun peut retenir.

La différence entre une application grand public et une interface de programmation

Cette distinction est la plus utile du guide, et elle est mal connue.

Quand vous utilisez la version gratuite ou personnelle d’un assistant en ligne, vous êtes dans un cadre grand public. Les conditions d’utilisation peuvent prévoir que vos échanges servent à améliorer le service, et vous n’avez signé aucun contrat de traitement de données avec le fournisseur. C’est parfaitement acceptable pour rédiger un texte sans enjeu. Ce ne l’est pas pour vos données clients.

Quand un prestataire construit un système pour vous, il n’utilise pas cette application. Il appelle une interface de programmation, c’est-à-dire un accès technique au modèle, dans le cadre d’une offre professionnelle. Les conditions y sont différentes : les contenus envoyés ne servent pas à entraîner les modèles, un contrat de sous-traitance au sens du règlement général sur la protection des données est signé, et la région d’hébergement peut souvent être choisie.

Le même modèle, la même technologie, deux cadres juridiques sans rapport. Ne jugez donc jamais une technologie sur l’expérience que vous avez eue de son application grand public.

Il existe un troisième cadre, intermédiaire et très courant : les offres professionnelles des éditeurs, achetées par licence pour vos équipes. Elles offrent en général un engagement de non-réutilisation des données. Elles restent à vérifier une par une, parce que les conditions varient d’un éditeur à l’autre et changent avec le temps.

Les six questions à poser à tout prestataire ou éditeur

Posez-les par écrit, et attendez des réponses écrites. Un fournisseur sérieux y répond en quelques lignes et sans gêne. Un fournisseur qui les esquive vous renseigne tout autant.

  • Où mes données sont-elles traitées, dans quel pays et sous quelle juridiction.
  • Sont-elles conservées après le traitement, et si oui combien de temps exactement.
  • Servent-elles à entraîner ou à améliorer le modèle, et cet engagement figure-t-il au contrat.
  • Quelle région d’hébergement puis-je choisir, et cette option est-elle incluse ou facturée.
  • Qui sont vos sous-traitants, y compris le fournisseur du modèle lui-même et l’hébergeur.
  • Que se passe-t-il si je mets fin au contrat : mes données sont-elles supprimées, sous quel délai, avec quelle preuve.

La cinquième question est celle que l’on oublie le plus souvent, et c’est la plus instructive. Beaucoup d’éditeurs de logiciels ont ajouté des fonctions d’intelligence artificielle générative en appelant un modèle tiers. Votre contrat est avec l’éditeur, mais vos données transitent chez un autre acteur, parfois hors d’Europe. Ce n’est pas nécessairement un problème, à condition que vous le sachiez et que la chaîne soit documentée.

Une échelle de sensibilité en quatre niveaux

Classer toutes vos données au niveau le plus strict revient à ne rien faire. Les distinguer permet d’avancer vite là où c’est possible, et prudemment là où il le faut.

Niveau 1, données publiques ou banales

Vos contenus déjà publiés, vos supports commerciaux, un texte générique, une note interne sans enjeu. Aucune contrainte particulière. Tout outil professionnel sérieux convient, et se priver de l’intelligence artificielle générative à ce niveau n’a aucun sens.

Niveau 2, données internes non personnelles

Vos procédures, vos documents techniques, vos chiffres d’activité agrégés, votre code applicatif. Une divulgation serait ennuyeuse sans être grave. Le niveau raisonnable est celui d’une offre professionnelle sous contrat, avec engagement écrit de non-réutilisation et hébergement en Europe de préférence.

Niveau 3, données personnelles et données clients

Fichiers clients, contrats, échanges nominatifs, transcripts de rendez-vous, dossiers de candidature. Le règlement général sur la protection des données s’applique pleinement. Il faut un contrat de sous-traitance en bonne et due forme, un hébergement européen, une durée de rétention courte et définie, une inscription au registre des traitements, et une information des personnes concernées. C’est le niveau de la très grande majorité des chantiers utiles en PME, et il est parfaitement praticable.

Niveau 4, données sensibles ou stratégiques

Données de santé, données d’infrastructures critiques, secrets industriels, informations dont la fuite mettrait l’entreprise en difficulté. Ici, la question de l’hébergement se pose différemment. Il devient raisonnable d’exécuter un modèle ouvert sur une machine que vous contrôlez, dans votre infrastructure ou chez un hébergeur européen dédié, de sorte qu’aucune donnée ne sorte de votre périmètre.

Cette dernière option mérite d’être connue, parce qu’on la croit souvent hors de portée d’une PME. Elle ne l’est plus. Les modèles ouverts récents, exécutés sur une machine correctement dimensionnée, suffisent à de nombreuses tâches de classement, d’extraction et de résumé. Ils restent en retrait des meilleurs modèles propriétaires sur le raisonnement complexe, et coûtent plus cher en infrastructure qu’en appels facturés à l’usage. C’est un arbitrage, pas une évidence, et il se décide au cas par cas.

Ce que le RGPD impose concrètement

Sans entrer dans le détail juridique, cinq obligations reviennent systématiquement dans les chantiers que nous menons.

Vous devez pouvoir justifier une base légale au traitement, qui est le plus souvent votre intérêt légitime ou l’exécution d’un contrat. Vous devez inscrire le traitement à votre registre, ce qui prend quelques lignes et reste la première chose que l’on vous demandera en cas de contrôle. Vous devez signer un contrat de sous-traitance avec chaque fournisseur qui traite des données personnelles pour votre compte. Vous devez informer les personnes concernées, y compris vos propres salariés lorsque l’outil traite leurs données. Et vous devez appliquer la minimisation, c’est-à-dire n’envoyer au modèle que ce dont la tâche a besoin.

Ce dernier point est le plus efficace en pratique, et le moins appliqué. Beaucoup de traitements fonctionnent aussi bien sur des données réduites ou pseudonymisées. Retirer les noms et les identifiants avant l’appel au modèle, quand la tâche ne les exige pas, règle une bonne partie du sujet par construction plutôt que par contrat.

Un mot enfin sur le règlement européen sur l’intelligence artificielle. Il classe les usages par niveau de risque et fait peser les obligations les plus lourdes sur les fournisseurs de systèmes à haut risque, typiquement dans le recrutement, le crédit ou la sécurité des personnes. Pour l’usage courant en PME, assistance à la rédaction, résumé, classement de documents, les obligations principales relèvent de la transparence : indiquer qu’un contenu a été généré, informer les personnes qui interagissent avec un système automatisé, et tenir à jour un inventaire de vos usages. Si vous touchez au recrutement ou à l’évaluation de personnes, faites-vous accompagner, car le régime y est nettement plus exigeant.

Votre liste de contrôle

À parcourir avant de mettre en service un usage impliquant des données réelles.

  • Le niveau de sensibilité des données concernées est identifié et écrit.
  • L’outil utilisé est une offre professionnelle sous contrat, pas un compte personnel.
  • L’engagement de non-réutilisation des données pour l’entraînement figure au contrat.
  • La région d’hébergement est connue et acceptable au regard du niveau de sensibilité.
  • La durée de conservation est définie, courte, et effectivement appliquée.
  • La chaîne complète de sous-traitants est documentée, fournisseur du modèle compris.
  • Le traitement figure au registre et les personnes concernées sont informées.
  • Seules les données nécessaires à la tâche sont transmises.
  • Une règle écrite, tenant en cinq lignes, dit aux équipes ce qui est autorisé et ce qui ne l’est pas.
  • Une alternative autorisée existe pour chaque usage interdit, faute de quoi la règle sera contournée.

Ce guide ne constitue pas un conseil juridique. Il décrit les points que nous traitons systématiquement dans nos chantiers, et il ne remplace pas l’avis de votre conseil ou de votre délégué à la protection des données, en particulier sur les traitements de niveau 3 et 4.

Nos propres engagements sur le traitement des données de nos clients sont détaillés sur la page confidentialité des données. Et si vous voulez savoir quels usages sont réellement praticables chez vous compte tenu de votre niveau de sensibilité, c’est l’une des questions que tranche un diagnostic, domaine par domaine.

Étape suivante

Par où commencer chez vous ?

Dix jours pour cartographier où part le temps de vos équipes, chiffrer les leviers et désigner le premier système à construire. Si l'IA n'est pas la bonne réponse, je vous le dirai.

Diagnostic

Étape 1

10 jours

9 500 € HT · forfait, sur un domaine

  • Cartographie du temps réellement passé sur le domaine audité
  • Les leviers chiffrés en heures dégagées, classés par effort et par gain
  • La note de confidentialité : quelle donnée sort, où elle est traitée
  • Un plan de chantier à trois mois, avec le premier système à construire