IA locale sans cloud : de quelles données parle-t-on exactement ?

Il faut d'abord s'accorder sur les mots. Une IA locale exécute l'inférence — le calcul qui produit une réponse — sur une machine contrôlée par l'entreprise. On-premise désigne un hébergement dans ses locaux ou son datacenter. Sans cloud signifie qu'aucun service distant ne participe au traitement en production ; cela n'exclut pas des dépendances externes pour l'installation, les mises à jour, la télémétrie ou le support. Souverain ajoute une dimension juridique : qui contrôle l'infrastructure et à quel droit est soumis le fournisseur. Le Cloud and AI Development Act (CADA) formalise cette distinction avec quatre niveaux d'assurance, du simple stockage dans l'Union (niveau 1) au contrôle total de la chaîne logicielle sans interférence d'un pays tiers (niveau 4). Une infrastructure européenne n'est donc que le premier palier.

Les familles de données à cartographier

Dans un déploiement type Ollama + OpenWebUI avec un modèle comme Mistral 7B, Llama 3 ou Qwen, on retrouve au minimum :

  • Données de requête : prompts, fichiers joints, données extraites des applications connectées (ERP, GED, messagerie).
  • Données de sortie : réponses, résumés, exports et historique de conversation conservé par l'interface.
  • Données de personnalisation : fragments, embeddings et index vectoriels d'un RAG (Retrieval-Augmented Generation), ou jeux d'exemples et checkpoints d'un fine-tuning.
  • Données techniques : identifiants, jetons de session, journaux applicatifs et réseau, métadonnées (horodatage, adresse IP, nom d'utilisateur).
  • Artefacts : poids du modèle, dépendances logicielles, sauvegardes, données de maintenance.

Les données d'entraînement initial du modèle appartiennent à l'éditeur et n'entrent pas dans ce périmètre. Pour les systèmes à haut risque impliquant un entraînement, l'article 10 du Règlement (UE) 2024/1689 impose toutefois des pratiques de gouvernance des données ; cette exigence ne s'étend pas à un assistant bureautique à risque minimal.

La localisation du serveur ne prouve rien à elle seule. La bonne question est : quel composant communique avec l'extérieur, quand et pourquoi ? Un schéma de flux suffit pour y répondre : utilisateur → interface → orchestrateur → modèle → base documentaire → sauvegardes, avec, pour chaque flèche, l'indication d'un éventuel service tiers.

IA locale sans cloud : quelles données restent réellement en interne ?

Si le serveur, le stockage et le réseau sont internes, si aucune télémétrie n'est active et si les sauvegardes suivent la même politique, alors les prompts, les fichiers, les réponses et l'historique restent dans le périmètre contrôlé. Les documents indexés par un RAG y restent aussi, sous trois formes : fichiers originaux, fragments textuels et vecteurs. Point souvent négligé : un embedding peut révéler le contenu qu'il représente par inversion ou comparaison. Il doit être protégé au même niveau que le document source.

Ce qui peut sortir malgré une installation locale

Vecteur de sortie Données concernées Contrôle à exiger
Activation de licence, vérification de version Identifiant machine, version, parfois nom d'organisation Fonctionnement hors ligne prouvé ou licence perpétuelle
Mises à jour automatiques, téléchargement de modèles Métadonnées système, empreinte réseau Dépôt interne (miroir), mise à jour hors ligne
Connecteur ou extension appelant une API externe Prompts complets, extraits de documents Inventaire des extensions, désactivation par défaut
Télémétrie « anonymisée », monitoring éditeur Statistiques d'usage, parfois extraits de requêtes Désactivation documentée, capture réseau
Support à distance Journaux, captures, accès session Clause contractuelle, accès nominatif et tracé
DNS, proxy, antivirus, EDR mal configurés Domaines consultés, fichiers analysés dans un cloud de sécurité Revue des politiques sortantes

Trois situations, trois niveaux de contrôle

  1. Réseau totalement isolé (air gap) : aucune donnée ne circule vers l'extérieur ; le risque se déplace vers les supports physiques, les exports manuels et les administrateurs.
  2. Réseau interne avec accès internet maîtrisé : le cas le plus fréquent en PME ; tout repose sur le filtrage sortant, la journalisation réseau et l'inventaire des dépendances.
  3. Hébergement chez un prestataire français ou européen : les données quittent les locaux ; il faut documenter la localisation, le droit applicable, la réversibilité et les accès.

La CNIL rappelle que pour les traitements les plus sensibles, le lieu d'hébergement ne suffit pas : il faut examiner le droit auquel le fournisseur est soumis et le risque d'accès par des autorités d'États tiers. Une IA locale réduit fortement l'exposition, elle ne l'annule pas : erreurs de configuration, accès privilégiés et copies de sauvegarde restent à gouverner.

Architecture d'une IA locale : modèle, RAG, fine-tuning et sécurité des flux

Le choix d'architecture détermine quelles données existent, où elles sont stockées et qui peut les lire.

Inférence locale d'un modèle préentraîné

Les prompts et réponses restent sur l'infrastructure choisie, mais le modèle vient d'un éditeur tiers : il faut vérifier sa licence (Apache 2.0, Llama Community License, etc.), sa provenance (empreinte de téléchargement, dépôt officiel) et l'absence de code exécutable douteux dans le fichier. La quantization (réduction de la précision des poids pour tenir sur un GPU modeste) ne change rien à la confidentialité, mais conditionne le matériel requis.

RAG : la voie privilégiée pour les connaissances internes

Le RAG enchaîne ingestion, découpage en fragments, calcul des embeddings, stockage dans un index vectoriel, recherche, puis génération. Un document retiré ou corrigé disparaît de l'index sans réentraînement, et chaque réponse peut citer ses sources. Contrainte majeure : la recherche doit respecter les droits de l'utilisateur, faute de quoi un salarié obtient par l'assistant un passage qu'il ne pouvait pas ouvrir dans la GED. Le filtrage par métadonnées d'autorisation s'applique au moment de la recherche, pas après génération.

Fine-tuning : à manier avec prudence

Jeux d'exemples, checkpoints, artefacts temporaires et journaux d'entraînement contiennent souvent des données confidentielles en clair, et un modèle peut mémoriser et reproduire des informations. Un LoRA (adaptation légère de quelques paramètres) sert à ajuster un style ou un format, pas à injecter des connaissances qui évoluent.

Contrôles techniques à inscrire au cahier des charges

  • Réseau segmenté, filtrage sortant par liste blanche, journalisation des connexions.
  • SSO ou authentification fédérée, RBAC (contrôle d'accès par rôle), secrets hors fichiers de configuration.
  • Chiffrement au repos et en transit, gestion des clés documentée.
  • Filtrage des prompts, DLP (prévention des fuites), quotas et traçabilité par utilisateur.
  • Procédure de purge, sauvegardes testées, mises à jour hors ligne.

Côté matériel, un modèle 7B quantizé fonctionne sur un GPU de 16 à 24 Go ; latence, consommation et maintenance se chiffrent avant l'achat. Le CADA valorise la capacité de calcul européenne et l'open source, mais n'atteste rien sur votre installation. Règle de décision : l'architecture la plus simple qui couvre le cas d'usage, la sensibilité et le besoin de mise à jour. Notre page sur l'installation d'une IA locale sur serveur d'entreprise détaille les configurations proposées.

Cas pratique : déployer un assistant interne sur des documents confidentiels

Prenons une PME industrielle de 80 salariés qui veut interroger ses procédures qualité, ses contrats fournisseurs et ses notes techniques. Le scénario illustre la méthode, pas des résultats de performance.

Parcours d'une question

  1. L'utilisateur s'authentifie via le SSO de l'entreprise.
  2. L'orchestrateur charge ses groupes et droits documentaires.
  3. La recherche dans l'index vectoriel est filtrée sur ces droits avant toute récupération.
  4. Les passages autorisés sont transmis au modèle local, qui génère la réponse.
  5. L'interface affiche les sources, la date d'indexation et une consigne de vérification humaine.
  6. Un journal minimal (utilisateur, horodatage, documents cités) est conservé pour une durée définie.

Chaque donnée du système — fichiers, index, embeddings, prompts, réponses, identifiants, journaux — a un propriétaire, une durée de conservation et une procédure de suppression.

Vérifications avant mise en production

Question Preuve attendue
Le serveur peut-il joindre internet ? Règles de pare-feu sortantes, capture réseau sur 48 h
Le modèle ou l'interface embarque-t-il une télémétrie ? Paramètre désactivé documenté, test de trafic
Les extensions téléchargent-elles du code ? Inventaire des dépendances, dépôt interne figé
Où sont les sauvegardes ? Emplacement, chiffrement, droit applicable à l'hébergeur
Qui accède aux journaux ? Liste nominative, revue trimestrielle
Comment supprimer les données d'un salarié ou d'un client ? Procédure testée couvrant index, embeddings et sauvegardes

Test de fuite

Introduire un document marqué « confidentiel direction », accessible à deux personnes. Demander, avec un compte non autorisé, une restitution directe puis indirecte (« résume les conditions négociées avec le fournisseur X »). Vérifier qu'aucun extrait n'apparaît dans la réponse ni dans les citations, puis contrôler journaux et exports. Répéter après chaque mise à jour.

Le pilote porte sur un corpus non critique, avec un comité métier et sécurité, des indicateurs — exactitude sur un jeu de questions de référence, taux de réponses sans source, latence, refus corrects — et des critères d'arrêt explicites. Les limites sont expliquées aux utilisateurs : hallucinations, documents contradictoires, droits mal renseignés dans la GED, injection de consignes cachées dans un fichier importé, surconfiance. C'est la trame de l'accompagnement IAPRO : audit préalable, installation, personnalisation, formation et maintenance, avec déploiement sur site lorsque l'isolement réseau ou la conservation en France est exigé.

IA locale, souveraineté et conformité : RGPD, AI Act et choix d'hébergement

Le fonctionnement local ne dispense d'aucune obligation. Il change la liste des sous-traitants et la nature des risques.

RGPD : les mêmes questions, posées en interne

Prompts, réponses, journaux et documents indexés contiennent des données personnelles dès qu'un nom de client, de salarié ou de fournisseur y figure. Il faut définir la finalité, appliquer la minimisation (ne pas indexer les fichiers RH si l'assistant sert à la qualité), identifier la base légale, fixer les durées de conservation, garantir les droits des personnes jusque dans l'index vectoriel, inscrire le traitement au registre et conduire une analyse d'impact lorsque le traitement le justifie. Le mainteneur externe qui accède au serveur est un sous-traitant au sens de l'article 28 du RGPD ; son contrat doit le prévoir. Notre glossaire IA précise registre, AIPD et sous-traitant.

AI Act : le risque dépend de l'usage, pas de la technologie

Un modèle installé localement reste soumis aux obligations attachées à son cas d'usage. Un assistant documentaire relève en général du risque minimal ; un outil de tri de candidatures ou de scoring relève de l'annexe III, applicable le 2 décembre 2027 après l'omnibus numérique, avec les exigences de l'article 10 : qualité, pertinence, représentativité, traçabilité des données et gestion des biais. Le guide Regulia sur le classement et les exigences des systèmes à haut risque les détaille article par article. La formation à l'IA de l'article 4 s'applique depuis le 2 février 2025 à tous les déployeurs. Notre hub AI Act oriente vers l'audit correspondant.

Souveraineté : quatre dimensions

  1. Lieu de stockage et de traitement.
  2. Droit applicable au fournisseur : la CNIL recommande, pour les données les plus sensibles, un prestataire exclusivement soumis au droit européen et cite la qualification SecNumCloud de l'ANSSI comme référence.
  3. Contrôle de l'infrastructure.
  4. Transparence de la chaîne logicielle, critère des niveaux 2 et 4 du CADA.

Une architecture on-premise coche souvent les quatre cases, mais seule la documentation le prouve : cartographie des flux, classification des données, registre des sous-traitants, clauses de support, politique de conservation, preuve de désactivation de la télémétrie, tests de sécurité, fiche du modèle, plan de réponse aux incidents.

Déployer une IA locale : méthode, coûts, ROI et critères de décision

Voici la méthode en six étapes que nous proposons.

  1. Diagnostiquer données, applications, maturité et cas d'usage. Le Diag Data IA de Bpifrance finance cette étape : 8 jours d'expert référencé sur 3 mois, mission de 10 000 € HT prise en charge à 40 %, soit 6 000 € HT restant à charge, pour les entreprises de 10 à 2 000 salariés, plus d'un an d'existence et CA d'au moins 1 M€. IAPRO ne réalise pas ce diagnostic mais aide à préparer le dossier et met en œuvre la feuille de route. Le hub aides à l'IA recense les autres dispositifs.
  2. Classer les données par sensibilité et fixer les exigences de résidence, d'isolement, de disponibilité et de réversibilité.
  3. Comparer trois options.
Option Maîtrise des données Coût initial Coût variable Expertise interne requise
Cloud public avec garanties contractuelles Dépend du contrat et du droit du fournisseur Faible Élevé à volume croissant Faible
Cloud français/européen documenté (SecNumCloud si sensible) Bonne, à vérifier contractuellement Moyen Moyen Moyenne
Installation sur site Maximale, si gouvernance en place Élevé (serveur, GPU, intégration) Faible Élevée ou externalisée
  1. Piloter sur un corpus limité avec des utilisateurs formés et des indicateurs définis à l'avance.
  2. Industrialiser sécurité, supervision, mises à jour, sauvegardes, gestion des incidents et revue des accès.
  3. Mesurer et réévaluer valeur et risque à échéance fixe.

ROI : ne pas compter les requêtes

Mesurez le temps économisé par type de tâche, la réduction des recherches manuelles, la qualité des réponses, le taux d'adoption, puis mettez en face infrastructure, maintenance, formation et incidents évités. Notre calculateur de ROI IA structure ce calcul. Une IA locale coûte généralement davantage au départ, mais offre une meilleure maîtrise des données, des coûts variables et de la réversibilité dès que l'usage devient quotidien. Bpifrance mobilise 10 Md€ d'ici 2029 pour l'écosystème IA et observe que la part des PME utilisant l'IA générative est passée de 15 % en 2023 à 31 % en 2024 ; cela n'implique aucune rentabilité automatique pour votre projet. Décidez à partir des flux et du risque, pas d'un slogan : documentez ce qui reste interne, ce qui sort, qui y accède et comment vous le prouvez.

FAQ — IA locale sans cloud et données internes

Une IA locale sans cloud garantit-elle que toutes les données restent dans l'entreprise ?

Non. Elle garantit que l'inférence s'exécute sur votre infrastructure, ce qui supprime les transferts vers un fournisseur d'IA. Mais licence, mises à jour, extensions, télémétrie, support à distance, outils de sécurité et sauvegardes externalisées peuvent faire sortir des données. Seuls un inventaire des flux, un filtrage sortant et une vérification réseau permettent de l'affirmer.

Quelles données peuvent encore sortir d'une IA installée sur un serveur interne ?

Principalement des métadonnées : identifiant machine lors d'une activation, version logicielle, statistiques d'usage. Dans les cas défavorables, des extraits de prompts partent via un connecteur appelant une API externe, une extension non auditée ou un antivirus qui analyse les fichiers dans le cloud. Les sauvegardes hébergées chez un tiers constituent un autre canal souvent oublié.

Les embeddings et les index vectoriels sont-ils des données sensibles ?

Oui, dès lors qu'ils représentent des documents sensibles. Un vecteur n'est pas lisible directement, mais il peut être inversé partiellement ou comparé pour retrouver le contenu d'origine. Si le document source contient des données personnelles ou confidentielles, l'index doit bénéficier du même chiffrement, des mêmes droits d'accès et de la même procédure de suppression.

Quelle différence entre une IA on-premise, une IA souveraine et un cloud européen ?

L'on-premise désigne l'hébergement dans vos locaux ou datacenter. Le cloud européen désigne un hébergement dans l'Union, soit le niveau 1 du Cloud and AI Development Act. La souveraineté ajoute le droit applicable au fournisseur, le contrôle de l'infrastructure et la transparence logicielle. Une IA on-premise est souvent souveraine, mais seule la documentation le démontre.

Une IA locale est-elle automatiquement conforme au RGPD et à l'AI Act ?

Non. Le RGPD s'applique aux prompts, réponses, journaux et documents dès qu'ils contiennent des données personnelles, quel que soit l'hébergement. L'AI Act, le Règlement (UE) 2024/1689, classe le système selon son usage : un assistant documentaire relève du risque minimal, un outil de tri de candidatures de l'annexe III. L'installation locale facilite la maîtrise, elle ne remplace pas l'analyse.

Le RAG est-il plus sûr que le fine-tuning pour exploiter des documents internes ?

En général oui. Avec le RAG, les documents restent dans un index dont on peut retirer ou corriger un élément sans réentraîner le modèle, et chaque réponse peut citer ses sources. Le fine-tuning disperse des données confidentielles dans des jeux d'exemples, des checkpoints et des journaux, avec un risque de mémorisation. Le RAG exige toutefois un filtrage strict par droits d'accès.

Comment vérifier qu'un logiciel d'IA locale n'envoie pas de télémétrie ?

Trois preuves complémentaires : la documentation éditeur indiquant le paramètre de désactivation, une capture du trafic réseau sortant du serveur pendant au moins 48 heures d'usage réel, et une règle de pare-feu en liste blanche qui bloque tout domaine non autorisé. Renouvelez le test après chaque mise à jour, car un paramètre peut être réactivé.

Quand faut-il choisir une installation sur site plutôt qu'un cloud de confiance ?

Lorsque les données exigent un isolement réseau, lorsque la conservation en France ou l'absence d'accès par des autorités étrangères est imposée par un client, un régulateur ou une politique interne, ou lorsque le volume d'usage rend les coûts variables du cloud supérieurs à l'amortissement d'un serveur. Pour des données moins sensibles, un hébergeur qualifié SecNumCloud peut suffire.

Pour aller plus loin avec IAPRO

Si vous hésitez entre serveur interne et cloud de confiance, ou si votre IA locale n'a jamais fait l'objet d'une capture réseau et d'un test de fuite, demandez un audit d'architecture ou un atelier de cadrage. Nous qualifions vos flux, documentons ce qui reste interne et proposons, si nécessaire, une installation d'IA locale sur site avec formation et maintenance. Vérifiez aussi votre éligibilité au Diag Data IA et aux autres dispositifs via notre simulateur d'aides avant de lancer le projet.

Vérifiez vos aides en 2 minutes

Chaque dispositif (Bpifrance, France Num, aides régionales, OPCO) a ses propres critères d'éligibilité et ses propres délais. Notre simulateur croise votre profil avec les dispositifs actifs, ou échangez directement avec un expert IAPRO.

Vérifier mon éligibilité Demander un diagnostic gratuit de 30 min

Liens utiles