L'essentiel sur l'IA souveraine France
IA souveraine n'est pas synonyme d'IA « hébergée en UE ». Utiliser l'API OpenAI avec l'option Data Residency EU (ou Azure OpenAI avec data center Paris) garantit contractuellement que vos données « restent en UE ». Ce que cette formule ne garantit pas : que Microsoft US ou OpenAI US ne puissent pas y accéder en vertu du CLOUD Act (Clarifying Lawful Overseas Use of Data Act, 2018). Ce texte autorise les autorités américaines à obtenir de toute entreprise incorporée aux États-Unis l'accès à des données qu'elle contrôle, quel que soit le pays d'hébergement physique. C'est précisément ce que le RGPD Art.46 sur les transferts hors EEE, l'AI Act Art.25 sur la gouvernance des données, les lignes directrices CNIL post-Schrems II et les exigences DORA cloud risk cherchent à prévenir. La seule façon d'éliminer ce risque : déployer un modèle open weights (Mistral Large 2) sur une infrastructure française sans actionnaire américain (OVHcloud) avec une configuration « no call home ». C'est ce que Nehos déploie.
La stack IA souveraine standard Nehos repose sur cinq couches. Couche LLM : Mistral Large 2 (ou Mistral Small pour les usages budget-contraints) servi via vLLM sur GPU cluster OVHcloud — H100 80 GB NVL pour l'inférence LLM, A100 40 GB pour les embeddings RAG. Couche vectorielle : Qdrant auto-hébergé sur OVHcloud pour le retrieval augmenté (RAG). Couche persistance : Postgres 16 avec extensions pgaudit (traçabilité AI Act) et pgcrypto (chiffrement at rest). Couche orchestration : LangGraph / LangChain pour les agents multi-étapes. Couche observabilité : Langfuse auto-hébergé (tokens, latence, coût, évaluation). Pour les secteurs spécifiques : instances OVHcloud HDS-certifiées pour les données de santé, PCI-DSS applicatif pour les flux de paiement, et 3DS Outscale SecNumCloud-qualifié pour les organisations à sensibilité défense ou souveraineté maximale. Voir [service Cloud Souverain Nehos](/services/souverainete-numerique-responsable/cloud-souverain) pour la couche infrastructure.
Méthode de déploiement Nehos en quatre phases. Phase 1 — Audit de souveraineté (5-10 jours) : cartographie des flux de données actuels vers les LLM tiers (OpenAI, Anthropic, Google), qualification CLOUD Act risk, analyse RGPD Art.46, gap analysis AI Act. Phase 2 — Architecture souveraine (2-4 semaines) : design du GPU cluster OVHcloud, sizing H100/A100 selon volumes token estimés, architecture RAG, plan de migration depuis les API tiers. Phase 3 — Déploiement et tests (4-8 semaines) : provisioning OVHcloud, déploiement vLLM + Mistral, pipeline RAG (Qdrant + Mistral Embed), orchestration LangGraph, monitoring Langfuse, tests de charge et de sécurité (OWASP LLM Top 10). Phase 4 — Transfert de compétences et MCO : formation des équipes IT, documentation opérationnelle, SLA 99,5 % uptime, astreinte.
Tarification indicative : 715 k€ HT selon la complexité du projet. Fourchette basse (30-511 k€ HT) : POC IA souveraine sur périmètre restreint (1-2 cas d'usage, stack légère GPU A100 partagé OVHcloud, RAG sur corpus documentaire interne < 50 000 documents). Fourchette intermédiaire (55-211 k€ HT) : déploiement complet avec GPU H100 dédié, RAG multi-corpus, intégrations applicatives (ERP, CRM, SIRH, GED), conformité AI Act documentée. Fourchette haute (6,5 k€ HT) : projet multi-agents souverains, secteur réglementé (HDS santé / DORA finance / collectivité CNIL), intégration SecNumCloud, audit de conformité inclus. MCO mensuel : 15 872 € HT selon volume tokens et SLA. Premier chiffrage gratuit en 30 minutes via RDV consultant.
IA Souveraine — Mistral Large 2 Auto-hébergé OVHcloud, Zéro Transfert Hors UE
Nehos déploie des infrastructures IA souveraines pour ETI, collectivités, secteurs réglementés (santé, finance, défense) : Mistral Large 2 auto-hébergé sur OVHcloud (GPU cluster dédié ou partagé), LlaMA 3 / Qwen optionnels, aucun transfert de données vers les serveurs Mistral AI SA, OpenAI, Anthropic ou leurs partenaires US. RGPD by design, AI Act conforme, compatible HDS pour données de santé. Stack complète : LLM + RAG + vector store (Qdrant) + orchestration (LangGraph) + monitoring (Langfuse). 715 k€ HT.
Adapté à toute taille de structure
#IA souveraine vs IA « conforme RGPD » — La distinction critique
En 2026, la majorité des DSI et DPO d'ETI françaises ont reçu des offres de fournisseurs cloud US avec la mention « données hébergées en UE » ou « conforme RGPD ». C'est une formulation marketing qui mérite d'être décortiquée avec précision, parce que la nuance engage directement votre exposition légale.
#Ce que « conforme RGPD » signifie chez les fournisseurs US
Microsoft Azure OpenAI Service avec Data Residency Europe, OpenAI Enterprise avec EU data processing terms, Anthropic Claude avec DPA UE : ces offres garantissent contractuellement que (1) vos données sont physiquement stockées dans des data centers européens, (2) le fournisseur traite les données selon les exigences RGPD, (3) des Clauses Contractuelles Types (CCT / Standard Contractual Clauses) UE sont signées pour légaliser le transfert international. C'est réel. Ce n'est pas une promesse vide.
Mais ce n'est pas de la souveraineté.
Voici pourquoi. Le CLOUD Act américain (Clarifying Lawful Overseas Use of Data Act, 18 U.S.C. § 2713, entré en vigueur mars 2018) impose à toute entreprise soumise à la juridiction américaine — ce qui inclut Microsoft, OpenAI LLC, Anthropic PBC — de fournir aux autorités américaines, sur ordonnance ou citation, l'accès aux données qu'elle contrôle ou possède, indépendamment de leur localisation physique. Un data center à Paris opéré par Microsoft US n'échappe pas au CLOUD Act. Un data center à Dublin opéré par Amazon US non plus.
Cela crée un conflit de lois direct avec le RGPD (le fournisseur ne peut pas légalement à la fois respecter le CLOUD Act et le RGPD dans certaines situations). La CNIL, dans ses lignes directrices post-arrêt Schrems II (C-311/18, juillet 2020), a explicitement noté ce risque. Le Comité Européen de Protection des Données (CEPD) a publié en 2021 des recommandations sur les mesures supplémentaires pour les transferts hors EEE qui indiquent que les garanties techniques doivent rendre l'accès aux données « cryptographiquement inaccessible » au tiers américain, ce que les offres standard ne font pas.
Par ailleurs, pour les offres non-Enterprise d'OpenAI, Anthropic et Google : vos prompts servent à l'amélioration du modèle (opt-out disponible mais pas toujours activé par défaut sur les comptes business). Sur les offres Enterprise, l'opt-out est contractualisé — mais vous restez CLOUD Act-exposés sur l'accès gouvernemental.
#Ce que la souveraineté réelle signifie
Une IA véritablement souveraine remplit trois conditions simultanément. (1) Les poids du modèle sont hébergés sur une infrastructure que vous contrôlez ou qu'un opérateur français sans actionnaire américain contrôle (OVHcloud SAS, filiale d'OVH Groupe SA, capital français). (2) Le modèle n'envoie aucune donnée à un serveur tiers lors de l'inférence — la configuration vLLM + Mistral en « mode offline » ne fait aucune requête réseau vers mistral.ai, openai.com ou tout autre endpoint externe. (3) L'opérateur infrastructure (OVHcloud) n'est pas soumis à la juridiction américaine et n'a pas signé d'accord de cloud commercial avec une entité américaine lui imposant le droit US sur les données hébergées.
Mistral Large 2, publié en open weights en juillet 2024, répond exactement à ce critère : les poids peuvent être téléchargés, auto-hébergés sur n'importe quel GPU cluster, et utilisés sans aucune connexion à l'API publique de Mistral AI SA. Le modèle est compact (123 milliards de paramètres) mais compétitif avec GPT-4o sur les benchmarks européens et nettement supérieur sur le français, l'espagnol et les langues romanes. Pour vos données : elles ne quittent jamais votre périmètre réseau.
C'est la distinction que votre DPO, votre RSSI et votre conseil juridique attendent que vous fassiez en 2026. Cf glossaire LLM souverain et service RGPD Transferts Nehos.
#Mistral AI — Le LLM souverain de référence en France
Mistral AI est une société française fondée en 2023 par Arthur Mensch, Guillaume Lample et Timothée Lacroix — anciens de DeepMind et Meta FAIR. Siège social à Paris 10e, capital majoritairement européen (Lightspeed, a16z ont investi mais la gouvernance reste française, pas d'accord de cloud commercial avec un opérateur US). Mistral AI n'est pas une filiale d'un groupe américain, n'est pas soumise au CLOUD Act, et a explicitement conçu ses modèles en open weights pour permettre l'auto-hébergement.
#Pourquoi Mistral plutôt que Llama 3 ou Qwen pour la souveraineté maximale ?
Llama 3 est un excellent modèle open weights publié par Meta Platforms Inc. (entreprise américaine, Menlo Park, Californie). Si vous auto-hébergez Llama 3 sur OVHcloud, vous êtes techniquement souverain sur l'inférence — les poids ne téléphonent pas à Meta. Cependant, les poids ont été entraînés sur les serveurs Meta (infrastructure US), ce qui crée un risque théorique de backdoor ou de propriété intellectuelle US sur le modèle. En pratique, pour la quasi-totalité des usages ETI, ce risque est académique. Mais pour certains clients de défense ou de souveraineté critique (administration, santé stratégique), la préférence Mistral EU est justifiée.
Qwen (série Alibaba) est un modèle open weights compétitif, performant en multilingue incluant le français. Le risque : Alibaba Cloud est soumis à la loi chinoise sur la cybersécurité et le renseignement national (loi de juin 2017), qui impose une obligation similaire au CLOUD Act en termes d'accès gouvernemental aux données. Pour les ETI françaises, substituer une dépendance américaine par une dépendance chinoise n'est pas un gain de souveraineté.
Mistral offre le meilleur compromis pour la France : entreprise EU, open weights, performances FR/ES supérieures à Llama 3 sur les benchmarks MMLU-FR et HellaSwag-FR, partenariat commercial avec OVHcloud qui permet d'accéder à Mistral Large 2 via l'API OVHcloud AI Deploy (infra OVHcloud, pas Mistral API publique) ou via auto-hébergement complet. Voir spécifications techniques Mistral AI.
#Mistral API OVHcloud vs auto-hébergement Mistral OVHcloud : nuance importante
Ce point est souvent mal compris. Deux configurations existent. (1) API Mistral via OVHcloud AI Deploy : vous appelez un endpoint OVHcloud, le modèle tourne sur l'infra OVHcloud, vos données ne transitent pas par Mistral AI SA. C'est plus souverain que l'API publique Mistral, plus simple à déployer, mais vous partagez la même infrastructure GPU avec d'autres clients OVHcloud (multi-tenant). (2) Auto-hébergement Mistral Large 2 sur bare metal GPU OVHcloud dédié : vous téléchargez les poids, vous déployez vLLM sur votre propre serveur H100 dédié, l'instance ne communique avec aucun tiers externe. C'est la configuration maximalement souveraine — isolation complète, aucune dépendance au gateway OVHcloud, coût plus élevé mais zero-vendor-lock sur l'inférence. Cf OVHcloud AI Deploy et Training.
Nehos déploie systématiquement l'option (2) pour les clients des secteurs réglementés (santé HDS, finance DORA, défense). L'option (1) est acceptable pour des ETI non-réglementées cherchant un compromis coût/souveraineté.
#Stack IA souveraine Nehos — Composants et flux de données
Architecture de référence déployée par Nehos sur tous les projets IA souveraine. Chaque composant est auto-hébergé sur OVHcloud, sans dépendance SaaS externe au périmètre UE.
Couche 1 — GPU Cluster OVHcloud Serveurs bare metal GPU OVHcloud. H100 80 GB NVL (ou H100 SXM pour les GPU clusters haute densité) pour l'inférence LLM Mistral Large 2 — coût indicatif à partir de 992 € HT/mois pour un serveur H100 dédié. A100 40 GB pour les embeddings RAG (Mistral Embed) — coût indicatif à partir de 1 113 € HT/mois. Pour les projets budget-contraints ou les POC : GPU A100 partagé OVHcloud AI Deploy (facturation à la requête, souveraineté moindre mais acceptable en non-réglementé). Instances certifiées HDS pour les projets santé — OVHcloud est certifié Hébergeur de Données de Santé depuis 2016. Toutes les instances OVHcloud sont localisées dans les data centers français (Gravelines, Roubaix, Strasbourg) ou européens (Varsovie, Francfort selon disponibilité).
Couche 2 — Serving LLM (vLLM) vLLM (version ≥ 0.4) en mode production sur la couche GPU. Interface API OpenAI-compatible (endpoints /v1/chat/completions et /v1/embeddings identiques à l'API OpenAI) — ce qui rend Mistral un drop-in replacement transparent pour tout code LangChain, LlamaIndex ou client HTTP existant qui ciblait OpenAI. Configuration « no network » : vLLM ne fait aucun appel réseau externe une fois les poids chargés. Rate limiting sur la couche API Gateway (Kong) pour éviter la saturation GPU par un sous-ensemble d'utilisateurs.
Couche 3 — Embeddings souverains (Mistral Embed) Mistral Embed (modèle d'embedding multilingue natif Mistral, 1024 dimensions) sur la couche A100 dédiée. Supérieur à text-embedding-ada-002 (OpenAI) sur les corpus français — benchmark MTEB-FR. Même principe : modèle auto-hébergé, aucun appel réseau externe lors de l'encodage des documents.
Couche 4 — Vector Store (Qdrant auto-hébergé) Qdrant (vector database open source) déployé sur un serveur OVHcloud dédié avec SSD NVMe. Persistance des embeddings de votre corpus documentaire (contrats, procédures, documentation technique, base de connaissances). Distance cosine ou dot product selon les cas d'usage. Réplication en mode haute disponibilité pour les projets production. Aucune donnée vectorielle ne quitte l'infrastructure OVHcloud. Cf service Agents IA RAG Nehos.
Couche 5 — Persistance et traçabilité (Postgres 16) Postgres 16 avec extensions pgaudit (log de toutes les requêtes SQL — critique pour la traçabilité AI Act Art.12 sur la journalisation), pgcrypto (chiffrement at rest des colonnes sensibles), pg_partman (partitionnement par date pour les tables de logs LLM). Chaque appel LLM entrant et sortant est loggé avec timestamp, user_id pseudonymisé, input hash, output hash, tokens consommés, latence — immuable via trigger BEFORE DELETE. Cet audit trail est l'élément clé lors d'un contrôle AI Act ou RGPD. Cf glossaire Cloud Souverain.
Couche 6 — Orchestration agents (LangGraph) LangGraph (framework Microsoft Research Labs, open source) pour les agents multi-étapes complexes : RAG avec rerankage, agents avec mémoire conversationnelle persistante (Postgres), agents avec outils (recherche interne, appels ERP/CRM/SIRH via API internes). LangChain pour les pipelines RAG plus simples. Les deux fonctionnent nativement avec l'interface OpenAI-compatible de vLLM — zéro modification de code pour switcher de GPT-4o vers Mistral Large 2 auto-hébergé.
Couche 7 — Observabilité LLM (Langfuse auto-hébergé) Langfuse (observabilité LLM open source) déployé en self-hosted sur OVHcloud — ni Langfuse Cloud ni Helicone SaaS (qui hébergent vos traces LLM sur leurs serveurs). Dashboards : nombre de tokens par session, latence P50/P90/P99, coût équivalent (pour benchmarking vs API publiques), évaluations qualité (scores LLM-as-judge, scores humains), drift de qualité dans le temps. SDK Python et TypeScript disponibles, intégration transparente LangGraph/LangChain. C'est l'outil que nous utilisons pour démontrer la conformité AI Act Art.17 (surveillance post-commercialisation).
Couche 8 — Sécurité réseau et secrets mTLS (mutual TLS) entre tous les composants (vLLM, Qdrant, Postgres, Langfuse, Kong) — chaque service authentifie le service appelant, pas seulement le token. HashiCorp Vault auto-hébergé pour la gestion des secrets (clés API internes, credentials Postgres, certificats mTLS). Kong API Gateway pour le rate limiting et le routing. Fail2ban sur les endpoints exposés. Firewall OVHcloud Network Security Group restrictif (allowlist IP interne uniquement sur les ports LLM et vecteurs). OWASP LLM Top 10 appliqué : prompt injection filtering (détection regex + LLM-based), output validation, confidential data leakage prevention.
#Secteurs réglementés — Santé (HDS), Finance (DORA), Défense, Collectivités
#Santé — Hébergeur de Données de Santé (HDS)
Toute IA traitant des données de santé à caractère personnel (dossiers médicaux, diagnostics, prescriptions, résultats biologiques, imagerie médicale) doit être hébergée chez un prestataire certifié HDS (certification nationale française issue de l'article L.1111-8 du Code de la santé publique). OVHcloud est certifié HDS depuis 2016 — certification ISO 27001 + HDS pour ses data centers français.
Nehos déploie la stack IA souveraine sur les instances HDS-certifiées OVHcloud pour tout projet de santé : agents de recherche documentaire médicale, assistants de codage CIM-10, agents d'aide à la décision clinique (SAMD — Software as a Medical Device, attention au règlement MDR 2017/745 si usage diagnostique). Chaque composant (Mistral Large 2, Qdrant, Postgres, Langfuse) tourne sur des instances HDS distinctes avec isolation réseau maximale. Aucune donnée patient ne transite hors du périmètre HDS. Voir cas groupe hospitalier IA souveraine HDS.
Point de vigilance MDR : si votre agent IA prend ou assiste des décisions diagnostiques ou thérapeutiques, il peut être qualifié de SAMD (Software as a Medical Device) et tomber sous le règlement EU MDR 2017/745. Nehos qualifie ce point en amont et vous oriente vers un organisme notifié si nécessaire.
#Finance — DORA et exigences ACPR
Le règlement DORA (Digital Operational Resilience Act, Règlement UE 2022/2554, applicable depuis janvier 2025) impose aux établissements financiers des exigences spécifiques sur la résilience des systèmes d'information, la gestion du risque cloud (tiers critiques), et la concentration de risque fournisseur. Utiliser OpenAI GPT-4o comme LLM de production pour des usages bancaires ou assurantiels crée un risque de concentration critique sur un fournisseur non-UE, avec les obligations de notification afférentes à l'ACPR.
Un LLM souverain auto-hébergé OVHcloud élimine ce risque de concentration tiers : vous êtes propriétaire de la stack, OVHcloud n'est qu'un fournisseur d'infrastructure (non qualifié fournisseur ICT critique au sens DORA sur la composante compute bare metal). Cela simplifie considérablement les dossiers de conformité DORA auprès de l'ACPR et de la BCE (SSM pour les établissements significatifs). Voir cas assurance IA souveraine RGPD.
PCI-DSS applicatif : si votre agent IA traite des flux de paiement ou des données de carte bancaire, Nehos applique les contrôles PCI-DSS v4.0 sur la couche applicative (tokenisation des numéros de carte, interdiction de log des CVV, audit trail des accès).
#Défense et secteur public sensible — SecNumCloud
L'ANSSI (Agence Nationale de la Sécurité des Systèmes d'Information) publie une liste de prestataires cloud qualifiés SecNumCloud pour les systèmes d'information sensibles (OIV — Opérateurs d'Importance Vitale, OES — Opérateurs de Services Essentiels, administrations centrales). OVHcloud n'est pas encore qualifié SecNumCloud sur sa gamme grand public — la qualification est en cours. 3DS Outscale (filiale Dassault Systèmes) est aujourd'hui le principal opérateur cloud qualifié SecNumCloud.
Pour les projets de défense, de renseignement ou de souveraineté maximale : Nehos déploie la même stack IA (Mistral Large 2 + vLLM + Qdrant + LangGraph + Langfuse) sur 3DS Outscale SecNumCloud-qualifié. Les coûts d'infrastructure sont plus élevés (+40 à +80 % vs OVHcloud grand public) mais la qualification ANSSI est obtenue. Cf service Cloud Souverain Nehos.
#Collectivités et administrations — CNIL et données publiques
La CNIL a publié en 2023 et 2024 plusieurs avis et délibérations sur l'usage de l'IA dans le service public : recommandation de privilégier les LLM open source et auto-hébergés pour le traitement de données à caractère personnel des administrés, qualification des chatbots de services publics en systèmes à risque élevé AI Act dès lors qu'ils assistent des décisions administratives, exigence de transparence et d'explicabilité vis-à-vis des administrés. Nehos accompagne les collectivités et EPA (Établissements Publics Administratifs) dans le déploiement d'assistants IA souverains conformes à ces recommandations.
#Comparaison des coûts — IA souveraine vs API OpenAI / Anthropic
#Analyse TCO sur 12 mois pour une ETI avec 2 M tokens/jour
| Solution | Coût inférence LLM | Souveraineté | CLOUD Act | IA Act Art.10 facilité | TCO 12 mois (hors déploiement) |
|---|---|---|---|---|---|
| OpenAI GPT-4o API (standard) | ~$10/M tokens input, ~$30/M tokens output | Non | Exposé | Non | ~180 000 $/an |
| Azure OpenAI GPT-4o (EU data residency) | ~$10/M tokens input, ~$30/M tokens output | Contractuelle seulement | Exposé | Partielle | ~185 000 $/an + frais Azure |
| Mistral Large 2 via API Mistral | ~€4/M tokens input, ~€12/M tokens output | Partielle (EU, mais API Mistral) | Non exposé | Partielle | ~9 3 968 €/an |
| Mistral Large 2 self-hosted OVHcloud H100 | Coût fixe infra | Complète | Zéro | Complète | ~49 11 904 €/an (infra) |
Hypothèses de calcul : 2 millions de tokens/jour, ratio 60 % input / 40 % output, 365 jours/an. Infrastructure H100 OVHcloud : 1 serveur H100 80 GB NVL (à partir de 745 €/mois), 1 serveur A100 embeddings (1 12 672 €/mois) =à partir de 1 193 €/mois =66 14 336 €/an. À 2 M tokens/jour, le GPU H100 n'est utilisé qu'à ~15-20 % de sa capacité — point de saturation à ~12-15 M tokens/jour. Au-delà de 500 000 tokens/jour, le self-hosting commence à être compétitif. Au-delà de 2 M tokens/jour, il est systématiquement moins cher.
#Quand le self-hosting est rentable
Seuil de rentabilité annuel. Pour Mistral Large 2 vs OpenAI GPT-4o API : le break-even se situe à environ 400-600 millions de tokens/mois (environ 15-20 M tokens/jour) en tenant compte du coût d'infrastructure H100. Pour la plupart des ETI avec des usages IA réels (assistants internes, RAG documentaire, agents métier), ce seuil est atteint en 6 à 18 mois. Pour les organisations dont le critère n°1 est la souveraineté et non le coût pur (santé, défense, secteur public) : le calcul ROI n'est pas le facteur déterminant.
#Configuration pour la conformité AI Act
L'AI Act (Règlement UE 2024/1689, applicable depuis août 2024 sur les pratiques interdites, depuis août 2025 sur les systèmes à usage général, depuis août 2026 sur les systèmes haut risque) impose des obligations spécifiques aux déployeurs et aux fournisseurs de systèmes IA à haut risque. Le déploiement d'une IA souveraine facilite structurellement la conformité sur six articles.
Art.9 — Système de gestion des risques (cybersécurité) : une infrastructure auto-hébergée est plus facile à auditer qu'une dépendance API externe. Vous contrôlez les politiques de sécurité, les configurations réseau, les droits d'accès. L'audit ANSSI ou la revue RSSI peut examiner l'intégralité de la pile sans dépendre d'un rapport de conformité tiers (SOC 2 Type II d'OpenAI ne vous appartient pas).
Art.10 — Gouvernance des données : vos données d'entraînement, de fine-tuning et d'évaluation ne quittent pas votre périmètre. La DPIA Art.35 RGPD est simplifiée parce que le sous-traitant ultérieur (OVHcloud) est EU-based et non CLOUD Act-exposé. Les exigences de représentativité et d'absence de biais sur les données (Art.10 §3 AI Act) sont plus faciles à documenter quand vous avez un accès complet aux pipelines de données.
Art.12 — Journalisation : la combinaison pgaudit (Postgres) + Langfuse auto-hébergé produit un audit trail complet et immuable de chaque requête LLM (timestamp, identifiant session, hash input/output, tokens, latence). Ce log est exportable pour un audit réglementaire externe. Sur une API SaaS tierce, vous dépendez des logs que le fournisseur accepte de vous exporter.
Art.13 — Transparence : vous connaissez précisément le modèle déployé (Mistral Large 2, version x.y.z, poids téléchargés depuis Hugging Face le JJ/MM/AAAA), ses capacités documentées et ses limitations connues (hallucinations sur les dates récentes, précision moindre sur le code Python vs Mistral Codestral, etc.). Sur une API GPT-4o, vous ne savez pas quelle version exacte est servie ni quand elle a été mise à jour.
Art.14 — Supervision humaine : l'architecture souveraine facilite la mise en place de guardrails et de points d'escalade humaine, parce que vous contrôlez la couche orchestration (LangGraph). Chaque décision importante peut être stoppée, logguée, soumise à approbation humaine via une interface que vous développez et contrôlez.
Art.17 — Surveillance post-commercialisation : Langfuse auto-hébergé produit les dashboards de surveillance continue (qualité, drift, anomalies) qui constituent votre système de surveillance post-commercialisation au sens de l'AI Act. Cf service AI Act Conformité Nehos.
#Mise en place — De l'audit de souveraineté au déploiement LLM
Phase 1 — Audit de souveraineté (5-10 jours ouvrés,1 13 952 € HT)
Cartographie exhaustive des usages LLM actuels dans votre organisation : quelles API sont appelées (OpenAI, Anthropic, Google, Azure OpenAI, Mistral API publique), depuis quelles applications, avec quels types de données (données publiques vs données internes sensibles vs données personnelles RGPD vs données spéciales Art.9). Analyse CLOUD Act risk par usage. Gap analysis RGPD Art.46 et AI Act Art.9-17 sur les cas d'usage identifiés à risque. Recommandation de priorités de migration vers la stack souveraine. Output : rapport d'audit souveraineté (confidentiel NDA), roadmap de migration priorisée, estimation budgétaire par phase.
Phase 2 — Design d'architecture (2-4 semaines, inclus dans le devis projet complet)
Sizing GPU cluster OVHcloud selon volumes tokens estimés (modélisation vos logs d'usage API actuels ou d'une estimation par cas d'usage). Architecture RAG : choix du découpage documentaire (chunk size, overlap), stratégie d'indexation (Qdrant collections), pipeline d'ingestion documentaire automatisé. Architecture agents : design LangGraph des agents métier (flux, outils, mémoire, escalade humaine). Plan de migration : basculement progressif depuis les API tiers vers la stack souveraine, avec fallback possible pendant la période de transition.
Phase 3 — Déploiement et tests (4-8 semaines)
Provisioning OVHcloud (bare metal GPU, VM auxiliaires Postgres/Qdrant/Langfuse, configuration réseau mTLS, Vault secrets). Déploiement vLLM + Mistral Large 2 (téléchargement poids ~140 GB, configuration vLLM, tests de performance GPU). Pipeline RAG : ingestion corpus documentaire, embeddings Mistral Embed, indexation Qdrant, tests de retrieval (precision@k, recall@k, MRR). Agents LangGraph : développement, tests unitaires, tests d'intégration. Sécurité : OWASP LLM Top 10, pentests API, configuration Kong, audit RSSI. Tests de charge : simulation volumes production, mesure latence P50/P90/P99, identification goulots. Livraison : environnement staging validé, documentation technique, runbook opérationnel.
Phase 4 — Transfert de compétences et mise en production
Formation des équipes IT (2 journées : administration vLLM, Qdrant, Postgres, Langfuse ; alerting et monitoring ; procédures de mise à jour des poids Mistral). Formation des équipes métier utilisatrices (demi-journée par profil utilisateur). Bascule production progressive (canary deployment : 5 % du trafic, puis 20 %, puis 100 % selon les métriques qualité). SLA contractuel 99,5 % uptime. Astreinte optionnelle 24/7.
#ROI mesurable — Cas ETI santé RAG souverain
Cas client anonymisé (NDA). Groupe hospitalier privé français, 12 établissements, 4 800 professionnels de santé. Enjeu : déployer un moteur de recherche augmenté IA sur 800 000 documents médicaux internes (protocoles de soins, recommandations HAS, guides de prescription, dossiers de recherche interne, comptes-rendus anonymisés). Usage : aide à la décision pour les praticiens (réponse à des questions cliniques complexes en langage naturel, avec citations des sources et scores de confiance). Contrainte absolue : aucun document patient ni aucune requête de praticien ne peut transiter hors du périmètre HDS. API OpenAI exclue dès le départ par le DPO et le DSI. Azure OpenAI exclue pour CLOUD Act risk.
Solution Nehos déployée. Stack souveraine HDS : OVHcloud bare metal H100 certifié HDS, Mistral Large 2 vLLM, Mistral Embed, Qdrant, Postgres 16 pgaudit, LangGraph, Langfuse self-hosted. Ingestion : pipeline d'anonymisation des comptes-rendus (NER médical pour détection entités nominatives, pseudonymisation, validation humaine sur échantillon) avant indexation Qdrant. RAG hybride : sparse retrieval (BM25) + dense retrieval (Qdrant) + rerankage (Mistral Large 2 reranker). Interface : intégration dans le portail intranet hospitalier existant (SSO, authentification SAML2).
Résultats mesurés à 12 mois post-déploiement. Temps moyen de recherche documentaire praticien : -65 % (de 8 min à 2,8 min en moyenne pour les requêtes documentaires standards). Satisfaction praticiens (NPS interne) : +34 points. Conformité AI Act haut risque MDR (le système a été qualifié aide à la décision non-diagnostique — risque limité, pas MDR SAMD) et RGPD Art.9 (données de santé HDS) : validée par audit externe. Aucun incident de sécurité ou de fuite de données en 12 mois. Coût total du projet : 451 k€ HT. MCO mensuel : à partir de 1 161 € HT (infra H100 HDS + maintien applicatif). Voir cas groupe hospitalier IA souveraine HDS.
#Tarification — 715 k€ HT
Trois fourchettes de projet selon la complexité et le secteur.
Fourchette entrée (715 k€ HT, 3-5 mois) : POC puis MVP sur un périmètre restreint (1-2 cas d'usage, corpus documentaire < 50 000 documents, GPU A100 partagé OVHcloud AI Deploy ou A100 dédié selon exigences). Typique : ETI non-réglementée, usage interne (assistant documentaire, FAQ interne, aide à la rédaction), pas de données personnelles sensibles. Inclus : audit souveraineté (2-3 jours), architecture, déploiement stack (vLLM + Qdrant + Langfuse), RAG sur corpus fourni, formation équipe IT, documentation opérationnelle.
Fourchette intermédiaire (13,5 k€ HT, 4-7 mois) : déploiement complet avec GPU H100 dédié OVHcloud, RAG multi-corpus (GED, ERP, CRM, SIRH), intégrations applicatives (connecteurs REST + authentification SSO), conformité AI Act documentée (Art.12 audit trail, Art.13 transparence, Art.14 supervision humaine), DPIA RGPD. Typique : ETI avec données personnelles employés ou clients, secteur non-réglementé mais sensible (industrie, logistique, services B2B).
Fourchette haute (6,5 k€ HT, 6-10 mois) : secteurs réglementés (HDS santé, DORA finance, collectivité CNIL, défense SecNumCloud), audit de souveraineté complet (10 jours), conformité sectorielle spécifique (HDS, DORA, MDR selon cas), multi-agents complexes, volumes > 5 M tokens/jour, intégrations SI legacy, formation multi-profils (IT + métier + RSSI + DPO). MCO mensuel ensuite : 15 872 € HT selon SLA et volumes.
Estimation précise sur votre contexte en 30 minutes avec un consultant Nehos souveraineté : [Calendly RDV IA souveraine](https://calendly.com/raphael-poirier_/decouverte15min-nehos-groupe Outil d'estimation en ligne : Estimateur ROI agent IA.