Banque mutualiste — Copilote IA RAG souverain pour 1 200 conseillers
RAG sécurisé sur 12 000 fiches produits, procédures internes et réglementations. Mistral Large 2 et Qdrant auto-hébergés sur OVHcloud SecNumCloud, context window 128k. 1 200 conseillers utilisateurs, +28 % de productivité mesurés.
Durée
Non communiquée — confidentialité NDA client
Équipe
5 experts
Technologies clés
1 200
Conseillers bancaires utilisateurs du copilote IA après déploiement au réseau
+28 %
Gain de productivité des conseillers mesuré par rapport à la baseline établie au cadrage
12 000
Fiches produits, procédures internes et réglementations indexées dans le RAG sécurisé
128k
Context window de Mistral Large 2 — procédures longues et annexes traitées dans un même raisonnement
#Contexte
Banque mutualiste française, anonymisée au titre du NDA qui encadre la mission. Réseau d'agences dense, organisation décentralisée en caisses régionales, avec l'hétérogénéité de pratiques que ce modèle implique.
L'actif documentaire est massif et fragmenté : fiches produits d'épargne, de crédit et d'assurance, procédures de souscription et de contrôle, notes réglementaires, modes opératoires outils — répartis dans plusieurs référentiels, avec des cycles de mise à jour et des règles d'habilitation distincts.
Le point de départ n'était pas technologique mais opérationnel : un conseiller passe trop de temps à chercher l'information avant de pouvoir la restituer au sociétaire. Recherche plein texte peu efficace, réflexe de l'appel au référent produit, réponses qui varient d'une caisse à l'autre pour une même question.
#L'enjeu
Trois contraintes se cumulaient, et c'est leur combinaison qui rendait le projet difficile.
La justesse. Une réponse approximative sur une condition tarifaire ou une règle d'éligibilité n'est pas un désagrément d'usage : c'est un risque de conformité. Un assistant qui invente une clause est pire qu'un intranet lent. Toute réponse devait rester rattachable à ses documents sources et refléter la version en vigueur — laquelle bouge en permanence.
La souveraineté. Le corpus interne et les échanges des conseillers sont des actifs sensibles. Envoyer ces contenus vers une API d'IA hébergée hors du périmètre de l'établissement était exclu par la DSI et la filière risques dès le cadrage — ce qui a écarté d'emblée la plupart des offres d'assistants prêtes à l'emploi. Choix de souveraineté numérique responsable, pas préférence esthétique.
L'échelle. Un outil adopté par une agence pilote enthousiaste ne prouve rien. La cible était l'ensemble des conseillers du réseau, avec des appétences numériques variables et des périmètres d'habilitation distincts.
La question posée à Nehos n'était donc pas « est-ce que l'IA générative peut aider nos conseillers », mais « de combien, sur quelle base de mesure, et à quel coût de possession ».
#La solution
Un copilote conversationnel destiné aux conseillers, adossé à une architecture RAG sécurisée sur le corpus de l'établissement : 12 000 fiches produits, procédures internes et réglementations.
Le principe est volontairement conservateur. Le modèle ne mémorise pas la documentation, il la consulte : aucun apprentissage sur les données de l'établissement, aucune dépendance à un état interne du modèle. Le système récupère les passages pertinents dans le corpus indexé, puis rédige une réponse structurée en s'appuyant exclusivement sur eux, références affichées à côté. Si le corpus ne permet pas de répondre, l'assistant le dit — comportement attendu d'un RAG bien construit.
Sur la couche technique, tout est auto-hébergé : Mistral Large 2 pour la génération, Qdrant comme base vectorielle, déployés sur OVHcloud SecNumCloud. Décision d'architecture, pas argument marketing : documents, vecteurs, requêtes et journaux restent dans un environnement qualifié SecNumCloud, sous contrôle de la DSI.
Le context window de 128k a structuré la conception : il permet de faire tenir plusieurs passages longs — une procédure complète avec ses annexes et la fiche produit associée — dans un même raisonnement, sans découper le contexte au risque de perdre une condition importante.
#Déroulé
L'ingestion documentaire a représenté l'essentiel de l'effort réel. Chaque document a été normalisé, découpé en fragments cohérents avec sa structure logique plutôt qu'à longueur fixe, enrichi de métadonnées — famille de produit, périmètre, version, date d'effet, habilitation — puis vectorisé.
Ces métadonnées ne sont pas décoratives. Elles pilotent le filtrage des habilitations au moment de la recherche : un conseiller ne voit remonter que la documentation de son périmètre, et le modèle ne voit jamais un contenu hors périmètre — il ne peut donc pas le divulguer, même par formulation détournée.
La conception a avancé par itérations courtes avec un panel de référents métier, sur des jeux de questions réelles. Chaque itération était évaluée sur la justesse des réponses et la pertinence des sources citées, pas sur une impression de fluidité.
Le déploiement a été progressif : périmètre restreint, correction du corpus, puis extension par vagues. La conduite du changement a été traitée comme un lot à part entière — un copilote non adopté est un copilote inutile.
#Résultats
Le copilote est utilisé par 1 200 conseillers. Le gain de productivité mesuré par rapport à la baseline établie au cadrage s'établit à +28 %.
La recherche d'information, qui mobilisait un temps significatif entre plusieurs référentiels et parfois un appel au référent produit, se traite désormais dans le flux de travail du conseiller.
L'effet le plus commenté en interne n'était pas le gain de temps mais l'homogénéisation : pour une même question, les conseillers de caisses différentes s'appuient sur la même documentation en vigueur.
#Enseignements
Le corpus est le produit. Quand une réponse est jugée insatisfaisante, la cause est presque toujours un document source ambigu, obsolète ou mal structuré. Le correctif porte alors sur la documentation, pas sur le modèle — et bénéficie à tous les canaux.
La souveraineté est une décision d'architecture. Elle se prend au cadrage, pas après. Auto-héberger le modèle et la base vectorielle sur une infrastructure qualifiée ferme des options et en ouvre d'autres — à commencer par celle de dire oui à la filière risques.
Un grand context window ne remplace pas la recherche documentaire. Le 128k réduit la fragilité de la sélection de passages, il ne la rend pas facultative.
L'adoption se joue sur la citation. Les conseillers ont fait confiance à l'outil parce qu'ils pouvaient vérifier.
Ce cas relève de notre service Agents IA, décliné en agent IA bancaire, au sein du vertical Banque, Assurance & Finance. Il applique la Méthode Nehos ROI-First IA : on chiffre le ROI avant de signer, on livre, on revient mesurer.
Résultats mesurés après déploiement au réseau
1 200 conseillers utilisateurs du copilote après déploiement à l'ensemble du réseau
+28 % de productivité mesurés par rapport à la baseline établie au cadrage
12 000 fiches produits, procédures internes et réglementations indexées dans le RAG sécurisé
Mistral Large 2 et Qdrant auto-hébergés sur OVHcloud SecNumCloud — aucune donnée hors périmètre
Context window 128k exploité pour traiter procédures longues et annexes dans un même raisonnement
Réponses systématiquement rattachées à leurs documents sources, vérifiables par le conseiller
Filtrage des habilitations appliqué au niveau de la recherche documentaire
Boucle de correction orientée corpus : le correctif porte sur le document, pas sur le modèle
L'essentiel sur ce cas client
Banque mutualiste française anonymisée NDA. Problème de départ : les conseillers passent trop de temps à chercher l'information produit et réglementaire dans une documentation dispersée, au lieu de la restituer au sociétaire.
Solution Nehos : un copilote conversationnel adossé à un RAG sécurisé sur 12 000 fiches produits, procédures internes et réglementations. Chaque réponse est sourcée et rattachée à ses documents d'origine.
Architecture souveraine assumée : Mistral Large 2 et Qdrant auto-hébergés sur OVHcloud SecNumCloud. Aucune donnée client ni document interne ne sort du périmètre. Context window 128k pour tenir des procédures longues dans un seul raisonnement.
Résultat mesuré après déploiement à l'ensemble du réseau : 1 200 conseillers utilisateurs et +28 % de productivité. Positionnement Nehos : on chiffre le ROI avant de signer, on livre, puis on mesure.
Questions fréquentes sur ce cas client
Un NDA encadre la mission. Deux raisons côté client : la cartographie du corpus documentaire interne et les modalités d'outillage des conseillers sont des informations sensibles dans un secteur concurrentiel, et l'établissement communique lui-même sur ses chantiers technologiques selon son propre calendrier. Les éléments présentés ici sont réels et vérifiables par Nehos sous NDA réciproque.
Parce que la documentation bancaire change en permanence et qu'une réponse doit être justifiable. Avec un RAG, la connaissance reste dans le corpus indexé : mettre à jour une procédure suffit à mettre à jour les réponses, sans réentraînement. Surtout, chaque réponse est rattachée à ses documents sources, donc vérifiable par le conseiller et auditable en interne. Un modèle entraîné sur le corpus aurait dilué cette traçabilité et rendu chaque mise à jour documentaire beaucoup plus coûteuse.
Que Mistral Large 2 et Qdrant tournent sur une infrastructure qualifiée SecNumCloud, opérée dans le périmètre maîtrisé par l'établissement. Les documents, les vecteurs issus de leur indexation, les questions posées par les conseillers et les journaux d'usage y restent. Aucun appel n'est émis vers une API d'IA externe. C'était la condition d'entrée posée par la DSI et la filière risques, et elle a structuré toute l'architecture.
À traiter des documents longs sans les mutiler. Une procédure bancaire complète, ses annexes et la fiche produit associée peuvent être présentées ensemble au modèle dans un même raisonnement. Sans cette fenêtre, il aurait fallu découper davantage et sélectionner plus agressivement les passages, au risque d'écarter une condition d'éligibilité ou une exception qui figure dans une annexe. Le 128k ne remplace pas la qualité de la recherche documentaire, il en réduit la fragilité.
Le filtrage s'applique au niveau de la recherche documentaire, pas au niveau de l'affichage. Chaque fragment indexé porte des métadonnées de périmètre et d'habilitation, et la requête d'un conseiller ne peut faire remonter que les fragments auxquels il a droit. Le modèle ne voit donc jamais un contenu hors périmètre : il ne peut pas le divulguer, même par formulation détournée.
Par rapport à une baseline établie pendant le cadrage, avant tout développement : quelles questions les conseillers posent réellement, à quelle fréquence, par quel canal, et quel temps y est consacré. C'est le principe de la méthode Nehos ROI-First IA — on définit la mesure avant de construire, sinon on ne mesure qu'une impression. Le chiffre s'entend par rapport à cette référence.
Non, et c'est une délimitation posée dès le cadrage. Le copilote informe le conseiller, qui reste seul en relation avec le sociétaire et seul décisionnaire. L'assistant ne produit aucun acte, ne prend aucune décision et n'est exposé sur aucun canal client. Cette frontière simplifie la trajectoire de conformité et clarifie le discours auprès des équipes.