Retour aux articles
IA
Shortcut

Chatbot interne avec RAG : brancher l'IA sur vos données métier sans les exposer

🔐

Le RAG permet de connecter un chatbot IA à vos documents internes sans exposer vos données. Architecture, sécurité, RGPD, coûts et délais pour une PME.

Un chatbot interne avec RAG (Retrieval-Augmented Generation) est un assistant IA qui répond aux questions de vos équipes en s’appuyant sur vos documents internes — procédures, contrats, base de connaissances, historique client — sans jamais les transmettre pour entraîner un modèle. Concrètement : vos données restent dans votre infrastructure, le modèle de langage ne fait que les lire au moment de répondre, et chaque réponse cite ses sources. C’est aujourd’hui l’approche la plus sûre et la plus rentable pour mettre l’IA au service de vos données métier.

Voici comment ça fonctionne, ce que ça coûte, et les pièges à éviter.

Le RAG expliqué simplement

Imaginez un nouveau collaborateur brillant, mais qui ne connaît rien à votre entreprise. Plutôt que de lui faire mémoriser tous vos documents (long, coûteux, vite obsolète), vous lui donnez accès à une bibliothèque bien rangée : à chaque question, il va chercher les bons documents, les lit, puis répond en les citant.

C’est exactement le principe du RAG :

  1. Vos documents sont indexés dans une base de recherche interne (on parle de “base vectorielle”).
  2. À chaque question, le système retrouve les 3 à 10 passages les plus pertinents.
  3. Le modèle de langage (LLM) rédige la réponse uniquement à partir de ces passages, avec les sources citées.

Le point essentiel pour un dirigeant : le modèle n’apprend rien de vos données. Il les consulte au moment de la question, comme un employé consulte un dossier, puis les oublie. Vos documents ne quittent jamais votre système de stockage.

Pourquoi le RAG bat le fine-tuning pour les données d’entreprise

Le fine-tuning — réentraîner un modèle sur vos données — semble intuitif, mais il est presque toujours le mauvais choix pour de la connaissance interne :

  • Vos données évoluent en permanence. Un tarif change, une procédure est mise à jour ? Avec le RAG, il suffit de réindexer le document (quelques minutes). Avec le fine-tuning, il faut réentraîner le modèle (des jours, et un coût à chaque itération).
  • Le fine-tuning n’empêche pas les hallucinations. Un modèle fine-tuné restitue un style, pas des faits fiables. Le RAG, lui, ancre chaque réponse dans un document source vérifiable.
  • Le fine-tuning fige vos données dans le modèle. Impossible d’en retirer une information (droit à l’effacement RGPD) sans tout réentraîner. Avec le RAG, supprimer un document de l’index suffit.
  • Le contrôle d’accès devient possible. Un modèle fine-tuné répond la même chose à tout le monde. Un système RAG peut filtrer les documents selon les droits de l’utilisateur : le stagiaire ne voit pas les grilles salariales, le commercial ne voit que ses comptes.
CritèreChatbot RAGFine-tuningChatGPT générique
Connaît vos données internesOui, en temps réelOui, figées à l’entraînementNon
Mise à jour des connaissancesMinutes (réindexation)Jours (réentraînement)Impossible
Réponses sourcées et vérifiablesOui (citations)NonNon
Contrôle d’accès par utilisateurOuiNonNon
Conformité RGPD (effacement)SimpleTrès complexeHors de votre contrôle
Coût de mise en place15 000 – 40 000 €20 000 – 60 000 €20 €/utilisateur/mois
Risque de fuite de donnéesMaîtriséMoyenÉlevé (usage non encadré)

La dernière ligne mérite l’attention : quand une entreprise n’offre pas d’outil IA interne, les équipes utilisent ChatGPT en douce avec de vraies données clients. Un chatbot RAG encadré est aussi une réponse au shadow AI.

L’architecture, sans jargon inutile

Un chatbot RAG repose sur quatre briques :

  • Le pipeline d’ingestion — Il lit vos sources (Drive, SharePoint, Notion, ERP, base documentaire), découpe les documents en passages et les convertit en embeddings : des représentations numériques qui capturent le sens du texte, pas juste les mots-clés.
  • La base vectorielle — Elle stocke ces embeddings et permet de retrouver en quelques millisecondes les passages sémantiquement proches d’une question. Des solutions comme pgvector (une extension PostgreSQL) s’intègrent directement dans une stack existante, sans nouveau composant à administrer.
  • Le moteur de retrieval — Il combine recherche sémantique et filtres de permissions : seuls les documents que l’utilisateur a le droit de voir sont candidats à la réponse.
  • Le LLM — Il rédige la réponse finale à partir des passages retrouvés. C’est la seule brique qui peut être externe (API Claude, OpenAI, Mistral) ou interne (modèle open source auto-hébergé).

Le tout s’intègre là où vos équipes travaillent déjà : Slack, Teams, ou une interface web dédiée.

La question de la sécurité : où vont vos données ?

C’est l’objection numéro un, et elle est légitime. Voici les garanties concrètes d’une architecture RAG bien conçue :

  • Vos documents restent chez vous. L’index vectoriel est hébergé sur votre infrastructure (ou votre cloud privé). Seuls les passages pertinents pour une question donnée transitent vers le LLM — jamais la base complète.
  • Aucun entraînement sur vos données. Les offres API entreprise (Anthropic, OpenAI, Mistral) s’engagent contractuellement à ne pas entraîner leurs modèles sur les données envoyées, avec des durées de rétention nulles ou limitées. À vérifier dans le DPA (Data Processing Agreement) avant signature.
  • Retrieval sensible aux permissions. Les droits d’accès existants (Active Directory, Google Workspace) sont répercutés dans l’index : une question sur les salaires ne remontera aucun document RH à qui n’y a pas droit.
  • Conformité RGPD. Le RAG facilite le droit à l’effacement (supprimer un document = supprimer sa trace), la minimisation (seuls les passages utiles sont traités) et la traçabilité (chaque réponse est loguée avec ses sources). Un hébergement européen (Scaleway, OVHcloud) ou une API avec traitement dans l’UE règle la question du transfert de données.

API externe ou modèle auto-hébergé ?

Pour 80 % des PME, une API avec engagement contractuel de non-entraînement offre le meilleur rapport sécurité/performance/coût. L’auto-hébergement d’un modèle open source (Mistral, Llama) se justifie pour les secteurs très régulés (santé, défense, finance) ou les données classifiées — au prix d’une infrastructure GPU (300 à 2 000 €/mois) et de performances souvent inférieures aux modèles de pointe.

Coûts et délais réalistes pour une PME

PosteEstimation
POC sur un périmètre restreint (1 source de données)5 000 – 12 000 €, 2 à 3 semaines
Version production (multi-sources, permissions, intégration Slack/Teams)15 000 – 40 000 €, 6 à 10 semaines
Coûts API mensuels (100 à 500 utilisateurs)100 – 1 500 €/mois
Hébergement index + monitoring100 – 500 €/mois
Maintenance et amélioration continue500 – 1 500 €/mois

Le retour sur investissement se mesure vite : si 50 collaborateurs gagnent 15 minutes par jour à ne plus chercher l’information (une estimation prudente — McKinsey évalue à près de 20 % le temps de travail passé à chercher de l’information interne), le gain dépasse 100 000 € par an en temps retrouvé.

Les trois pièges qui plombent les projets RAG

  1. Garbage in, garbage out. Un chatbot branché sur des documents obsolètes, contradictoires ou mal rédigés donnera des réponses obsolètes, contradictoires et confuses. Prévoyez un audit documentaire avant l’indexation — c’est souvent 30 % de l’effort du projet, et le plus rentable.
  2. L’index qui vieillit en silence. Sans synchronisation automatique avec les sources, l’index diverge de la réalité en quelques semaines. La réindexation continue (ou planifiée) doit faire partie de l’architecture dès le jour 1, pas être ajoutée après le premier incident.
  3. Des réponses sans citations. Un chatbot qui affirme sans sourcer finira par halluciner avec aplomb, et vos équipes perdront confiance dès la première erreur. Exigez que chaque réponse cite ses documents sources, avec lien direct — et qu’elle sache dire “je ne trouve pas cette information” plutôt qu’inventer.

Par où commencer ?

Le bon premier pas n’est pas un chantier de six mois : c’est un POC de deux à trois semaines sur un périmètre unique et mesurable — la FAQ RH, la documentation technique, ou la base de connaissances support. Vous validez la qualité des réponses sur vos vraies données avant d’investir dans la version complète.

Chez Shortcut, nous concevons des chatbots RAG intégrés à votre infrastructure existante, avec la sécurité et la conformité RGPD traitées dès la conception — pas en rustine. Contactez-nous pour évaluer votre cas d’usage : premier échange gratuit, sans engagement.

IARAGChatbotSécurité
🚀

Vous avez un projet en tête ?

Discutons de vos besoins et trouvons ensemble la meilleure solution pour votre entreprise.

Parlons de votre projet