Logiciel & IA · De la stratégie à la production

Intégration IA · RAG

Développement RAG : un assistant IA qui répond à partir de vos documents

Etixio développe des assistants RAG (retrieval augmented generation) : des applications qui recherchent les passages utiles dans vos documents et vos bases de données, puis demandent à un modèle de langage de rédiger une réponse qui cite ses sources. Nous prenons en charge toute la chaîne, de l’ingestion des documents au service supervisé en production, en respectant les droits d’accès de chaque utilisateur.

Comprendre la technologie

Le modèle répond à partir de vos sources, pas de sa mémoire.

Un modèle de langage ne connaît ni vos procédures, ni vos contrats, ni votre documentation produit. Le RAG consiste à lui fournir, au moment de la question, les extraits pertinents de vos sources. L’application recherche d’abord les passages utiles, les transmet au modèle avec des instructions précises, puis affiche une réponse accompagnée de ses références.

Cette approche évite de réentraîner un modèle, permet de mettre à jour les connaissances en réindexant les documents et rend chaque réponse vérifiable. Elle est au cœur de nombreux agents IA et chatbots d’entreprise et des fonctionnalités IA intégrées aux produits.

Quatre personnes étudient des documents autour d’une table

Les usages en entreprise

Où un assistant RAG est utile.

Documentation interne et procédures

Retrouver une règle, une procédure qualité ou une réponse RH dans des centaines de documents, avec le lien vers le passage exact.

Support client et support technique

Préparer une réponse à partir des fiches produit, des notices et des tickets déjà résolus, avant validation par un agent.

Analyse de dossiers

Rassembler les informations d’un dossier volumineux (contrat, dossier client, dossier patient) et en restituer une synthèse structurée.

Fonction de recherche dans un produit SaaS

Permettre aux utilisateurs d’un logiciel d’interroger leurs propres contenus, avec un index séparé par client.

Notre champ d’intervention

Les briques d’une chaîne RAG en production.

La qualité d’un assistant RAG dépend d’abord de la recherche. Si les bons passages ne sont pas retrouvés, aucun modèle ne produira une réponse juste. Nous travaillons donc chaque étape de la chaîne, en la mesurant.

Ingestion et découpage

Extraction du texte des PDF, documents bureautiques, pages web ou bases de données, nettoyage, conservation des métadonnées (auteur, date, service, niveau de confidentialité) et découpage en passages qui respectent la structure du document.

Embeddings et base vectorielle

Calcul de représentations vectorielles avec un modèle d’embeddings choisi selon la langue et le domaine, puis stockage dans une base adaptée à votre infrastructure (PostgreSQL avec pgvector, OpenSearch, Qdrant ou service managé).

Recherche hybride et reclassement

Combinaison de la recherche sémantique et de la recherche par mots-clés, filtres par métadonnées, puis reclassement des résultats pour ne transmettre au modèle que les passages les plus pertinents.

Génération avec citations

Instructions qui imposent de répondre uniquement à partir des extraits fournis, de citer les sources et de signaler quand l’information est absente plutôt que de l’inventer.

Droits d’accès

Filtrage des documents selon les droits de l’utilisateur au moment de la recherche, en s’appuyant sur votre gestion des identités. Un utilisateur ne reçoit jamais un extrait qu’il ne pourrait pas ouvrir lui-même.

Mise à jour des index

Synchronisation régulière ou déclenchée par événement, prise en compte des documents modifiés ou supprimés et traçabilité de la version indexée.

Mesurer plutôt que supposer

Évaluer la recherche et les réponses séparément.

Nous constituons avec vos équipes métier un jeu de questions de référence, y compris des questions sans réponse dans les documents et des questions hors périmètre. Nous mesurons d’un côté la recherche (les bons passages sont-ils retrouvés ?) et de l’autre la réponse (est-elle fidèle aux sources, complète, correctement citée ?).

Ces évaluations sont rejouées à chaque changement de découpage, de modèle d’embeddings, de modèle de langage ou d’instructions. Une amélioration sur un cas qui dégrade dix autres est ainsi repérée avant la mise en production. Voir notre approche du LLMOps et de l’évaluation IA.

Exploitation et coûts

Superviser le service et maîtriser son coût.

Supervision

Journalisation des questions, des passages retrouvés et des réponses, suivi des erreurs, des temps de réponse et des retours des utilisateurs, dans le respect des règles de conservation des données.

Coûts

Le coût dépend du volume d’indexation, du nombre de passages transmis et du modèle retenu. Nous ajustons la taille du contexte, utilisons un modèle plus léger quand il suffit et mettons en cache ce qui peut l’être.

Confidentialité

Choix du fournisseur de modèle et du lieu d’hébergement selon la sensibilité des données, jusqu’à une IA open source auto-hébergée ou un modèle européen comme Mistral AI lorsque c’est nécessaire.

Deux développeurs relisent du code ensemble

Sur le terrain

Un agent RAG dans un contexte exigeant.

Pour un établissement hospitalier, Etixio a conçu un agent IA médical basé sur le RAG qui explore le dossier patient et restitue une synthèse chronologique aux équipes d’anesthésie. Nous avons aussi développé Bobby, un assistant conversationnel relié aux données de notre ERP. Dans les deux cas, le travail a porté autant sur l’accès aux données et l’interface que sur le modèle.

Les choix qui comptent

Le RAG n’est pas toujours la bonne réponse.

Si les questions portent sur des données chiffrées d’une base, une requête structurée générée et contrôlée par l’application sera plus fiable qu’une recherche dans des textes. Si les documents tiennent dans le contexte du modèle, un découpage élaboré peut être inutile. Si la recherche classique suffit, un assistant n’apporte pas forcément de valeur.

Nous posons ces questions au cadrage. Le choix du modèle se fait ensuite sur vos exemples, en comparant Claude, OpenAI, Gemini ou un modèle hébergé.

Du travail aux livrables

Ce que nous livrons.

Un prototype RAG existant peut être repris et fiabilisé ; voir notre offre de reprise de POC IA. La réalisation se fait en projet au forfait ou avec une équipe dédiée si le service doit évoluer dans la durée.

Questions fréquentes

Développement RAG : vos questions.

Qu’est-ce que le RAG en intelligence artificielle ?

Le RAG (retrieval augmented generation, ou génération augmentée par la recherche) combine un moteur de recherche et un modèle de langage. L’application retrouve les passages pertinents dans vos sources, puis le modèle rédige une réponse à partir de ces passages, en citant ses références.

Quelle différence entre RAG et fine-tuning ?

Le fine-tuning modifie le comportement d’un modèle par un entraînement complémentaire ; il sert surtout à ajuster un style ou un format. Le RAG apporte des connaissances au moment de la question, sans réentraînement. Pour répondre à partir de documents qui évoluent, le RAG est généralement plus adapté et plus simple à maintenir.

Un chatbot sur nos documents internes respecte-t-il les droits d’accès ?

Il doit le faire, et c’est un point que nous traitons dès la conception. Les droits sont appliqués au moment de la recherche, à partir de votre gestion des identités, de sorte qu’un utilisateur ne reçoit que des extraits de documents qu’il peut déjà consulter.

Comment éviter que l’assistant invente des réponses ?

Aucun système ne supprime totalement ce risque. Nous le réduisons en imposant de répondre uniquement à partir des extraits fournis, en affichant les sources, en autorisant l’assistant à dire qu’il ne sait pas et en mesurant la fidélité des réponses sur un jeu d’évaluation.

Quelle base vectorielle choisir ?

Cela dépend de votre infrastructure et du volume. Si vous utilisez déjà PostgreSQL, l’extension pgvector suffit souvent. Pour des volumes plus importants ou une recherche hybride avancée, un moteur dédié peut être préférable. Nous choisissons avec vous selon l’exploitation que vous pouvez assurer.

Pouvez-vous reprendre un prototype RAG existant ?

Oui. Nous mesurons ses résultats sur des questions réelles, identifions si les erreurs viennent de l’ingestion, de la recherche ou de la génération, puis ajoutons ce qui manque pour la production — droits, évaluations, supervision et maîtrise des coûts.

Construisons un assistant qui répond à partir de vos sources.

Présentez-nous vos documents, les utilisateurs concernés et les questions qu’ils posent. Nous préciserons ensemble le premier périmètre à étudier.

Réserver un échange de 30 min avec un lead tech

Que recherchez-vous ?