Documentation interne et procédures
Retrouver une règle, une procédure qualité ou une réponse RH dans des centaines de documents, avec le lien vers le passage exact.
Intégration IA · RAG
Etixio développe des assistants RAG (retrieval augmented generation) : des applications qui recherchent les passages utiles dans vos documents et vos bases de données, puis demandent à un modèle de langage de rédiger une réponse qui cite ses sources. Nous prenons en charge toute la chaîne, de l’ingestion des documents au service supervisé en production, en respectant les droits d’accès de chaque utilisateur.
Comprendre la technologie
Un modèle de langage ne connaît ni vos procédures, ni vos contrats, ni votre documentation produit. Le RAG consiste à lui fournir, au moment de la question, les extraits pertinents de vos sources. L’application recherche d’abord les passages utiles, les transmet au modèle avec des instructions précises, puis affiche une réponse accompagnée de ses références.
Cette approche évite de réentraîner un modèle, permet de mettre à jour les connaissances en réindexant les documents et rend chaque réponse vérifiable. Elle est au cœur de nombreux agents IA et chatbots d’entreprise et des fonctionnalités IA intégrées aux produits.

Les usages en entreprise
Retrouver une règle, une procédure qualité ou une réponse RH dans des centaines de documents, avec le lien vers le passage exact.
Préparer une réponse à partir des fiches produit, des notices et des tickets déjà résolus, avant validation par un agent.
Rassembler les informations d’un dossier volumineux (contrat, dossier client, dossier patient) et en restituer une synthèse structurée.
Permettre aux utilisateurs d’un logiciel d’interroger leurs propres contenus, avec un index séparé par client.
Notre champ d’intervention
La qualité d’un assistant RAG dépend d’abord de la recherche. Si les bons passages ne sont pas retrouvés, aucun modèle ne produira une réponse juste. Nous travaillons donc chaque étape de la chaîne, en la mesurant.
Extraction du texte des PDF, documents bureautiques, pages web ou bases de données, nettoyage, conservation des métadonnées (auteur, date, service, niveau de confidentialité) et découpage en passages qui respectent la structure du document.
Calcul de représentations vectorielles avec un modèle d’embeddings choisi selon la langue et le domaine, puis stockage dans une base adaptée à votre infrastructure (PostgreSQL avec pgvector, OpenSearch, Qdrant ou service managé).
Combinaison de la recherche sémantique et de la recherche par mots-clés, filtres par métadonnées, puis reclassement des résultats pour ne transmettre au modèle que les passages les plus pertinents.
Instructions qui imposent de répondre uniquement à partir des extraits fournis, de citer les sources et de signaler quand l’information est absente plutôt que de l’inventer.
Filtrage des documents selon les droits de l’utilisateur au moment de la recherche, en s’appuyant sur votre gestion des identités. Un utilisateur ne reçoit jamais un extrait qu’il ne pourrait pas ouvrir lui-même.
Synchronisation régulière ou déclenchée par événement, prise en compte des documents modifiés ou supprimés et traçabilité de la version indexée.
Mesurer plutôt que supposer
Nous constituons avec vos équipes métier un jeu de questions de référence, y compris des questions sans réponse dans les documents et des questions hors périmètre. Nous mesurons d’un côté la recherche (les bons passages sont-ils retrouvés ?) et de l’autre la réponse (est-elle fidèle aux sources, complète, correctement citée ?).
Ces évaluations sont rejouées à chaque changement de découpage, de modèle d’embeddings, de modèle de langage ou d’instructions. Une amélioration sur un cas qui dégrade dix autres est ainsi repérée avant la mise en production. Voir notre approche du LLMOps et de l’évaluation IA.
Exploitation et coûts
Journalisation des questions, des passages retrouvés et des réponses, suivi des erreurs, des temps de réponse et des retours des utilisateurs, dans le respect des règles de conservation des données.
Le coût dépend du volume d’indexation, du nombre de passages transmis et du modèle retenu. Nous ajustons la taille du contexte, utilisons un modèle plus léger quand il suffit et mettons en cache ce qui peut l’être.
Choix du fournisseur de modèle et du lieu d’hébergement selon la sensibilité des données, jusqu’à une IA open source auto-hébergée ou un modèle européen comme Mistral AI lorsque c’est nécessaire.

Sur le terrain
Pour un établissement hospitalier, Etixio a conçu un agent IA médical basé sur le RAG qui explore le dossier patient et restitue une synthèse chronologique aux équipes d’anesthésie. Nous avons aussi développé Bobby, un assistant conversationnel relié aux données de notre ERP. Dans les deux cas, le travail a porté autant sur l’accès aux données et l’interface que sur le modèle.
Les choix qui comptent
Si les questions portent sur des données chiffrées d’une base, une requête structurée générée et contrôlée par l’application sera plus fiable qu’une recherche dans des textes. Si les documents tiennent dans le contexte du modèle, un découpage élaboré peut être inutile. Si la recherche classique suffit, un assistant n’apporte pas forcément de valeur.
Nous posons ces questions au cadrage. Le choix du modèle se fait ensuite sur vos exemples, en comparant Claude, OpenAI, Gemini ou un modèle hébergé.
Du travail aux livrables
Un prototype RAG existant peut être repris et fiabilisé ; voir notre offre de reprise de POC IA. La réalisation se fait en projet au forfait ou avec une équipe dédiée si le service doit évoluer dans la durée.
Questions fréquentes
Le RAG (retrieval augmented generation, ou génération augmentée par la recherche) combine un moteur de recherche et un modèle de langage. L’application retrouve les passages pertinents dans vos sources, puis le modèle rédige une réponse à partir de ces passages, en citant ses références.
Le fine-tuning modifie le comportement d’un modèle par un entraînement complémentaire ; il sert surtout à ajuster un style ou un format. Le RAG apporte des connaissances au moment de la question, sans réentraînement. Pour répondre à partir de documents qui évoluent, le RAG est généralement plus adapté et plus simple à maintenir.
Il doit le faire, et c’est un point que nous traitons dès la conception. Les droits sont appliqués au moment de la recherche, à partir de votre gestion des identités, de sorte qu’un utilisateur ne reçoit que des extraits de documents qu’il peut déjà consulter.
Aucun système ne supprime totalement ce risque. Nous le réduisons en imposant de répondre uniquement à partir des extraits fournis, en affichant les sources, en autorisant l’assistant à dire qu’il ne sait pas et en mesurant la fidélité des réponses sur un jeu d’évaluation.
Cela dépend de votre infrastructure et du volume. Si vous utilisez déjà PostgreSQL, l’extension pgvector suffit souvent. Pour des volumes plus importants ou une recherche hybride avancée, un moteur dédié peut être préférable. Nous choisissons avec vous selon l’exploitation que vous pouvez assurer.
Oui. Nous mesurons ses résultats sur des questions réelles, identifions si les erreurs viennent de l’ingestion, de la recherche ou de la génération, puis ajoutons ce qui manque pour la production — droits, évaluations, supervision et maîtrise des coûts.
Présentez-nous vos documents, les utilisateurs concernés et les questions qu’ils posent. Nous préciserons ensemble le premier périmètre à étudier.