Réalisation · Agent IA et RAG en entreprise

Agent IA et RAG sur données métier

Illustration isométrique : un assistant robotisé extrait des documents d'une archive et les transmet à une interface de conversation

Conception et industrialisation d'un agent IA qui interroge la base documentaire interne d'un client, avec garde-fous sur les données personnelles, observabilité Langfuse et contrôle continu des coûts.

Période d'engagement : · Page revue le

Contexte

Client industriel disposant de milliers de documents techniques internes (PDF, intranet, tickets). Les équipes terrain perdaient un temps significatif à chercher l'information. L'enjeu : un agent fiable, traçable, qui ne laisse pas fuiter les données sensibles.

Enjeu

Construire un agent RAG de qualité production : indexation incrémentale, recherche hybride (BM25 et vecteurs), garde-fous contre l'injection de prompt et la fuite de données personnelles, observabilité fine, conformité à l'AI Act, sur une infrastructure sur site ou en cloud privé.

Approche SeedVision

SeedVision a livré l'indexation pgvector et la recherche hybride, un agent LangGraph doté d'une politique de garde-fous, une observabilité Langfuse auto-hébergée (coût et qualité par requête), la documentation AI Act, le déploiement Kubernetes et la formation de l'équipe d'exploitation.

Chronologie de l'engagement

  • Conception et industrialisation de l'agent. Indexation incrémentale des documents internes, recherche hybride, politique de garde-fous, observabilité auto-hébergée, déploiement Kubernetes et formation de l'équipe d'exploitation.
  • Exploitation et amélioration continue. 2 ans de service : le jeu de test métier sert de garde-fou à chaque changement de modèle, de prompt ou de méthode d'indexation.

Avant et après

Recherche d'information

Avant : Des milliers de documents techniques répartis entre PDF, intranet et tickets : chaque question devient une fouille manuelle.

Après : Adoption interne de plus de 70 % des équipes terrain en 90 jours, sur une recherche hybride qui interroge les trois sources à la fois.

Fiabilité des réponses

Avant : Un agent branché directement sur un modèle répond toujours, y compris quand il n'a rien trouvé.

Après : Hallucinations divisées par 6 sur le jeu de test métier, réponses rattachées aux documents sources.

Traçabilité

Avant : Sans journal, une réponse contestée ne peut être ni expliquée ni rejouée.

Après : Journaux d'audit complets, exploitables pour la conformité à l'AI Act.

Coût d'exploitation

Avant : Un agent sans mesure par requête devient un poste de dépense qu'on ne peut ni prévoir ni arbitrer.

Après : Coût par requête maîtrisé : moins de 0,03 € en moyenne, mesuré requête par requête.

Résultats

  • Hallucinations divisées par 6 sur le jeu de test métier
  • Journaux d'audit complets pour la conformité à l'AI Act
  • Coût par requête maîtrisé : moins de 0,03 € en moyenne
  • Adoption interne : plus de 70 % des équipes terrain en 90 jours

Voir la plateforme en production

Technologies et périmètre

  • LangChain
  • Claude
  • RAG
  • MLOps

Période d'engagement :

Ce que couvre l'engagement, bloc par bloc

  • Indexation incrémentale — Seuls les documents modifiés sont réindexés. Une base documentaire vivante ne peut pas être reconstruite intégralement à chaque changement : ce serait coûteux et, dans les faits, jamais fait.
  • Recherche hybride BM25 et vecteurs — La recherche par mots-clés retrouve une référence exacte, la recherche vectorielle retrouve une formulation voisine. Les deux ensemble couvrent les questions réelles des équipes terrain.
  • Politique de garde-fous — Filtrage des tentatives d'injection de prompt, contrôle des données personnelles en entrée comme en sortie, et refus explicite quand aucun document ne soutient la réponse.
  • Observabilité auto-hébergée et exploitation — Langfuse hébergé chez le client pour le coût et la qualité par requête, déploiement Kubernetes sur site ou en cloud privé, formation de l'équipe qui exploite l'agent au quotidien.

Ce que l'exploitation impose

  • Un agent doit pouvoir répondre qu'il ne sait pas — La réponse la plus dangereuse est celle qui a l'air juste sans être appuyée par un document. Le refus documenté fait donc partie de la politique de garde-fous, au même titre que le filtrage des entrées.
  • Le jeu de test métier vaut plus qu'un score générique — Les classements publics de modèles ne disent rien de vos documents. C'est le jeu de test construit avec les équipes qui autorise, ou non, un changement de modèle ou de prompt.
  • L'observabilité doit rester dans le périmètre du client — Tracer les requêtes d'un agent revient à conserver des extraits de documents internes. Ces traces vivent donc sur l'infrastructure du client, comme les documents eux-mêmes.

Choix d'architecture, et pourquoi

  • Les vecteurs dans PostgreSQL plutôt qu'un moteur séparé — pgvector évite d'ajouter une base à sauvegarder, à sécuriser et à faire vivre. Tant que le volume documentaire reste de l'ordre du millier de documents, le composant en moins vaut mieux que le gain théorique.
  • Un graphe d'agent explicite plutôt qu'une chaîne implicite — LangGraph rend visibles les étapes, les conditions d'arrêt et les points de contrôle. Un agent dont on ne peut pas dessiner le parcours ne peut pas être audité.
  • Déploiement sur site ou en cloud privé — Les documents ne sortent pas du périmètre du client : c'est la contrainte qui a commandé le choix du déploiement, avant même le choix des modèles.

Millésimes techniques et réglementaires

Faits publics et datés qui contraignent le périmètre.

  • pgvector 0.5. Fait public : cette version apporte l'index HNSW à PostgreSQL. Elle rend défendable de garder les vecteurs dans la base existante plutôt que d'exploiter un moteur de recherche vectorielle séparé.
  • Entrée en vigueur du règlement européen sur l'IA. Le calendrier réglementaire européen est public. C'est lui, et non une exigence interne, qui impose de savoir quel document et quel modèle ont produit une réponse donnée.
  • Application du régime général. Échéance à laquelle l'essentiel du règlement devient applicable. Les journaux d'audit produits par l'agent sont conçus pour être lisibles à cette échéance, pas reconstitués en urgence.

Questions sur cet engagement

Les documents du client sortent-ils de son infrastructure ?

Non : l'indexation, l'agent et l'observabilité se déploient sur site ou en cloud privé. L'outil de supervision est auto-hébergé pour que les traces de requêtes restent dans le périmètre du client.

Comment l'agent évite-t-il d'inventer une réponse ?

Par une recherche hybride qui combine mots-clés et vecteurs, une politique de garde-fous, et la possibilité explicite de répondre qu'il ne sait pas. La mesure se fait sur un jeu de test métier plutôt que sur un score générique : c'est ce jeu qui a montré des hallucinations divisées par 6.

Que fournit cette plateforme en vue d'un contrôle AI Act ?

Des journaux d'audit complets, la documentation technique attendue et la traçabilité des requêtes. Le classement du niveau de risque et les garde-fous sur les données personnelles figurent dans le même dossier.

Offres associées

Réalisations proches

À lire sur le blog

Parler de votre projet

Un enjeu proche de Agent RAG métier ? Écrivez à contact@seedvision.fr : réponse sous 24 h.