← Tous les cas d’usage

Cas d’usage · Secteur public

Vos documents interrogés en langage naturel, avec un modèle hébergé chez vous

Procédures, notes, marchés, doctrine : graal indexe vos documents, et vos équipes comme vos agents obtiennent des réponses qui citent leurs sources. Le modèle tourne sur vos GPU, l’accès suit les droits de chaque projet, et aucune requête ne part chez un fournisseur que vous n’avez pas choisi.

Illustration de l’interface

Le défi

Des documents précieux, dispersés et sensibles

  • Des milliers de documents répartis entre partages de fichiers, outils métier et messageries.
  • Des contenus sensibles qui ne peuvent pas être envoyés à un service d’IA en ligne.
  • Des réponses qui doivent citer leur source pour être utilisables.
  • Des droits d’accès qui diffèrent d’un service à l’autre.

Comment graal le traite

Du document à la réponse citée

  1. Étape 01

    Déposer

    Vos documents sont déposés sur S3 ou lus depuis un serveur SFTP. Un job d’indexation les découpe en passages et conserve leur provenance.

  2. Étape 02

    Indexer

    Les passages sont vectorisés par un modèle d’embeddings servi par la passerelle LLM, puis rangés dans un index vectoriel, dans votre infrastructure.

  3. Étape 03

    Protéger

    Chaque index porte ses droits : un utilisateur ou un agent n’interroge que les index de ses projets. Les données personnelles sont masquées avant d’atteindre le modèle.

  4. Étape 04

    Interroger

    Vos applications appellent l’API de la passerelle, compatible OpenAI, et vos agents passent par MCP. Chaque réponse cite les passages dont elle est tirée.

  5. Étape 05

    Suivre

    Quotas de jetons par projet, journaux des appels et audit : vous savez qui a demandé quoi, et ce que cela a consommé.

Le scénario type part d’un fonds documentaire circonscrit — les procédures d’un service, un corpus de marchés, la doctrine d’une direction — et d’un modèle ouvert servi sur vos GPU. Si vous préférez un fournisseur externe pour certains usages, la passerelle le branche aussi, projet par projet : c’est vous qui décidez où partent les requêtes.

Ce que vous obtenez

  • Des réponses sourcées : chaque passage cité renvoie au document d’origine
  • Un assistant que vos applications et vos agents appellent par une API standard
  • Des droits d’accès appliqués à la recherche elle-même
  • Une consommation de jetons mesurée et plafonnée par projet

Ce qui reste chez vous

  • Vos documents et leur index vectoriel
  • Le modèle, servi sur vos GPU
  • Les journaux des questions et des réponses

Capacités mobilisées

Questions fréquentes

Quel modèle utiliser ?

Un modèle ouvert servi sur vos GPU par la passerelle, ou le fournisseur de votre choix, projet par projet. Changer de modèle de génération ne demande pas de refaire l’index.

Faut-il des GPU ?

Pour servir un modèle chez vous en production, oui : la passerelle les attribue par type d’instance. Un petit modèle sur CPU suffit pour un premier essai.

Nos documents servent-ils à entraîner le modèle ?

Non. Ils sont indexés, pas appris : le modèle lit les passages retrouvés au moment de la question, et rien n’entre dans ses poids.

Essayez-le sur votre fonds documentaire

En 8 semaines, un assistant sur un premier corpus, avec un modèle servi chez vous.