Cas d’usage · Secteur public
Vos documents interrogés en langage naturel, avec un modèle hébergé chez vous
Procédures, notes, marchés, doctrine : graal indexe vos documents, et vos équipes comme vos agents obtiennent des réponses qui citent leurs sources. Le modèle tourne sur vos GPU, l’accès suit les droits de chaque projet, et aucune requête ne part chez un fournisseur que vous n’avez pas choisi.
Le défi
Des documents précieux, dispersés et sensibles
- Des milliers de documents répartis entre partages de fichiers, outils métier et messageries.
- Des contenus sensibles qui ne peuvent pas être envoyés à un service d’IA en ligne.
- Des réponses qui doivent citer leur source pour être utilisables.
- Des droits d’accès qui diffèrent d’un service à l’autre.
Comment graal le traite
Du document à la réponse citée
Étape 01
Déposer
Vos documents sont déposés sur S3 ou lus depuis un serveur SFTP. Un job d’indexation les découpe en passages et conserve leur provenance.
Étape 02
Indexer
Les passages sont vectorisés par un modèle d’embeddings servi par la passerelle LLM, puis rangés dans un index vectoriel, dans votre infrastructure.
Étape 03
Protéger
Chaque index porte ses droits : un utilisateur ou un agent n’interroge que les index de ses projets. Les données personnelles sont masquées avant d’atteindre le modèle.
Étape 04
Interroger
Vos applications appellent l’API de la passerelle, compatible OpenAI, et vos agents passent par MCP. Chaque réponse cite les passages dont elle est tirée.
Étape 05
Suivre
Quotas de jetons par projet, journaux des appels et audit : vous savez qui a demandé quoi, et ce que cela a consommé.
Le scénario type part d’un fonds documentaire circonscrit — les procédures d’un service, un corpus de marchés, la doctrine d’une direction — et d’un modèle ouvert servi sur vos GPU. Si vous préférez un fournisseur externe pour certains usages, la passerelle le branche aussi, projet par projet : c’est vous qui décidez où partent les requêtes.
Ce que vous obtenez
- Des réponses sourcées : chaque passage cité renvoie au document d’origine
- Un assistant que vos applications et vos agents appellent par une API standard
- Des droits d’accès appliqués à la recherche elle-même
- Une consommation de jetons mesurée et plafonnée par projet
Ce qui reste chez vous
- Vos documents et leur index vectoriel
- Le modèle, servi sur vos GPU
- Les journaux des questions et des réponses
Capacités mobilisées
- IA générative
Passerelle LLM, modèles locaux, RAG et réponses citées.
- Connecteurs
Documents sur S3 ou sur un serveur SFTP.
- Orchestration et calcul
Réindexation planifiée des nouveaux documents.
- Gouvernance
Droits par index, quotas de jetons et audit.
- Agents IA
L’assistant accessible à vos agents par MCP.
Questions fréquentes
Quel modèle utiliser ?
Un modèle ouvert servi sur vos GPU par la passerelle, ou le fournisseur de votre choix, projet par projet. Changer de modèle de génération ne demande pas de refaire l’index.
Faut-il des GPU ?
Pour servir un modèle chez vous en production, oui : la passerelle les attribue par type d’instance. Un petit modèle sur CPU suffit pour un premier essai.
Nos documents servent-ils à entraîner le modèle ?
Non. Ils sont indexés, pas appris : le modèle lit les passages retrouvés au moment de la question, et rien n’entre dans ses poids.
Essayez-le sur votre fonds documentaire
En 8 semaines, un assistant sur un premier corpus, avec un modèle servi chez vous.