← Vue d’ensemble

IA générative

L’IA générative, sur vos modèles et vos documents

Une passerelle LLM sert les modèles que vous choisissez, hébergés sur vos GPU ou chez le fournisseur de votre choix, avec des quotas, un journal et le masquage des données personnelles. Le RAG répond sur vos documents, cite ses sources et respecte les droits de chacun.

Illustration de l’interface

Capacités clés

Vos modèles, vos règles

Une passerelle LLM souveraine

Un point d’accès compatible avec l’API OpenAI, vers des modèles locaux sur vos GPU ou vers les fournisseurs que vous autorisez pour votre organisation.

Des quotas et un journal

Un budget de jetons par projet, un refus lisible au-delà, et un journal des appels, en métadonnées par défaut.

Le masquage des données personnelles

NIR, IBAN, téléphone, courriel, SIREN : les données personnelles sont masquées avant tout envoi à un fournisseur externe.

Le RAG sur vos documents

Vos PDF et vos tables alimentent un index vectoriel dans votre PostgreSQL. Chaque réponse cite ses sources, et chaque index a ses droits.

Assistant de code et documentation

Un assistant dans Jupyter et VS Code, et la documentation des tables du catalogue proposée par IA, sur le modèle que vous avez choisi.

Des agents intégrés

Un agent d’exploitation qui diagnostique un run en échec, un agent data engineer qui propose un pipeline, sous leur propre compte et leurs propres règles.

Comment ça marche

Du modèle à l’application

  1. Étape 01

    Choisir les modèles

    Vous déclarez les modèles locaux et les fournisseurs autorisés, puis les quotas de chaque projet.

  2. Étape 02

    Indexer

    Un job découpe vos documents, calcule leurs représentations par la passerelle et les range dans un index, avec les droits de leur source.

  3. Étape 03

    Brancher

    Vos applications, vos notebooks et vos agents appellent la passerelle ou l’index, sous quotas et avec journal.

Une seule porte vers les modèles

La passerelle LLM vit dans graal, à côté des droits, du coffre à secrets et du journal d’audit. Vos applications ne détiennent aucune clé de fournisseur : elles appellent la passerelle avec leur identité graal, et c’est elle qui applique le quota, masque les données personnelles, choisit le modèle et trace l’appel. Changer de modèle ne change pas une ligne de vos applications.

Standards et intégrations

Des interfaces standard

  • API compatible OpenAI
  • MCP
  • vLLM
  • llama.cpp
  • pgvector
  • PostgreSQL
  • GPU
  • OIDC

Gouvernance

Chaque appel est compté et tracé

  • Quotas de jetons par projet et par application
  • Journal des appels, consultable par le RSSI, contenu chiffré sur option
  • Un index ne répond qu’aux personnes autorisées sur sa source

Questions fréquentes

Nos documents partent-ils chez un fournisseur ?

Pas avec un modèle local : tout reste dans votre cluster. Avec un fournisseur externe, seuls les extraits nécessaires partent, après masquage des données personnelles.

Quels modèles sont pris en charge ?

Les modèles ouverts que vous hébergez sur vos GPU, ou sur CPU pour les plus petits, et les fournisseurs que vous autorisez par leur URL et leur clé.

Peut-on limiter la dépense ?

Oui. Chaque projet a un quota de jetons ; au-delà, l’appel est refusé avec un message explicite, et la consommation se lit par projet.

Un assistant sur vos documents

Un RAG sur un corpus de votre choix, servi par un modèle hébergé dans votre infrastructure.