Une passerelle LLM souveraine
Un point d’accès compatible avec l’API OpenAI, vers des modèles locaux sur vos GPU ou vers les fournisseurs que vous autorisez pour votre organisation.
IA générative
Une passerelle LLM sert les modèles que vous choisissez, hébergés sur vos GPU ou chez le fournisseur de votre choix, avec des quotas, un journal et le masquage des données personnelles. Le RAG répond sur vos documents, cite ses sources et respecte les droits de chacun.
Capacités clés
Un point d’accès compatible avec l’API OpenAI, vers des modèles locaux sur vos GPU ou vers les fournisseurs que vous autorisez pour votre organisation.
Un budget de jetons par projet, un refus lisible au-delà, et un journal des appels, en métadonnées par défaut.
NIR, IBAN, téléphone, courriel, SIREN : les données personnelles sont masquées avant tout envoi à un fournisseur externe.
Vos PDF et vos tables alimentent un index vectoriel dans votre PostgreSQL. Chaque réponse cite ses sources, et chaque index a ses droits.
Un assistant dans Jupyter et VS Code, et la documentation des tables du catalogue proposée par IA, sur le modèle que vous avez choisi.
Un agent d’exploitation qui diagnostique un run en échec, un agent data engineer qui propose un pipeline, sous leur propre compte et leurs propres règles.
Comment ça marche
Étape 01
Vous déclarez les modèles locaux et les fournisseurs autorisés, puis les quotas de chaque projet.
Étape 02
Un job découpe vos documents, calcule leurs représentations par la passerelle et les range dans un index, avec les droits de leur source.
Étape 03
Vos applications, vos notebooks et vos agents appellent la passerelle ou l’index, sous quotas et avec journal.
La passerelle LLM vit dans graal, à côté des droits, du coffre à secrets et du journal d’audit. Vos applications ne détiennent aucune clé de fournisseur : elles appellent la passerelle avec leur identité graal, et c’est elle qui applique le quota, masque les données personnelles, choisit le modèle et trace l’appel. Changer de modèle ne change pas une ligne de vos applications.
Standards et intégrations
Gouvernance
Pas avec un modèle local : tout reste dans votre cluster. Avec un fournisseur externe, seuls les extraits nécessaires partent, après masquage des données personnelles.
Les modèles ouverts que vous hébergez sur vos GPU, ou sur CPU pour les plus petits, et les fournisseurs que vous autorisez par leur URL et leur clé.
Oui. Chaque projet a un quota de jetons ; au-delà, l’appel est refusé avec un message explicite, et la consommation se lit par projet.
Un RAG sur un corpus de votre choix, servi par un modèle hébergé dans votre infrastructure.