Aller au contenu

Vue d'ensemble des capacités

graal couvre tout le cycle data & IA, de la source brute à l’agent en production. Cette page range ses capacités en dix familles et renvoie, pour chacune, à la page du site qui la présente et à la page de documentation qui la détaille.

Famille Ce qu’elle couvre Sur le site Dans la documentation
1. Ingestion et connecteurs Bases, fichiers et S3, SFTP, API REST, Hadoop, SAS, capture de changements Connecteurs Secrets et bibliothèques
2. Pipelines low-code Éditeur visuel, export Pandas et PySpark, aperçu par étape, contrôles qualité Pipelines low-code Jobs et workflows
3. Orchestration Jobs, workflows en graphe, cron, événements, backfills, reprises, alertes Orchestration Jobs et workflows
4. Calcul Spark distribué, types d’instance, GPU, pods restreints sans droit sur le cluster Orchestration et calcul Images de runtime
5. Lakehouse et SQL Tables Apache Iceberg, SQL fédéré avec Trino, catalogue, éditeur SQL, lignage Lakehouse et SQL Données et SQL
6. Notebooks Jupyter et VS Code dans le navigateur, SSO, assistant de code Notebooks Espaces de travail
7. ML et IA générative Expériences, registre de modèles, serving, dérive, passerelle LLM, RAG Machine learning · IA générative Machine learning
8. Agents IA et gouvernance Serveur MCP, comptes de service, validation humaine, SSO, RBAC, audit, coûts Agents IA · Gouvernance Agents IA (MCP) · Rôles et permissions
9. Déploiement et exploitation Chart Helm, haute disponibilité, hors ligne, OpenShift, GitOps, observabilité, multi-tenant Déploiement · Architecture Installation · Architecture
10. Ouverture et réversibilité Code exporté, formats ouverts, API REST OpenAPI, API MLflow, MCP Souveraineté API REST · Souveraineté et architecture

Bases PostgreSQL, Oracle, SQL Server et MySQL ; fichiers CSV et Parquet sur S3 ; SFTP ; API REST en source ; pont Hadoop et HDFS ; lecture des données SAS (.sas7bdat) ; capture de changements (CDC). Les identifiants d’une source sont des secrets de projet, jamais des champs du pipeline.

Un pipeline se dessine en glisser-déposer et s’exporte en Pandas ou PySpark : le code se relit, se versionne et tourne sans graal. Chaque étape s’aperçoit sur un échantillon, des contrôles qualité (non nul, unicité, plage, fraîcheur) se posent comme des étapes, et un pipeline peut être décrit en langage naturel avant d’être relu.

Jobs Python, Spark, SQL, bash et notebooks, programmes SAS et types spécialisés (dbt et autres). Workflows en graphe, planification cron, déclencheurs sur événement (arrivée d’un fichier, fin d’un autre workflow), backfills sur une plage de dates, reprises automatiques et alertes.

Spark distribué sur votre Kubernetes, types d’instance par projet, ordonnancement GPU. Tous les pods respectent le profil PSA restricted, et la plateforme n’a besoin d’aucun droit d’administration du cluster.

Tables Apache Iceberg sur votre stockage S3, SQL fédéré avec Trino, catalogue en couches, bases, tables et champs, éditeur SQL dans la console, lignage au niveau colonne et documentation des jeux de données générée par IA.

Jupyter et VS Code dans le navigateur, derrière la même authentification que la console, avec l’accès aux tables et aux buckets du projet et un assistant de code branché sur un modèle hébergé chez vous.

Suivi d’expériences et registre de modèles, compatibles avec le client MLflow ; modèles servis en REST derrière votre SSO, suivi de dérive ; passerelle LLM vers des modèles locaux ou des fournisseurs que vous choisissez ; RAG sur vos documents.

Un serveur MCP que vos agents pilotent sous leur propre compte de service, un fil d’activité en direct, la révocation d’un agent en un geste, la validation humaine des actions sensibles et des politiques par agent. SSO OIDC, SAML et LDAP/AD, RBAC par projet et par groupe, journal d’audit des actions humaines et des agents, secrets chiffrés, quotas et coûts par projet.

Un chart Helm, installé sur votre Kubernetes ou votre OpenShift, sur site, en cloud privé ou chez un hébergeur qualifié SecNumCloud ou certifié HDS, y compris hors ligne. Haute disponibilité, GitOps, métriques Prometheus, OpenTelemetry, sauvegarde et restauration, un realm par locataire, marque blanche.

Le code des pipelines s’exporte, les données restent dans des formats ouverts (Parquet, Iceberg, S3, SQL), et tout ce que fait la console passe par une API REST décrite en OpenAPI. S’y ajoutent l’API MLflow, le protocole MCP, le versionnement Git des projets, un fournisseur Terraform et une ligne de commande.

L’ancien site de graal publiait des tutoriels et des intégrations par outil. Ils ont été remplacés par les familles ci-dessus :

  • dbt, Dask, Beam, Airflow : les jobs et workflows de la famille 3, Orchestration ;
  • Debezium : la capture de changements de la famille 1, Connecteurs ;
  • Jenkins, Azure DevOps, Azure Data Factory : l’API REST et le GitOps de la famille 9 ;
  • Migration depuis Databricks : le cas d’usage migration de plateforme.