Vue d'ensemble des capacités
graal couvre tout le cycle data & IA, de la source brute à l’agent en production. Cette page range ses capacités en dix familles et renvoie, pour chacune, à la page du site qui la présente et à la page de documentation qui la détaille.
Les dix familles
Section intitulée « Les dix familles »| Famille | Ce qu’elle couvre | Sur le site | Dans la documentation |
|---|---|---|---|
| 1. Ingestion et connecteurs | Bases, fichiers et S3, SFTP, API REST, Hadoop, SAS, capture de changements | Connecteurs | Secrets et bibliothèques |
| 2. Pipelines low-code | Éditeur visuel, export Pandas et PySpark, aperçu par étape, contrôles qualité | Pipelines low-code | Jobs et workflows |
| 3. Orchestration | Jobs, workflows en graphe, cron, événements, backfills, reprises, alertes | Orchestration | Jobs et workflows |
| 4. Calcul | Spark distribué, types d’instance, GPU, pods restreints sans droit sur le cluster | Orchestration et calcul | Images de runtime |
| 5. Lakehouse et SQL | Tables Apache Iceberg, SQL fédéré avec Trino, catalogue, éditeur SQL, lignage | Lakehouse et SQL | Données et SQL |
| 6. Notebooks | Jupyter et VS Code dans le navigateur, SSO, assistant de code | Notebooks | Espaces de travail |
| 7. ML et IA générative | Expériences, registre de modèles, serving, dérive, passerelle LLM, RAG | Machine learning · IA générative | Machine learning |
| 8. Agents IA et gouvernance | Serveur MCP, comptes de service, validation humaine, SSO, RBAC, audit, coûts | Agents IA · Gouvernance | Agents IA (MCP) · Rôles et permissions |
| 9. Déploiement et exploitation | Chart Helm, haute disponibilité, hors ligne, OpenShift, GitOps, observabilité, multi-tenant | Déploiement · Architecture | Installation · Architecture |
| 10. Ouverture et réversibilité | Code exporté, formats ouverts, API REST OpenAPI, API MLflow, MCP | Souveraineté | API REST · Souveraineté et architecture |
Famille par famille
Section intitulée « Famille par famille »1. Ingestion et connecteurs
Section intitulée « 1. Ingestion et connecteurs »Bases PostgreSQL, Oracle, SQL Server et MySQL ; fichiers CSV et Parquet sur S3 ; SFTP ; API REST
en source ; pont Hadoop et HDFS ; lecture des données SAS (.sas7bdat) ; capture de changements
(CDC). Les identifiants d’une source sont des secrets de projet, jamais des champs du pipeline.
2. Pipelines low-code vers code
Section intitulée « 2. Pipelines low-code vers code »Un pipeline se dessine en glisser-déposer et s’exporte en Pandas ou PySpark : le code se relit, se versionne et tourne sans graal. Chaque étape s’aperçoit sur un échantillon, des contrôles qualité (non nul, unicité, plage, fraîcheur) se posent comme des étapes, et un pipeline peut être décrit en langage naturel avant d’être relu.
3. Orchestration
Section intitulée « 3. Orchestration »Jobs Python, Spark, SQL, bash et notebooks, programmes SAS et types spécialisés (dbt et autres). Workflows en graphe, planification cron, déclencheurs sur événement (arrivée d’un fichier, fin d’un autre workflow), backfills sur une plage de dates, reprises automatiques et alertes.
4. Calcul
Section intitulée « 4. Calcul »Spark distribué sur votre Kubernetes, types d’instance par projet, ordonnancement GPU. Tous les pods respectent le profil PSA restricted, et la plateforme n’a besoin d’aucun droit d’administration du cluster.
5. Lakehouse et SQL
Section intitulée « 5. Lakehouse et SQL »Tables Apache Iceberg sur votre stockage S3, SQL fédéré avec Trino, catalogue en couches, bases, tables et champs, éditeur SQL dans la console, lignage au niveau colonne et documentation des jeux de données générée par IA.
6. Notebooks et espaces de travail
Section intitulée « 6. Notebooks et espaces de travail »Jupyter et VS Code dans le navigateur, derrière la même authentification que la console, avec l’accès aux tables et aux buckets du projet et un assistant de code branché sur un modèle hébergé chez vous.
7. ML et IA générative
Section intitulée « 7. ML et IA générative »Suivi d’expériences et registre de modèles, compatibles avec le client MLflow ; modèles servis en REST derrière votre SSO, suivi de dérive ; passerelle LLM vers des modèles locaux ou des fournisseurs que vous choisissez ; RAG sur vos documents.
8. Agents IA et gouvernance
Section intitulée « 8. Agents IA et gouvernance »Un serveur MCP que vos agents pilotent sous leur propre compte de service, un fil d’activité en direct, la révocation d’un agent en un geste, la validation humaine des actions sensibles et des politiques par agent. SSO OIDC, SAML et LDAP/AD, RBAC par projet et par groupe, journal d’audit des actions humaines et des agents, secrets chiffrés, quotas et coûts par projet.
9. Déploiement et exploitation
Section intitulée « 9. Déploiement et exploitation »Un chart Helm, installé sur votre Kubernetes ou votre OpenShift, sur site, en cloud privé ou chez un hébergeur qualifié SecNumCloud ou certifié HDS, y compris hors ligne. Haute disponibilité, GitOps, métriques Prometheus, OpenTelemetry, sauvegarde et restauration, un realm par locataire, marque blanche.
10. Ouverture et réversibilité
Section intitulée « 10. Ouverture et réversibilité »Le code des pipelines s’exporte, les données restent dans des formats ouverts (Parquet, Iceberg, S3, SQL), et tout ce que fait la console passe par une API REST décrite en OpenAPI. S’y ajoutent l’API MLflow, le protocole MCP, le versionnement Git des projets, un fournisseur Terraform et une ligne de commande.
Si vous arrivez ici depuis un ancien lien
Section intitulée « Si vous arrivez ici depuis un ancien lien »L’ancien site de graal publiait des tutoriels et des intégrations par outil. Ils ont été remplacés par les familles ci-dessus :
- dbt, Dask, Beam, Airflow : les jobs et workflows de la famille 3, Orchestration ;
- Debezium : la capture de changements de la famille 1, Connecteurs ;
- Jenkins, Azure DevOps, Azure Data Factory : l’API REST et le GitOps de la famille 9 ;
- Migration depuis Databricks : le cas d’usage migration de plateforme.