Cas d’usage · Transverse
Votre plateforme data reprise, jobs et données compris
Un outil qui change de propriétaire, un parc Hadoop à renouveler, un contrat SaaS à renégocier : graal reprend vos jobs Python et Spark, recrée vos workflows et lit vos données là où elles sont pendant la bascule. À l’arrivée, tout tient dans des formats ouverts.
Le défi
Migrer sans arrêter la production
- Des dizaines de jobs et de workflows en production, écrits au fil des années.
- Un patrimoine Hadoop — HDFS, Hive, Kerberos — ou un SaaS qu’il faut quitter.
- Des programmes SAS encore au cœur de certains traitements.
- Une continuité de service attendue pendant toute la bascule.
Comment graal le traite
Une reprise par lots
Étape 01
Inventorier
Les Services graal recensent avec vous jobs, workflows, sources, droits et dépendances, et classent ce qui se reprend tel quel, ce qui s’adapte et ce qui s’arrête.
Étape 02
Reprendre les données
Le pont Hadoop lit HDFS et Hive kerberisés ; les tables migrent vers Iceberg, sur votre stockage S3, à votre rythme.
Étape 03
Reprendre les traitements
Les jobs Python et Spark se déposent avec leurs bibliothèques, les programmes SAS et les fichiers .sas7bdat s’exécutent sur graal, et les workflows sont recréés.
Étape 04
Basculer
Les deux plateformes tournent en parallèle, les résultats sont comparés, puis graal prend le relais, lot après lot.
Le scénario type : une direction data qui exploite depuis plusieurs années une plateforme DataOps ou un cluster Hadoop, et qui doit décider de la suite. Le pilote de 8 semaines reprend un premier lot de jobs de bout en bout, sur votre infrastructure, et fournit le chiffrage du reste.
Le 20/06/2025, Scaleway a annoncé l’acquisition de Saagie, plateforme française de DataOps, pour bâtir sa plateforme de données et d’IA.
À partir du 12/01/2027, un fournisseur de services de traitement de données ne peut plus facturer de frais de changement de fournisseur (Data Act, article 29).
Ce que vous obtenez
- Vos jobs Python et Spark en production sur votre infrastructure
- Des données en formats ouverts : Parquet, Iceberg, SQL
- Des workflows versionnés dans Git et documentés
- Une plateforme dont vous repartez, le jour venu, avec votre code et vos données
Ce qui reste chez vous
- Le code de vos jobs et de vos pipelines
- Vos données, en Parquet et Iceberg sur votre stockage
- Vos workflows et leur historique Git
Capacités mobilisées
- Connecteurs
HDFS et Hive kerberisés, bases, S3 et fichiers SAS.
- Orchestration et calcul
Jobs Python, Spark et SAS, workflows.
- Lakehouse et SQL
Tables Iceberg et SQL fédéré avec Trino.
- Gouvernance
Droits et audit repris projet par projet.
- Ouverture
Formats ouverts, API REST et code exportable.
Questions fréquentes
graal est-il une alternative on-premise à Databricks ?
graal s’installe sur votre Kubernetes, sur site ou chez l’hébergeur de votre choix, et vos jobs Spark et Python s’y reprennent. Quand vos données doivent rester dans votre infrastructure, c’est l’usage pour lequel graal est conçu.
Combien de temps dure une reprise ?
Cela dépend du patrimoine. Le pilote de 8 semaines reprend un premier lot de bout en bout et chiffre la suite.
Qui réalise la migration ?
Les Services graal, avec vos équipes, ou vos équipes seules, appuyées par la documentation et le support.
Peut-on garder Hadoop pendant la transition ?
Oui. Le pont Hadoop lit HDFS et Hive pendant toute la bascule ; vous arrêtez l’ancien cluster quand les résultats concordent.
Chiffrez votre reprise
Un premier lot de jobs repris en 8 semaines, et le plan pour la suite.