Tables Apache Iceberg
Transactions, évolution de schéma et retour à un état antérieur, sur votre S3, dans un format que tout l’écosystème sait lire.
Lakehouse et SQL
Vos données restent dans votre stockage objet, en tables Apache Iceberg. Trino les interroge en SQL, avec vos bases existantes, sans copie. Un catalogue commun dit ce que chaque table contient, d’où elle vient et qui peut la lire.
Capacités clés
Transactions, évolution de schéma et retour à un état antérieur, sur votre S3, dans un format que tout l’écosystème sait lire.
Une même requête joint vos tables Iceberg et vos bases PostgreSQL, Oracle ou SQL Server, sans déplacer les données.
Requêtes en lecture seule, résultats paginés, délai et volume bornés : l’exploration ne met pas le cluster à genoux.
Couches, bases, tables et champs, avec leurs descriptions et une recherche plein texte. Il se met à jour à la fin de chaque run.
Pour chaque colonne, les colonnes sources et les traitements qui l’ont produite, relevés automatiquement à l’exécution.
graal profile un échantillon et propose la description d’une table et de ses champs. Un humain la valide avant publication.
Comment ça marche
Étape 01
Pipelines et jobs écrivent en Iceberg, couche par couche : brute, nettoyée, prête à l’usage.
Étape 02
Chaque table écrite rejoint le catalogue avec son schéma, son propriétaire et son lignage.
Étape 03
Analystes, notebooks, applications et agents interrogent les mêmes tables en SQL, sous les mêmes droits.
Les données sont des fichiers Parquet dans votre stockage objet ; Iceberg y ajoute les métadonnées qui en font des tables transactionnelles. Le calcul, lui, vient à la demande : Trino pour le SQL interactif, Spark pour les traitements lourds. Vous dimensionnez l’un sans toucher à l’autre.
Le catalogue de graal est celui que lisent l’éditeur SQL, les notebooks, les pipelines et les agents. Une table décrite une fois l’est pour tout le monde, et ses droits s’appliquent quel que soit le chemin d’accès.
Standards et intégrations
Gouvernance
Non. Les tables vivent dans votre stockage compatible S3, et les métadonnées dans la base PostgreSQL de votre installation.
Oui. Iceberg est un format ouvert, et graal expose un catalogue REST Iceberg : Spark, PyIceberg ou un autre moteur compatible les lisent directement.
Non. Trino les interroge là où elles sont. Vous déplacez vers Iceberg ce qui gagne à l’être, à votre rythme.
Une requête qui joint consommation et température régionales : c’est l’un des actes de la démonstration.