← Vue d’ensemble

Lakehouse et SQL

Un lakehouse ouvert, sur votre stockage

Vos données restent dans votre stockage objet, en tables Apache Iceberg. Trino les interroge en SQL, avec vos bases existantes, sans copie. Un catalogue commun dit ce que chaque table contient, d’où elle vient et qui peut la lire.

Illustration de l’interface

Capacités clés

Des tables ouvertes, un SQL commun

Tables Apache Iceberg

Transactions, évolution de schéma et retour à un état antérieur, sur votre S3, dans un format que tout l’écosystème sait lire.

SQL fédéré avec Trino

Une même requête joint vos tables Iceberg et vos bases PostgreSQL, Oracle ou SQL Server, sans déplacer les données.

Un éditeur SQL dans la console

Requêtes en lecture seule, résultats paginés, délai et volume bornés : l’exploration ne met pas le cluster à genoux.

Un catalogue en couches

Couches, bases, tables et champs, avec leurs descriptions et une recherche plein texte. Il se met à jour à la fin de chaque run.

Le lignage jusqu’à la colonne

Pour chaque colonne, les colonnes sources et les traitements qui l’ont produite, relevés automatiquement à l’exécution.

Une documentation rédigée par IA

graal profile un échantillon et propose la description d’une table et de ses champs. Un humain la valide avant publication.

Comment ça marche

De la donnée brute à la table documentée

  1. Étape 01

    Écrire

    Pipelines et jobs écrivent en Iceberg, couche par couche : brute, nettoyée, prête à l’usage.

  2. Étape 02

    Cataloguer

    Chaque table écrite rejoint le catalogue avec son schéma, son propriétaire et son lignage.

  3. Étape 03

    Interroger

    Analystes, notebooks, applications et agents interrogent les mêmes tables en SQL, sous les mêmes droits.

Le stockage et le calcul restent séparés

Les données sont des fichiers Parquet dans votre stockage objet ; Iceberg y ajoute les métadonnées qui en font des tables transactionnelles. Le calcul, lui, vient à la demande : Trino pour le SQL interactif, Spark pour les traitements lourds. Vous dimensionnez l’un sans toucher à l’autre.

Un seul catalogue pour toutes les équipes

Le catalogue de graal est celui que lisent l’éditeur SQL, les notebooks, les pipelines et les agents. Une table décrite une fois l’est pour tout le monde, et ses droits s’appliquent quel que soit le chemin d’accès.

Standards et intégrations

Des formats que tout le monde lit

  • Apache Iceberg
  • Parquet
  • Trino
  • SQL
  • S3
  • Apache Spark
  • PyIceberg
  • OpenLineage

Gouvernance

Chaque table a ses droits

  • Droits de lecture et d’écriture par projet, par base et par table
  • Chaque requête est attribuée à une personne, à une application ou à un agent
  • Les tables restent lisibles hors de graal, par tout moteur compatible Iceberg

Questions fréquentes

Nos données sont-elles copiées chez graal ?

Non. Les tables vivent dans votre stockage compatible S3, et les métadonnées dans la base PostgreSQL de votre installation.

Un autre moteur peut-il lire nos tables ?

Oui. Iceberg est un format ouvert, et graal expose un catalogue REST Iceberg : Spark, PyIceberg ou un autre moteur compatible les lisent directement.

Faut-il migrer nos bases pour les interroger ?

Non. Trino les interroge là où elles sont. Vous déplacez vers Iceberg ce qui gagne à l’être, à votre rythme.

Interrogez vos tables en SQL

Une requête qui joint consommation et température régionales : c’est l’un des actes de la démonstration.