Je hebt besloten dat je data in Europa moet blijven. Op Europese infrastructuur, onder Europese wetgeving. Mooi!
Nu de moeilijkere vraag: hoe bouw je nu eigenlijk een data platform op Europese infra?
Die vraag hebben we de afelopen jaren al meerdere keren moeten beantwoorden. Eerst voor onze eigen klanten, daarna door er een product van te maken (Databaas). Deze post geeft je handvatten om zelf aan de slag te gaan. Welke cloud je kiest, welke tools je gebruikt, en hoe je ze aan elkaar knoopt.
Stap 1: Kies een Europese cloud
Alles begint bij infrastructuur. Als je compute en storage draaien op AWS, Azure of GCP, is je “soevereine data platform” een soevereine sticker op Amerikaanse hardware. EU-regio’s veranderen niets aan het juridische plaatje: Amerikaanse providers vallen onder de US CLOUD Act, ongeacht waar het datacenter staat, toegegeven door Microsoft.
Als je hier nog input voor zoekt:
- In European Cloud Providers Compared: A Hands-On Terraform Test meldde Stijn zich aan bij OVHcloud, Scaleway, Hetzner en STACKIT, deployde echte infrastructuur met Terraform, en scoorde ze op developer experience. Korte versie: Scaleway voor developer experience, OVH voor breedte aan services, Hetzner voor prijs.
- Ook een shout-out naar de Nederlandse clouds die recent flinke stappen hebben gezet: Soever (voor overheden), RAM-IT (voor zorg), Tilaa, Intermax, en dan mis ik er waarschijnlijk nog een boel.
- In European Cloud for Startups brachten we de startup credit-programma’s van Europese providers in kaart, want ja, die hebben ze ook.
- En als je direct praktisch aan de slag wilt: Getting started with OpenTofu/Terraform on OVH.
De takeaway specifiek voor een data platform: je hebt drie dingen nodig van je cloud. S3-compatibele object storage, een manier om containers te draaien (managed Kubernetes of stevige VMs), en een managed PostgreSQL voor de metadata van je tools. Scaleway en OVH bieden alle drie als managed services. Hetzner geeft je goedkope compute en object storage, maar je draait Kubernetes en Postgres zelf.
Stap 2: Accepteer dat de grote platformen niet meegaan
Stel je hebt Scaleway gekozen. Nu wil je je vertrouwde data platform erop zetten.
Dat kan niet.
| Platform | Draait op |
|---|---|
| Databricks | AWS, Azure, GCP |
| Snowflake | AWS, Azure, GCP |
| BigQuery | Alleen Google Cloud |
| Microsoft Fabric | Alleen Azure |
Geen van de grote vier data platformen kan op een Europese cloud worden gedeployed. Niet op OVH, niet op Scaleway, niet op Hetzner, niet op STACKIT. Ze zijn gebouwd op, en commercieel verbonden aan, de Amerikaanse hyperscalers. BigQuery en Fabric verlaten niet eens hun eigen cloud.
De vendors weten dat dit een probleem wordt, daarom hoor je veel over “sovereign regions” en “EU data boundaries.” Maar die constructies draaien nog steeds op hyperscaler-infrastructuur, met een control plane beheerd door een Amerikaans bedrijf. Als je eis Europese infrastructuur, Europese jurisdictie is, zijn de mainstream platformen simpelweg geen optie.
Het goede nieuws: alles wat die platformen doen, doet open source ook. Vaak zelfs met dezelfde engines onder de motorkap!
Stap 3: Kies je tools, laag voor laag
Een data platform is eigenlijk zes of zeven componenten onder één paraplu. Voor elke laag is er een volwassen open-source optie die overal draait waar containers draaien. Hieronder wat wij kozen voor Databaas, en de alternatieven die we afwogen.

Storage: Apache Iceberg op S3-compatibele object storage
Doel: Waar je data woont.
Je tabellen leven als open bestanden in een bucket die jij bezit. We gebruiken Apache Iceberg als table format: schema evolution, time travel, ACID transacties, allemaal op plain object storage.
Alternatieven:
- Delta Lake is technisch uitstekend, maar het zwaartepunt ligt in het Databricks-ecosysteem.
- Apache Hudi is sterk voor streaming-heavy workloads maar heeft een kleinere community.
Iceberg is de neutrale industriestandaard geworden. Zelfs Snowflake en Databricks ondersteunen het nu, wat alles zegt over waar de markt naartoe beweegt. Kiezen voor Iceberg betekent dat je data elke toolkeuze die je erboven maakt overleeft.
Catalog: Lakekeeper
Doel: Houdt bij welke data je hebt.
Iceberg tabellen hebben een catalog nodig die schema’s, snapshots en permissies bijhoudt. Wij gebruiken Lakekeeper, een open-source Iceberg REST catalog geschreven in Rust: snel, lightweight, self-hostable, met fijnmazige access control.
Alternatieven: Apache Polaris (Snowflake’s open-sourced catalog) en Project Nessie zijn solide opties. Unity Catalog is op papier open source, maar in de praktijk trekt het je het Databricks-ecosysteem in. Lakekeeper won voor ons op eenvoud van self-hosting en het permissiemodel.
Query engine: Trino & DuckDB
Doel: Stel vragen, krijg snel antwoorden.
Trino draait distributed SQL direct op je Iceberg tabellen: joins en aggregaties over miljarden rijen, geen kopieën, geen extracts. Het is dezelfde engine-klasse die Starburst en Athena aandrijft, dus je analisten krijgen een vertrouwde, snelle SQL-ervaring.
Alternatieven:
- ClickHouse is razend snel maar wil de data in zijn eigen formaat bezitten, wat het open-lakehouse idee ondermijnt.
- Apache Spark is het werkpaard voor zware transformaties maar overkill als interactieve engine.
En voor de meeste data, eerlijk gezegd, brengt DuckDB je verder dan je denkt. We schreven een complete startersgids over DuckDB + Superset.
DuckDB voor 80% van het werk, Trino voor de andere 20% wanneer je toegang op schaal nodig hebt.
Orchestration: Apache Airflow
Doel: Verplaatst data automatisch, op schema.
Pipelines hebben scheduling, retries en lineage nodig. Wij draaien managed Apache Airflow, en cruciaal: je DAGs leven in je eigen Git repos. Je pipeline-code blijft jouw code.
Alternatieven:
- Dagster heeft een fijne developer experience en asset-based model;
- Prefect is elegant voor Python-native teams.
We kozen Airflow voor het ecosysteem: elke data engineer kent het, elke tool integreert ermee, en hiring ervoor is makkelijk. Saai en stabiel zijn features in orchestration.
Identity & governance: Zitadel
Doel: Eén login, gecontroleerde toegang overal.
Eén login voor alles, of niemand gaat het platform veilig gebruiken. Zitadel handelt SSO, MFA en role-based access af over alle componenten, en kan federeren met de identity provider die je al hebt (Entra ID, Google Workspace).
Alternatieven:
- Keycloak is de veteraan hier en werkt prima, maar is operationeel zwaar.
- Authentik is een mooie lichtgewicht optie, maar dekte niet al onze behoeften.
Zitadel, zelf een Europees (Zwitsers) open-source project, raakte de sweet spot van moderne architectuur en multi-tenancy.
Dashboards: Apache Superset
Doel: Grafieken en KPI’s voor iedereen.
Apache Superset verbindt met Trino en geeft de hele organisatie charts, dashboards en SQL-exploratie, embedbaar en deelbaar.
Alternatieven:
- Metabase is vriendelijker voor niet-technische gebruikers maar de open-source editie is beperkter;
- Grafana schittert voor operationele metrics, minder voor business analytics;
- Lightdash is geweldig als je diep in dbt zit, maar dekt niet al onze integratiebehoeften.
Superset biedt de meeste mogelijkheden zonder licentieverrassingen.
Notebooks: JupyterHub + Marimo notebooks
Doel: Verkennen, prototypen, experimenteren.
Analisten en data scientists krijgen een managed workspace via JupyterHub, met Marimo voor reactive, reproduceerbare, git-vriendelijke notebooks die niet wegrotten zodra je ze sluit. Marimo notebooks zijn makkelijk te promoten naar productie en hebben goede integratie met je AI-wapen naar keuze (bijv. Claude, OpenAI).
Alternatieven:
- Hex en Deepnote zijn gepolijst, maar het is Amerikaanse SaaS, wat het hele punt hierboven tenietdoet.
JupyterHub is de self-hosted standaard; Marimo is de moderne upgrade erop.
Stap 4: Bouw het zelf
Alles hierboven is open source. Je kunt dit absoluut zelf in elkaar zetten, en voor teams met platform engineering capaciteit is het een legitieme route.
Het recept op hoofdlijnen:
- Provision de foundation. Managed Kubernetes, een object storage bucket, en een managed PostgreSQL op je Europese cloud naar keuze. Definieer alles in OpenTofu/Terraform vanaf dag één, onze provider-vergelijking laat zien wat je per cloud kunt verwachten.
- Deploy de componenten. Elke tool in deze post heeft een officiële Helm chart: Lakekeeper, Trino, Airflow, Zitadel, Superset, JupyterHub. Krijg ze allemaal draaiend tegen een Postgres database en de gedeelde bucket.
- Koppel identity. Configureer Zitadel als OIDC provider en verbind elke component ermee. Dit is lastiger dan het klinkt; elke tool heeft eigen ideeën over groepen en rollen. Sla dit over als je geen gecentraliseerde autorisatiematrix nodig hebt.
- Verbind het data plane. Wijs Trino en Airflow naar Lakekeeper, registreer de bucket als Iceberg warehouse, verbind Superset met Trino, en geef JupyterHub credentials naar de catalog.
- Maak het production-grade. TLS overal, network policies, backups voor elke Postgres instance, monitoring en alerting, failover op alle componenten, en een geteste upgrade-route voor acht-plus bewegende delen.
Stap 1 en 2 zijn een goede week werk. Of geef deze post gewoon aan Opus 5, en laat die binnen enkele uren een snelle POC neerzetten.
Stap 3 tot 5 is waar de echte tijd gaat zitten, en dat stopt nooit: Trino released ruwweg elke paar weken, Airflow en Superset hebben hun eigen cadans, en security patches wachten niet op je sprint planning.
Realistisch gezien teken je voor minimaal twee fulltime platform engineers.
Of: neem het als managed platform

Die voortdurende operationele load is precies waarom we Databaas hebben gebouwd: de volledige stack hierboven beschreven: Lakehouse, pipelines, governance, dashboards, notebooks en agents. Pre-geïntegreerd, EU-gehost, battle-tested en volledig gemanaged door ons team in Utrecht.
De principes blijven hetzelfde als wanneer je het zelf bouwt. Je data blijft in je eigen bucket, in je eigen cloud, in open formats. Je DAGs en notebooks blijven in je eigen repos. Alles is open source, dus als je ooit weg wilt, exporteer je je Iceberg tabellen en pipelines en loop je weg. Geen lock-in. En dat is het hele punt. Wij handelen de wiring, de upgrades en de 3 uur ‘s nachts pages af.
Eén platform, één contract, één team om te bellen. En als er iets kapot gaat, praat je met de mensen die het gebouwd hebben, niet met een ticket queue.
Wil je het zien draaien op je eigen data? Boek een demo! Of als je liever zelf bouwt en een voorsprong wilt, neem contact op via hello@wolk.work. We helpen je graag hoe dan ook.






