Governed Databricks-dataplatform voor wereldwijde operaties
Volvo Logistics runt de supply chain voor wisselstukken van Volvo's aftermarket wereldwijd. Het distribueert meer dan 700.000 wisselstukken over zes wereldwijde sites. De data achter die operaties zat verspreid over mainframes, SAP, streaming feeds en legacy-systemen. Gedeelde definities of overkoepelende governance waren er niet. We bouwden SMLCloud: een governed Azure Databricks-platform dat alle operationele, warehouse- en supply chain-data samenbrengt in analytics-ready dataproducten.



Aftermarket-logistiek op wereldschaal
Het juiste onderdeel moet snel bij de juiste werkplaats geraken. De SML-divisie van Volvo Logistics is verantwoordelijk voor het leveren van wisselstukken van leveranciers aan dealers en werkplaatsen wereldwijd. Het is een operatie met hoge volumes en strakke timing. Planning, warehousing en transportbeslissingen hangen er allemaal af van accurate, actuele data.
Vóór dit project zat die data verspreid over tientallen bronsystemen. Mainframes bevatten operationele records. SAP bevatte transactionele data. Middleware-tools zoals IBM CDC en IBM MQ legden wijzigingen uit bronsystemen vast. Azure Event Hub bracht live signalen van machines en processen binnen. Elk domein (Warehousing, Transport, Planning) onderhield zijn eigen extracten en zijn eigen versie van de cijfers. Geplande pipelines draaiden naast live datafeeds, ongecoördineerd en vaak met dubbel werk.
Governance werd inconsistent toegepast. Wanneer businessgebruikers een nieuw rapport nodig hadden, ging de aanvraag een IT-wachtrij in en kon het weken duren voor er iets kwam. Sommige aanvragen kwamen er nooit uit.
De structurele kloof
Het zichtbare probleem was gefragmenteerde rapportering. Het onderliggende probleem: Volvo Logistics had geen centrale governed datalaag die alle domeinen kon bedienen met consistente definities en gecontroleerde toegang. Jaren van fusies en overnames hadden systemen achtergelaten die nooit ontworpen waren om met elkaar te praten. Voorraadplanning gebeurde magazijn per magazijn, met beperkt zicht op welke resources gedeeld konden worden.
Wat nodig was: een platform dat uit elk bronsysteem kon inladen, definities over domeinen heen standaardiseerde en governance op elke laag afdwong. En dat tegelijk snel genoeg bleef voor operationele besluitvorming. We hebben dat platform samen met het SML-team gescopet en gebouwd.
SMLCloud: het Databricks-dataplatform
SMLCloud is een grootschalig Azure Databricks-platform dat alle operationele, warehouse- en supply chain-data van Volvo Logistics samenbrengt in governed, analytics-ready dataproducten. De architectuur volgt een medallion-patroon: een gelaagde aanpak waarbij data stap voor stap schoner wordt naarmate ze van ruwe ingestie naar business-ready output beweegt.
Bronze: ruwe data, bewaard zoals ze binnenkomt
Ruwe data uit elk bronsysteem landt ongewijzigd in de Bronze-laag: mainframe-dumps, SAP-extracten, change feeds uit middleware, live streams uit Event Hub. Niets wordt gefilterd of aangepast. Zo ontstaat een auditeerbaar spoor van alles wat het platform binnenkomt, ongeacht formaat of herkomst.
Silver: gestandaardiseerd en verrijkt
Eén ingestieframework doet het transformatiewerk voor alle bronsystemen. Het wordt aangestuurd door configuratie in plaats van custom code. Het past zich aan wanneer datastructuren veranderen, dwingt datatypes en validatieregels af en volgt hoe records evolueren doorheen de tijd. Mappingtabellen standaardiseren definities, zodat een shipment hetzelfde betekent of die nu uit Warehousing of Transport komt.
Gold: business-ready dataproducten
Gecureerde datasets voeden Power BI-dashboards, operationele applicaties en de AI/BI-tools van Databricks. Elke dataset is per domein georganiseerd en governed via Unity Catalog: Warehousing ziet zijn eigen dataproducten en Transport de zijne. Toegang wordt gecontroleerd tot op het niveau van individuele datasetstructuren.
Governance ingebouwd in elke pipeline
Unity Catalog beheert elke dataset, elke rapportview en elk toegangsrecht op het platform.
We migreerden meer dan 30 domeinschema's van het vorige catalogussysteem (Hive Metastore) en standaardiseerden de toegangscontroles. Alle geautomatiseerde processen draaien voortaan onder gecontroleerde, auditeerbare identiteiten in plaats van persoonlijke accounts. Toegang is rolgebaseerd: een transportanalist ziet transportdata, geen warehouse-financials. Data lineage wordt end-to-end bijgehouden: elk cijfer is terug te traceren naar zijn bron.
Governance is hier geen beleidsdocument. Het zit ingebouwd in de dagelijkse werking van het platform: elke pipeline, elke deployment en elke toegangsaanvraag loopt erdoor.
Van enkel batch naar near-real-time
De oorspronkelijke dataflows draaiden op schema: nachtelijke jobs die de records van de vorige dag verwerkten. Voor een logistieke operatie waar beslissingen afhangen van wat er nu gebeurt, was die vertraging van een dag een echte beperking. De business werkte eromheen in plaats van ze te aanvaarden.
Streaming pipelines
We introduceerden een real-time spoor naast de geplande pipelines. Machines sturen statusupdates via MQTT door Azure Event Grid. Elk toestel authenticeert met zijn eigen certificaat, waardoor de datastroom zowel veilig als traceerbaar is. Spark Structured Streaming transformeert de binnenkomende signalen bij aankomst. Een lichtgewicht database bewaart de laatste meting per metric. Een geautomatiseerde functie pusht die naar Salesforce voor verhuurmedewerkers wereldwijd.
Field engineers en rental managers kunnen nu de live machinestatus checken vanop hun smartphone.
Lakeflow-migratie
Het platform migreert zijn geplande pipelines naar Lakeflow Declarative Pipelines, een nieuwer Databricks-framework dat tussentijdse opslag tussen verwerkingsstappen overbodig maakt. Het resultaat: tot 40% efficiëntiewinst op routinematige datataken en 99% minder pipeline-latency.
“Met een simpele klik schakelen we onze metadata-scheduling om van getriggerd naar continu en weer terug, zonder in complexe code te moeten duiken. Spark Declarative Pipelines vangt schemawijzigingen bijna automatisch op. Een mooie feature.”
Data zonder IT-ticket
We zetten Databricks' AI/BI Genie Spaces in als interactielaag voor businessgebruikers. Daarmee stellen mensen in gewone taal vragen over hun data en krijgen ze antwoorden uit de gecureerde Gold-datasets. Power BI-dashboards dekken de gestructureerde rapporteringsnoden. Genie Spaces dekt de ad-hocvragen: de vragen die opduiken in een meeting en waarvoor vroeger een data-analist nodig was.
Voor een groeiend deel van de datanoden van de organisatie is de wachtrij tussen vraag en antwoord teruggebracht van weken naar seconden.

Delivery op schaal over zes sites
Met honderden geautomatiseerde datajobs verspreid over tientallen domeinpackages had het platform strikte deployment-discipline nodig.
We industrialiseerden de delivery met Databricks Asset Bundles en Azure DevOps CI/CD. Elke wijziging volgt een gecontroleerd pad: development, quality assurance, pre-productie, productie. Enkel de packages die effectief veranderd zijn, worden gedeployed. Geautomatiseerde tests verifiëren de logica voordat iets een live omgeving raakt. Code-formatchecks bewaken de consistentie binnen het engineeringteam.
Het platform draait over zes wereldwijde sites, verwerkt data uit meer dan 200 brontabellen en ondersteunt de dagelijkse werking van een logistiek netwerk dat Volvo's aftermarket wereldwijd bedient. Het draait sinds mei 2022 en blijft uitbreiden.

“Vandaag krijgen we een geïntegreerd zicht op waar wisselstukken zich bevinden, op de waarde van wisselstukken over magazijnen heen en op de potentiële kosten om onderdelen te verzenden van magazijn naar magazijn of naar dealers.”
Wat dit mogelijk maakte
Volvo Logistics begon dit project met een dataomgeving die data verzamelde maar niet kon verbinden. Vier jaar later is het platform geëvolueerd van enkel batchverwerking naar een hybride architectuur die batch- en real-time pipelines combineert op één governed Databricks-platform.
De volgende stappen liggen al op tafel: predictive maintenance op basis van sensorpatronen, een data-as-a-service-aanbod waarbij machine-inzichten een product worden, en de verdere migratie naar Lakeflow Declarative Pipelines voor volledig real-time ingestie.
