
Waarde halen uit grote datasets in korte tijd
1 juni 2022Eén week, miljoenen rijen, zes kernvragen. NMBS vroeg ons om een korte data-analyse uit te voeren. In één week onderzochten we twee gerelateerde datasets (elk enkele miljoenen rijen) om hen te helpen hun data te begrijpen en ontbrekende observaties te identificeren. De analyse moest achteraf reproduceerbaar en presenteerbaar zijn door de klant zelf.
Dit zijn onze tips om grote datasets te onderzoeken wanneer de tijd beperkt is.
Zet je workflow van bij de start goed op
Vraag je voor je data begint te verkennen af: hoeveel data heb ik? Hoe ga ik de resultaten presenteren? Moet de analyse reproduceerbaar zijn? Voor NMBS zetten we op dag één een pipeline op: data van Azure Blob Storage naar Databricks, output terug naar Blob Storage, met Azure Data Factory die triggert op nieuwe bestanden. Daarbovenop stond een Power BI-dashboard voor zowel exploratie als de eindpresentatie. Dat garandeerde reproduceerbaarheid, verhoogde de productiviteit en liet de klant toe om toekomstige analyses te draaien door simpelweg nieuwe bestanden te uploaden.
Focus op concrete voorbeelden
Bij grote volumes focus je beter op concrete voorbeelden dan op samenvattingen alleen. Gewoon zeggen dat '15% van de data ontbreekt' helpt weinig. Door voorbeelden van zowel problematische als niet-problematische observaties te onderzoeken en ze met de business te bespreken, ontdekten we dat veel aanvankelijk gemarkeerde gevallen 'ontbrekend maar niet problematisch' waren, en die werden vervolgens uit de eindanalyse geweerd.

Communicatie, concrete doelen en documentatie
Met beperkte tijd voorkomen dagelijkse calls en nauw contact met de klant dat er uren verloren gaan aan werk met lage prioriteit. We spraken vooraf zes concrete vragen af en presenteerden de conclusies op het einde van de week. Onze laatste halve dag ging volledig naar documentatie: tien procent van de totale werktijd, maar zonder zou de hele analyse achteraf zo goed als waardeloos geweest zijn.
Ontdek meer
Datagedreven bedrijven: wanneer goed genoeg niet langer volstaat
Datagedreven bedrijven presteren beter dan hun concurrenten. Toch wijzen 9 op de 10 bedrijven naar culturele uitdagingen als de grootste bottleneck. Drie praktische aanbevelingen om datagedreven te worden.

Cognitive search: waarde halen uit ongestructureerde data
Hoe Tafuta, het cognitive search platform van Arinti, organisaties helpt om waarde te halen uit ongestructureerde data met NLP, speech-to-text en beeldverwerking.

Datamanagement voor organisaties herdefiniëren met Microsoft Fabric
Microsoft Fabric verenigt diverse datamanagementtools in één samenhangend SaaS-platform. Dit artikel verkent de architectuur en hoe die organisaties in staat stelt om hun dataoperaties te optimaliseren.

Gerelateerde cases
Verkoop voorspellen over 14 productcategorieën
Salesforecasting voor Unilever België: dagelijkse en maandelijkse verkoopvolumes voorspellen over 14 productcategorieën met categoriespecifieke machine learning-modellen, en Power BI-dashboards voor het commerciële team.

Governed Databricks-dataplatform voor wereldwijde operaties
Volvo Logistics distribueert wereldwijd meer dan 700.000 wisselstukken. We bouwden een governed Databricks-dataplatform dat operationele data van zes wereldwijde sites samenbracht. Het resultaat: tot 40% efficiëntiewinst, 99% minder pipeline-latency en self-service analytics voor businessgebruikers.
