Wat is data-integratie en ETL?
Data integratie is het automatisch samenbrengen van gegevens uit verschillende systemen op één plek, in één structuur, zodat je ze kunt combineren en gebruiken. ETL staat voor extract, transform, load: data ophalen uit een bron, omzetten naar een bruikbare vorm en wegschrijven naar een doel, meestal een database of datawarehouse. Een data pipeline is de geautomatiseerde keten die dat elke nacht, elk uur of continu doet, inclusief foutafhandeling en bewaking.
Bij veel MKB-bedrijven bestaat die keten uit een medewerker die exporteert, knipt en plakt. Dat werkt tot er iemand ziek is, een kolom verschuift of het volume te groot wordt. Een goede pipeline vervangt dat werk, doet het elke dag hetzelfde en laat het weten als iets afwijkt. Het is de basis onder elk dashboard, elke rapportage en elke analyse; zonder betrouwbare pipeline zijn die cijfers niet te vertrouwen.
Voor wie is data-integratie interessant?
Voor bedrijven waarvan de gegevens over meerdere pakketten verspreid zitten en die daar één beeld uit willen halen. Voorbeelden van bronnen die we regelmatig koppelen:
- ERP en boekhouding: Exact Online, AFAS, Microsoft Dynamics, een branchepakket of maatwerksoftware, via API of een rapportagedatabase.
- Webshops en marktplaatsen: Shopify, WooCommerce, Magento en Bol.com, voor orders, retouren en productdata.
- CRM en verkoop: HubSpot, Pipedrive, Salesforce of een eigen klantsysteem, voor pijplijn en klantcontact.
- Planning, uren en HR: urenregistratie, roosterpakketten en verzuimsystemen.
- Excel en bestanden: budgetten, prijslijsten en handmatige lijsten in SharePoint, OneDrive of op een netwerkschijf.
- Machines en apparatuur: logbestanden, tellerstanden en sensordata uit productie of installaties.
Het doel is meestal een datawarehouse of datalaag voor business intelligence. Soms is het doel een ander systeem: orders van de webshop die naar het ERP moeten. In dat laatste geval spreken we van een API-koppeling tussen systemen, en die bouwen we net zo goed.
Wanneer is een data pipeline slim?
Een pipeline loont als dezelfde export vaker dan één keer per maand handmatig wordt gemaakt, als meerdere mensen dezelfde data op verschillende manieren ophalen, of als de gegevens te laat komen om nog nuttig te zijn. Ook bij een verhuizing naar een nieuw pakket is een pipeline slim: je bewaart de historie van het oude systeem in een datalaag in plaats van alles over te zetten, wat vaak goedkoper is dan een volledige datamigratie.
Wanneer niet? Als één bron volstaat en de BI-tool er rechtstreeks op kan, is een aparte pipeline overbodig. En als een bron alleen bereikbaar is via schermen zonder API of export, wegen we eerst af of het handwerk goedkoper is dan een kwetsbare koppeling. Daar zijn we eerlijk over.
Wat kost data-integratie?
De prijs hangt af van het aantal bronnen, de kwaliteit van hun API's, de benodigde transformaties en de eisen aan verversing en bewaking. Indicatieve prijzen, exclusief btw en hosting:
- Eén bron koppelen naar een datalaag, met dagelijkse verversing en basiscontroles (bijvoorbeeld Exact of Shopify via Airbyte): €5.000 tot €8.500
- Twee tot vier bronnen met transformaties, koppeling van klant- en artikelnummers en historie: €8.500 tot €18.000
- Pipeline-opzet voor vijf of meer bronnen, uurlijkse verversing, uitgebreide datakwaliteitscontroles en Azure Data Factory of maatwerk Python: €18.000 tot €35.000
- Maatwerkkoppeling voor een bron zonder standaardconnector of met een beperkte API: €3.500 tot €10.000 per bron
- Excel- of bestandskoppeling met structuurcontrole: €1.500 tot €3.500
- Bewaking, onderhoud bij API-wijzigingen en kleine aanpassingen: €150 tot €600 per maand
Je krijgt een vaste prijs per bron of per fase. Vaak starten we met de bron die het meeste handwerk vervangt, zodat je binnen drie weken de eerste tijdwinst ziet.
Hoe wij data-integratie aanpakken
We beginnen met een broninventarisatie: per systeem bekijken we welke gegevens beschikbaar zijn, via welke API of export, hoe vaak ze veranderen en waar de valkuilen zitten. Bij Exact zijn dat bijvoorbeeld de aanroeplimieten, bij AFAS de inrichting van de connectoren, bij Shopify de paginering van grote ordervolumes. Die kennis bepaalt de aanpak per bron.
Voor standaardpakketten gebruiken we Airbyte, een open source tool met kant-en-klare connectoren die op je eigen server draait. Werk je in Azure, dan zetten we Azure Data Factory in. Voor bronnen zonder goede connector, voor complexe transformaties of voor het samenvoegen van klant- en artikelnummers uit verschillende systemen schrijven we maatwerk in Python met pandas. De data landt in PostgreSQL of SQL Server, eerst ruw en daarna omgezet via dbt-modellen die de definities vastleggen en testen.
Datakwaliteit bouwen we in vanaf de eerste run. Elke pipeline controleert of het aantal records klopt, of sleutels uniek zijn, of er geen onverwacht lege velden of dubbele klanten zijn, en of de totalen aansluiten op de bron. Wijkt iets af, dan gaat er een melding naar ons en naar jou voordat het dashboard verkeerde cijfers toont. Alles staat in versiebeheer met documentatie, zodat een eigen medewerker of een andere partij het kan overnemen. Wil je pipelines laten bouwen door iemand die tijdelijk in je team meedraait, dan kun je ook een data-engineer inhuren.
Data-integratie in Tilburg, Brabant en heel Nederland
SuperCoders bouwt en bewaakt data pipelines vanuit Tilburg voor bedrijven in Brabant en heel Nederland. De broninventarisatie doen we graag op locatie met de mensen die de exports nu maken, want zij weten precies waar de data niet klopt. De bouw doen onze eigen data-engineers, met een vaste prijs per bron. De pipelines, de modellen en de documentatie zijn van jou. Wil je af van handmatige exports? Bel 013 234 0782 of plan een gratis adviesgesprek; binnen twee werkdagen heb je een prijsindicatie.