Data & inzicht

Data-integratie en ETL: bronnen koppelen tot betrouwbare data pipelines

De cijfers op je dashboard zijn zo goed als de pipeline erachter. Die bouwen en bewaken wij.

Vanaf €5.000 Doorlooptijd: 3-8 weken
  • Standaardtools waar het kan (Airbyte, Azure Data Factory), maatwerk in Python waar een bron dat vereist; nooit duurder dan nodig.
  • Datakwaliteit ingebouwd: elke run controleert volledigheid, dubbelingen en afwijkingen en meldt het voordat jij het ziet.
  • Pipelines in versiebeheer op jouw naam, met documentatie, zodat je niet vastzit aan ons of aan een tool.

Wat is data-integratie en ETL?

Data integratie is het automatisch samenbrengen van gegevens uit verschillende systemen op één plek, in één structuur, zodat je ze kunt combineren en gebruiken. ETL staat voor extract, transform, load: data ophalen uit een bron, omzetten naar een bruikbare vorm en wegschrijven naar een doel, meestal een database of datawarehouse. Een data pipeline is de geautomatiseerde keten die dat elke nacht, elk uur of continu doet, inclusief foutafhandeling en bewaking.

Bij veel MKB-bedrijven bestaat die keten uit een medewerker die exporteert, knipt en plakt. Dat werkt tot er iemand ziek is, een kolom verschuift of het volume te groot wordt. Een goede pipeline vervangt dat werk, doet het elke dag hetzelfde en laat het weten als iets afwijkt. Het is de basis onder elk dashboard, elke rapportage en elke analyse; zonder betrouwbare pipeline zijn die cijfers niet te vertrouwen.

Voor wie is data-integratie interessant?

Voor bedrijven waarvan de gegevens over meerdere pakketten verspreid zitten en die daar één beeld uit willen halen. Voorbeelden van bronnen die we regelmatig koppelen:

  • ERP en boekhouding: Exact Online, AFAS, Microsoft Dynamics, een branchepakket of maatwerksoftware, via API of een rapportagedatabase.
  • Webshops en marktplaatsen: Shopify, WooCommerce, Magento en Bol.com, voor orders, retouren en productdata.
  • CRM en verkoop: HubSpot, Pipedrive, Salesforce of een eigen klantsysteem, voor pijplijn en klantcontact.
  • Planning, uren en HR: urenregistratie, roosterpakketten en verzuimsystemen.
  • Excel en bestanden: budgetten, prijslijsten en handmatige lijsten in SharePoint, OneDrive of op een netwerkschijf.
  • Machines en apparatuur: logbestanden, tellerstanden en sensordata uit productie of installaties.

Het doel is meestal een datawarehouse of datalaag voor business intelligence. Soms is het doel een ander systeem: orders van de webshop die naar het ERP moeten. In dat laatste geval spreken we van een API-koppeling tussen systemen, en die bouwen we net zo goed.

Wanneer is een data pipeline slim?

Een pipeline loont als dezelfde export vaker dan één keer per maand handmatig wordt gemaakt, als meerdere mensen dezelfde data op verschillende manieren ophalen, of als de gegevens te laat komen om nog nuttig te zijn. Ook bij een verhuizing naar een nieuw pakket is een pipeline slim: je bewaart de historie van het oude systeem in een datalaag in plaats van alles over te zetten, wat vaak goedkoper is dan een volledige datamigratie.

Wanneer niet? Als één bron volstaat en de BI-tool er rechtstreeks op kan, is een aparte pipeline overbodig. En als een bron alleen bereikbaar is via schermen zonder API of export, wegen we eerst af of het handwerk goedkoper is dan een kwetsbare koppeling. Daar zijn we eerlijk over.

Wat kost data-integratie?

De prijs hangt af van het aantal bronnen, de kwaliteit van hun API's, de benodigde transformaties en de eisen aan verversing en bewaking. Indicatieve prijzen, exclusief btw en hosting:

  • Eén bron koppelen naar een datalaag, met dagelijkse verversing en basiscontroles (bijvoorbeeld Exact of Shopify via Airbyte): €5.000 tot €8.500
  • Twee tot vier bronnen met transformaties, koppeling van klant- en artikelnummers en historie: €8.500 tot €18.000
  • Pipeline-opzet voor vijf of meer bronnen, uurlijkse verversing, uitgebreide datakwaliteitscontroles en Azure Data Factory of maatwerk Python: €18.000 tot €35.000
  • Maatwerkkoppeling voor een bron zonder standaardconnector of met een beperkte API: €3.500 tot €10.000 per bron
  • Excel- of bestandskoppeling met structuurcontrole: €1.500 tot €3.500
  • Bewaking, onderhoud bij API-wijzigingen en kleine aanpassingen: €150 tot €600 per maand

Je krijgt een vaste prijs per bron of per fase. Vaak starten we met de bron die het meeste handwerk vervangt, zodat je binnen drie weken de eerste tijdwinst ziet.

Hoe wij data-integratie aanpakken

We beginnen met een broninventarisatie: per systeem bekijken we welke gegevens beschikbaar zijn, via welke API of export, hoe vaak ze veranderen en waar de valkuilen zitten. Bij Exact zijn dat bijvoorbeeld de aanroeplimieten, bij AFAS de inrichting van de connectoren, bij Shopify de paginering van grote ordervolumes. Die kennis bepaalt de aanpak per bron.

Voor standaardpakketten gebruiken we Airbyte, een open source tool met kant-en-klare connectoren die op je eigen server draait. Werk je in Azure, dan zetten we Azure Data Factory in. Voor bronnen zonder goede connector, voor complexe transformaties of voor het samenvoegen van klant- en artikelnummers uit verschillende systemen schrijven we maatwerk in Python met pandas. De data landt in PostgreSQL of SQL Server, eerst ruw en daarna omgezet via dbt-modellen die de definities vastleggen en testen.

Datakwaliteit bouwen we in vanaf de eerste run. Elke pipeline controleert of het aantal records klopt, of sleutels uniek zijn, of er geen onverwacht lege velden of dubbele klanten zijn, en of de totalen aansluiten op de bron. Wijkt iets af, dan gaat er een melding naar ons en naar jou voordat het dashboard verkeerde cijfers toont. Alles staat in versiebeheer met documentatie, zodat een eigen medewerker of een andere partij het kan overnemen. Wil je pipelines laten bouwen door iemand die tijdelijk in je team meedraait, dan kun je ook een data-engineer inhuren.

Data-integratie in Tilburg, Brabant en heel Nederland

SuperCoders bouwt en bewaakt data pipelines vanuit Tilburg voor bedrijven in Brabant en heel Nederland. De broninventarisatie doen we graag op locatie met de mensen die de exports nu maken, want zij weten precies waar de data niet klopt. De bouw doen onze eigen data-engineers, met een vaste prijs per bron. De pipelines, de modellen en de documentatie zijn van jou. Wil je af van handmatige exports? Bel 013 234 0782 of plan een gratis adviesgesprek; binnen twee werkdagen heb je een prijsindicatie.

Wat je krijgt

  • Een broninventarisatie met per systeem de beschikbare data, de koppelmethode en de bekende valkuilen
  • Werkende pipelines met Airbyte, Azure Data Factory of Python die dagelijks of elk uur draaien
  • Een datalaag in PostgreSQL of SQL Server met ruwe en opgeschoonde data en historie
  • Datakwaliteitscontroles per run: aantallen, unieke sleutels, lege velden en aansluiting op de bron
  • Bewaking met meldingen bij fouten, uitval van een bron of onverwachte afwijkingen
  • Versiebeheer en documentatie op jouw naam, zodat de pipelines overdraagbaar zijn

Onze aanpak

  1. 1

    Broninventarisatie

    We bekijken per systeem welke data beschikbaar is, via welke API of export, hoe vaak ze verandert en waar de valkuilen zitten.

  2. 2

    Aanpak per bron en vaste prijs

    Per bron kiezen we Airbyte, Azure Data Factory of maatwerk Python, en we bepalen de verversfrequentie. Je krijgt een vaste prijs per bron.

  3. 3

    Eerste pipeline en controle

    De belangrijkste bron komt binnen, met kwaliteitscontroles en een vergelijking van de totalen met het bronsysteem.

  4. 4

    Uitbreiden en transformeren

    Elke sprint voegt bronnen toe en bouwt de dbt-modellen die klant- en artikelnummers koppelen en definities vastleggen.

  5. 5

    Bewaking en onderhoud

    De pipelines draaien automatisch met meldingen. We onderhouden ze bij API-wijzigingen of dragen ze over aan je eigen team.

Technologie & tooling

AirbyteAzure Data FactoryPython (pandas)dbtPostgreSQLSQL ServerExact, AFAS en Shopify API'sExcel- en SharePoint-koppelingen

Veelgestelde vragen

Wat is het verschil tussen ETL en een API-koppeling?

Een API-koppeling stuurt gegevens van het ene systeem naar het andere om een proces te laten werken, bijvoorbeeld een webshoporder naar het ERP. ETL en data-integratie halen gegevens uit meerdere systemen naar één centrale plek voor rapportages en analyse, zonder de bronsystemen te wijzigen. Beide bouwen we; het doel bepaalt de aanpak.

Wat kost een data pipeline?

Eén bron koppelen naar een datalaag met dagelijkse verversing kost €5.000 tot €8.500 exclusief btw. Twee tot vier bronnen met transformaties en historie liggen tussen €8.500 en €18.000. Een opzet voor vijf of meer bronnen met uurlijkse verversing en uitgebreide controles kost €18.000 tot €35.000. Bewaking en onderhoud kosten €150 tot €600 per maand.

Airbyte, Azure Data Factory of maatwerk: wat is beter?

Airbyte is ideaal voor standaardpakketten met een goede connector en draait op je eigen server zonder licentiekosten. Azure Data Factory past als je al in Azure werkt. Maatwerk in Python is nodig bij bronnen zonder connector, complexe transformaties of het samenvoegen van gegevens uit systemen die elkaar niet kennen. Meestal combineren we ze: standaard waar het kan, maatwerk waar het moet.

Hoe voorkomen jullie dat verkeerde data op het dashboard komt?

Elke pipeline-run controleert het aantal records, de uniciteit van sleutels, lege of afwijkende velden en de aansluiting van totalen op de bron. Bij een afwijking wordt de run gemarkeerd en gaat er een melding naar ons en naar jou, voordat het dashboard de cijfers toont. Structurele problemen in de bron rapporteren we, zodat je ze daar kunt oplossen.

Wat gebeurt er als een leverancier zijn API verandert?

Dat komt voor, zeker bij Exact, Shopify en AFAS. De bewaking merkt het direct, omdat de run mislukt of de aantallen afwijken. Binnen het onderhoudsabonnement passen wij de pipeline aan; zonder abonnement doen we het op uurbasis of doet je eigen team het aan de hand van de documentatie.