Artikel 10 van de AI Act richt zich op een van de belangrijkste oorzaken van onbetrouwbare of discriminerende AI: slechte trainingsdata. De verplichting geldt primair voor aanbieders van hoog-risico AI-systemen die met technieken werken waarbij modellen worden getraind met data (dus niet voor elk hoog-risicosysteem — puur regelgebaseerde systemen zonder trainingsdata vallen hier grotendeels buiten).
Welke datasets vallen hieronder?
De eisen gelden voor trainings-, validatie- en testdatasets — de data waarmee het model wordt gebouwd, tussentijds bijgesteld en uiteindelijk getest voordat het op de markt komt.
De kernvereisten
- Relevante governance- en beheerpraktijken, passend bij het beoogde doel van het systeem — inclusief keuzes over dataverzameling, de herkomst van data, en eventuele aannames over wat wordt gemeten;
- Onderzoek naar mogelijke vertekeningen (bias) die de gezondheid, veiligheid of grondrechten van personen kunnen schaden, of die kunnen leiden tot discriminatie die bij wet is verboden;
- Datasets moeten relevant, voldoende representatief en, voor zover mogelijk, foutvrij en volledig zijn gezien het beoogde doel;
- Datasets moeten passende statistische eigenschappen hebben, ook — waar relevant — met betrekking tot de personen of groepen personen op wie het hoog-risico AI-systeem wordt toegepast;
- Rekening houden met kenmerken of elementen die specifiek zijn voor de geografische, gedrags-, contextuele of functionele omgeving waarin het systeem zal worden gebruikt.
Bijzondere categorieën persoonsgegevens: een uitzondering
In beginsel verbiedt de AVG het verwerken van bijzondere persoonsgegevens (zoals ras, gezondheid of seksuele geaardheid). De AI Act bevat een strikt afgebakende uitzondering: aanbieders mogen zulke gegevens uitzonderlijk verwerken, uitsluitend voor zover dit strikt noodzakelijk is om bias-detectie en -correctie bij hoog-risico AI-systemen te waarborgen, en alleen onder strenge aanvullende waarborgen — waaronder technische beperkingen op hergebruik, beveiligingsmaatregelen en verwijdering zodra de bias is gecorrigeerd of de bewaartermijn is verstreken.
Wat betekent dit voor deployers?
Deployers trainen doorgaans geen modellen zelf, maar zijn wél verplicht om de gebruiksaanwijzing van de aanbieder te volgen — inclusief eventuele beperkingen die daarin staan over de input-data waarmee het systeem in de praktijk mag worden gevoed. Gebruik je bijvoorbeeld een extern gebouwde HR-tool voor cv-screening, dan is de datakwaliteit primair de verantwoordelijkheid van de aanbieder, maar blijft zorgvuldig gebruik aan jouw kant nodig — zie ons artikel over cv-screening en sollicitatie-AI.
De officiële tekst staat in artikel 10 van Verordening (EU) 2024/1689, van toepassing sinds 2 augustus 2026.