Data ja datanhallinta
Mallin koulutus- ja testidatan on oltava relevanttia ja edustavaa ja vinoumat on tunnistettava ja käsiteltävä.
Mistä tässä on kyse
Syrjivä tekoäly syntyy harvoin huonosta koodista. Se syntyy vinoutuneesta datasta. Siksi Art. 10 tekee datan laadusta lakisääteisen velvoitteen: koulutus-, validointi- ja testiaineiston on oltava relevanttia, edustavaa ja mahdollisimman virheetöntä juuri sinun käyttötarkoitukseesi, ja vinoumat on tunnistettava ja käsiteltävä dokumentoidusti. Et voi vedota siihen, ettet tiennyt, mitä datassasi oli.
Malli on korkeintaan datansa veroinen, ja 10. artikla tekee datan laadusta lakisääteisen velvoitteen. Suuririskisen järjestelmän koulutus-, validointi- ja testiaineistojen on oltava relevantteja, riittävän edustavia ja mahdollisimman virheettömiä suhteessa käyttötarkoitukseen.
Käytännössä sinun on tiedettävä ja dokumentoitava, mistä datasi tulee, miten se on kerätty ja käsitelty, ja millaisia oletuksia siihen liittyy. Erityisen tärkeää on tunnistaa ja käsitellä vinoumat, jotka voivat johtaa ihmisryhmien syrjintään. Jos käsittelet erityisiä henkilötietoryhmiä nimenomaan vinoumien havaitsemiseksi, laki sallii sen tiukoin suojatoimin.
Datavaatimukset ovat asetuksen konkreettisin ja samalla vaativin kohta, koska ne koskevat asiaa, jota harva on dokumentoinut jälkikäteen: mistä data tuli. Art. 10(2) luettelee datanhallintakäytännöt, joiden on katettava merkitykselliset suunnitteluvalinnat, datankeruuprosessit ja datan alkuperä, esikäsittely, oletusten muotoilu, datan riittävyyden arviointi sekä vinoumien tarkastelu.
Datan alkuperä on kohta, joka kaatuu useimmin. Jos koulutusaineisto on kerätty vuosien varrella eri lähteistä ilman kirjanpitoa, alkuperää ei voi rekonstruoida jälkikäteen. Käytännön suositus on aloittaa kirjanpito nyt eteenpäin ja dokumentoida historiallinen osuus rehellisesti sillä tarkkuudella kuin se on tiedossa. Arvaus, joka esitetään faktana, on pahempi kuin merkintä tiedon puuttumisesta.
Vinoumien tarkastelu ei tarkoita väitettä siitä, ettei vinoumaa ole. Se tarkoittaa, että olet etsinyt sitä: tarkastellut mahdollisia vinoumia, jotka voivat vaikuttaa terveyteen ja turvallisuuteen tai johtaa syrjintään, ja tehnyt toimet niiden havaitsemiseksi, ehkäisemiseksi ja lieventämiseksi. Tyhjä tulos on kelvollinen tulos, jos etsintä on dokumentoitu.
Art. 10(5) sisältää poikkeuksen, joka on syytä tuntea: erityisiä henkilötietoryhmiä (GDPR Art. 9) saa käsitellä nimenomaan vinoumien havaitsemiseksi ja korjaamiseksi, tiukoin ehdoin. Käsittelyn on oltava välttämätöntä, se on rajattava anonymisoituun tilastoanalyysiin, tietoja ei saa siirtää kolmansille, ne on poistettava analyysin päätyttyä ja toimenpide on dokumentoitava tekniseen dokumentaatioon.
Datajoukkojen on oltava relevantteja, riittävän edustavia ja mahdollisimman virheettömiä ja täydellisiä käyttötarkoitukseen nähden. Sana ”mahdollisimman” on tarkoituksellinen. Täydellisyyttä ei vaadita, vaan sitä, että puutteet on tunnistettu ja niiden vaikutus arvioitu.
Yleisin virhe on käsitellä Art. 10:tä datatieteen tehtävänä. Se on dokumentointitehtävä. Vaatimustenmukaisuus ei ratkea mallin laadulla. Se ratkeaa sillä, pystytkö kertomaan mistä data tuli, miten se käsiteltiin, mitä oletuksia tehtiin ja mitä vinoumia etsittiin. Toinen yleinen virhe on unohtaa, että vaatimus koskee myös validointi- ja testidataa, ei vain koulutusdataa.
Mallin laatu ei ratkaise vaatimustenmukaisuutta. Se, pystytkö kertomaan mistä data tuli, ratkaisee.
Mitä laki vaatii, kohta kohdalta
Dokumentoi mistä datasi tulee, miten se on kerätty, miten varmistat laadun ja miten käsittelet vinoumat eri ihmisryhmien välillä.
- §1Koulutus-, validointi- ja testidatasetit täyttävät laatukriteerit (kohdat 2-5)
- §2Datanhallinta- ja hallintokäytännöt (mukaan lukien suunnittelu, datankeruu, esikäsittely, tarkastus)
- §2.aMerkitykselliset suunnitteluvalinnat
- §2.bDatankeruuprosessit ja datan alkuperä; henkilötietojen osalta alkuperäinen keruutarkoitus
- §2.cDatan valmistelutoimet: annotointi, merkitseminen, puhdistus, päivitys, rikastus ja aggregointi
- §2.dOletusten muodostaminen erityisesti siitä, mitä datan on tarkoitus mitata ja edustaa
- §2.eTarvittavien datajoukkojen saatavuuden, määrän ja soveltuvuuden arviointi
- §2.fMahdollisten vinoumien tarkastelu, jotka voivat vaikuttaa terveyteen ja turvallisuuteen, loukata perusoikeuksia tai aiheuttaa syrjintää
- §2.gAsianmukaiset toimenpiteet (f)-kohdassa tunnistettujen vinoumien havaitsemiseksi, ehkäisemiseksi ja lieventämiseksi
- §2.hAsetuksen noudattamista estävien datapuutteiden tunnistaminen ja korjaaminen
- §3Datasetit ovat relevantteja, riittävän edustavia ja mahdollisuuksien mukaan (parhaalla mahdollisella tavalla) virheettömiä ja täydellisiä käyttötarkoituksensa kannalta. HUOM: asetus ei vaadi absoluuttista virheettömyyttä/täydellisyyttä vaan 'mahdollisuuksien mukaan käyttötarkoituksen kannalta' (lawyer 2026-06-03).
- §5Datan käsittely erityisin tietoryhmin (GDPR Art. 9): vain ehdoin, joissa erityishuomio bias-monitorointiin
Usein kysytyt kysymykset
pkai tuottaa tämän artiklan vaatimat asiakirjat (Tekninen dokumentaatio (liite IV), Riskienhallintasuunnitelma, Vaatimustenmukaisuuden tarkistuslista, Datanhallinnan kuvaus) yrityksesi tiedoilla, noin 20 minuutissa.
Näytä artiklan sisältö tiivistettynä
Suuririskiset järjestelmät, jotka hyödyntävät mallien kouluttamista datalla, on kehitettävä koulutus-, validointi- ja testausdatajoukoilla, jotka täyttävät 2–5 kohdan vaatimukset (1 kohta). Datajoukkoihin sovelletaan datanhallinta- ja hallinnointikäytäntöjä, jotka koskevat erityisesti (2 kohta): (a) suunnitteluvalintoja; (b) keruuprosesseja ja datan alkuperää sekä henkilötietojen alkuperäistä keruutarkoitusta; (c) valmistelutoimia (annotointi, merkitseminen, puhdistus, päivitys, rikastaminen, yhdistäminen); (d) oletusten muotoilua; (e) saatavuuden, määrän ja soveltuvuuden arviointia; (f) vinoumien tarkastelua (terveys, turvallisuus, perusoikeudet, syrjintä); (g) toimenpiteitä vinoumien havaitsemiseksi, ehkäisemiseksi ja lieventämiseksi; (h) datapuutteiden tunnistamista ja korjaamista. Datajoukkojen on oltava merkityksellisiä, riittävän edustavia ja parhaan mukaan virheettömiä ja täydellisiä käyttötarkoituksen kannalta, asianmukaisin tilastollisin ominaisuuksin (3 kohta), ja niissä on otettava huomioon käyttöympäristön maantieteelliset, kontekstuaaliset, käyttäytymiseen liittyvät ja toiminnalliset erityispiirteet (4 kohta). Erityisten henkilötietoryhmien käsittely vinoumien havaitsemiseksi ja korjaamiseksi on sallittu vain tiukoin edellytyksin (5 kohta: välttämättömyys, suojatoimet, ei siirtoa, poistaminen, dokumentointi). Järjestelmiin, jotka eivät käytä mallien kouluttamista, 2–5 kohtaa sovelletaan vain testausdatajoukkoihin (6 kohta).
Tämä on artiklan sisältö tiivistettynä, ei sanatarkka lainaus. Sitova sanamuoto on EUR-Lexin virallisessa suomennoksessa, joka on linkitetty yllä.