Skip to content

Isikuandmete kraapimine tehisintellekti jaoks: mida nõuab isikuandmete kaitse üldmäärus

Lühidalt: Tehisintellekti treenimiseks tehtav veebikraapimine hõlmab sageli isikuandmeid ning sellele kohaldub avaliku kättesaadavuse kiuste täielikult isikuandmete kaitse üldmäärus.

Kui generatiivsete tehisintellektisüsteemide treeningandmeid kogutakse internetist kraapimise teel, satub nende hulka regulaarselt ka isikuandmeid. Isikuandmete kaitse üldmäärus seab sellisele tegevusele selged piirid, millest tehisintellektisüsteemide pakkujad ja kasutuselevõtjad peavad kinni pidama.

Veebikraapimine tähendab sisu automatiseeritud väljalugemist avalikult kättesaadavatelt veebilehtedelt, foorumitest, sotsiaalvõrgustikest ja teistest veebiallikatest. Generatiivsed tehisintellektimudelid vajavad treenimiseks suures koguses andmeid, mida sageli hangitakse just sel viisil. Kuna internetis on lisaks puhtalt faktilisele infole vabalt kättesaadavad ka nimed, fotod, kontaktandmed, arvamusavaldused ja muu isikuandmete alla kuuluv teave, satub see kraapimise käigus paratamatult andmehulka. Asjaolu, et andmed on avalikult vaadatavad, ei muuda midagi selles, et nende töötlemisele kohaldub isikuandmete kaitse üldmäärus.

Vastutavatel töötlejatel, kes kasutavad tehisintellektisüsteeme või tellivad nende arendust, tekib sellest tulenevalt kohustus kontrollida vastavust mitmele andmekaitsealasele põhimõttele. Esmalt on vaja isikuandmete kaitse üldmääruse artikli 6 kohast õiguslikku alust kraabitud isikuandmete töötlemiseks, kusjuures alusena kasutatakse sageli õigustatud huvi, mis eeldab aga huvide kaalumist andmesubjektide õigustega. Lisaks tulevad mängu eesmärgipärasuse, andmete minimeerimise ja läbipaistvuse põhimõtted, mida on suurte, struktureerimata internetist kogutud andmemahtude puhul eriti raske täita, kuna andmesubjektid ei tea reeglina, et nende andmeid kasutatakse tehisintellekti treenimiseks.

Ettevõtete vastavuskontrolli eest vastutavatele isikutele, kes kasutavad generatiivseid tehisintellekti rakendusi või treenivad omaenda mudeleid, tähendab see, et pakkujate treeningandmete päritolu ja õiguspärasus tuleb jälgitavalt dokumenteerida ja kontrollida. Selle juurde kuulub ka selgitamine, kuidas saab andmesubjektide õigusi, nagu õigus tutvuda andmetega, õigus andmete kustutamisele või õigus esitada vastuväiteid, tehniliselt ja organisatsiooniliselt rakendada kraabitud ja mudelisse jõudnud andmete suhtes, kuna üksikute andmestike hilisem eemaldamine juba treenitud mudelist on praktikas pea võimatu. Tehisintellektisüsteemide hankimisel või edasiarendamisel peaksid ettevõtted seetõttu nõudma pakkujatelt lepingulisi kinnitusi andmete õiguspärase hankimise kohta ning dokumenteerima selle andmekaitsealase mõjuhinnangu raames.


Allikas: www.computerweekly.com · Avaldatud 19. augustil 2026
Lumi AI News — tehisintellekti abil kureeritud vastavalt tehisintellektimääruse artiklile 50. Parafraseerimine ja klassifitseerimine Lumi News Pipeline v1.8.3 abil.

Share on: