Datuma gvidanto klasifikanta personajn identigantojn kaj laborfluksajn datumojn antaŭ ol uzi AI-ilon.
Datuma gvidanto klasifikanta personajn identigantojn kaj laborfluksajn datumojn antaŭ ol uzi AI-ilon.

Kio estas PII?

Privateco, sekureco kaj identeco

PII signifas persone identigeblan informon (personally identifiable information). La termino estas vaste uzata en sekureca, nuba kaj usona-stila privateca lingvaĵo por priskribi informon, kiu povas identigi, distingi aŭ esti ligita al individuo. En brita kaj eŭropa datumprotekta laboro, la pli grava jura termino estas kutime personaj datumoj. Por AI-laborfluksoj, la praktika punkto estas identigi informon rilatan al identigebla persono antaŭ ol ĝi estas kopiata en ilojn, instigojn, protokolojn, datumbarojn aŭ eligojn.

Reviziita de Jackie, Head of Learning & Development, Levellers - Laste reviziita la 8-an de junio 2026

Kion tio signifas

PII signifas persone identigeblan informon. La termino estas ofta en sekurecaj politikoj, nubaj kontraktoj, teknikaj dokumentoj kaj usona-orientita privateca materialo. NIST-difinoj priskribas PII kiel informon, kiu povas distingi aŭ spuri la identecon de individuo, ĉu sola ĉu kombinita kun alia ligita aŭ ligebla informo.

Brita kaj eŭropa datumprotekta praktiko kutime centras sur "personaj datumoj", ne PII. La ICO klarigas personajn datumojn kiel informon rilatan al identigita aŭ identigebla individuo. Tio inkluzivas evidentajn identigantojn, kiel nomo kaj retpoŝtadreso, kaj malpli evidentajn identigantojn, kiel identigaj numeroj, lokaciaj datumoj, IP-adresoj, kuketaj identigantoj kaj kombinaĵoj de informo, kiuj povas identigi iun nerekte.

Por Levellers-stila AI-laboro, la plej sekura praktika aliro estas trakti PII kiel utilan sekurecan mallongigon, sed uzi personajn datumojn por UK GDPR-analizo. La demando ne estas nur "ĉu tiu ĉi kampo identigas iun memstare?" Ĝi estas ankaŭ "ĉu tiu ĉi informo povus rilati al identigebla persono en tiu ĉi laborflukso, kun tiu ĉi kunteksto kaj tiuj ĉi ligitaj rekordoj?"

Kial tio gravas

AI igas terminologian disciplinon pli grava, ĉar informo moviĝas rapide inter dokumentoj, instigoj, datumbazoj, retrovo-indeksoj kaj eligoj. Nomo en kalkultabelo estas facile rimarkebla. Kliento-referenco enkonstruita en transskribaĵo, subtena resumo, lokacia spuro, aparata identiganto aŭ libera teksta noto povas esti malpli evidenta.

Se dungitoj pensas, ke PII signifas nur rektajn identigantojn kiel pasportojn aŭ bankkontajn numerojn, ili eble algluas personajn datumojn en ilojn sen rekoni tion. Se gvidantoj traktas ĉiun datumpunkton kiel egale senteman, ili eble blokos utilajn malalt-riskajn laborfluksojn. La celo estas klasifiki datumojn sufiĉe klare por apliki proporciajn kontrolojn.

Bona klasifikado helpas pri datuma minimumigo, DSARoj, ROPA, vendista revizio kaj sekureca dezajno. Ĝi ankaŭ helpas teamojn kompreni, kiam anonimigo estas reala kaj kiam datumoj estas nur pseŭdonimigataj aŭ maskataj.

Kiel tio funkcias

Praktika klasifika modelo devus apartigi rektajn identigantojn, nerektajn identigantojn, senteman kuntekston kaj ligitajn rekordojn. Rektaj identigantoj inkluzivas nomojn, retpoŝtadresojn, telefonajn numerojn, naciajn identigantojn, kontajn numerojn kaj biometriajn rekordojn. Nerektaj identigantoj inkluzivas kombinaĵojn kiel labortitolo plus dunganto plus loko, aŭ okazaĵaj datumoj, kiuj povas esti rekonektitaj al individuo.

La ICO-gvidado pri personaj datumoj emfazas kuntekston. La sama informo povas esti personaj datumoj por unu kontrolisto kaj ne por alia, depende de tio, ĉu ĝi rilatas al identigebla individuo kaj kia alia informo estas reaĉetebla. Pseŭdonimigataj datumoj restas personaj datumoj, se ili povas esti atribuitaj al persono per aldona informo. Vere anonimaj datumoj estas ekster la UK GDPR, sed la anonimigo devas esti reala.

En AI-laborfluksoj, klasifikado devus okazi antaŭ ol datumoj estas uzataj. Teamoj devus demandi, kiaj personaj datumoj estas necesaj, ĉu ili povas esti forigitaj, ĝeneraligitaj, maskataj, konservataj loke aŭ anstataŭigitaj per sintezaj ekzemploj, kaj ĉu la AI-vendisto konservos aŭ uzos la datumojn por aliaj celoj.

Bona AI-datuma klasifika procezo devus ankaŭ konsideri, kie la datumoj aperas post la komenca uzo. Personaj datumoj povas moviĝi en instig-historion, kaŝmemoron, vektordatumbazojn, eksportojn, revizioprotokojn, ekrankopiojn kaj generitajn skizojn. Kampo povas esti forigita el la instigilo, sed ankoraŭ resti en la fonta dokumento aŭ retrovo-indekso. Teamoj do devus klasifiki la laborflukson, ne nur la ununuran tekstan skatolon, kiun la uzanto vidas.

Ekzemploj

Subtena bileto enhavas klientan nomon, adreson, plenddetalon kaj mendnumeron. La nomo kaj adreso estas evidentaj identigantoj, sed la plendteksto ankaŭ povas esti personaj datumoj, ĉar ĝi rilatas al la kliento. Se la bileto estas resumita de AI, la resumo ankaŭ povas enhavi personajn datumojn.

Venda operacia teamo eksportas CRM-notojn por gvid-taksado. Individuaj nomoj, retpoŝtoj kaj telefonaj numeroj estas rektaj identigantoj. Labortitoloj, kompanionomboj, teritorioj, interaga historio kaj taksadaj etikedoj ankaŭ povas rilati al identigenblaj kontaktoj en kunteksto.

Produkta teamo uzas vokajn transskribaĵojn por trovi oftajn problemojn. Se transskribaĵoj inkluzivas nomojn, voĉojn, kontajn detalojn aŭ unikajn cirkonstancojn, ili devus esti traktataj kiel personaj datumoj, krom se ili estas ĝuste anonimigitaj. Maskado de nomoj sole eble ne sufiĉas, se la restanta rakonto identigas la personon.

Interna serĉa asistanto indeksas politikajn dokumentojn kaj HR-gvidadon. La dokumentoj povas aspekti ĝenerikaj, sed enkonstruitaj ekzemploj, disciplinaj rekordoj, malsatnotiĉoj aŭ nomitaj aprobo povas krei personan datuman eksponiĝon ene de la retrovo-sistemo.

Oftaj miskomprenoj

  • PII kaj personaj datumoj estas identaj terminoj. Ili interkovras, sed ili ne ĉiam estas uzataj sammaniere. UK GDPR-analizo devus normale uzi la terminon personaj datumoj.

  • Nur nomoj kaj retpoŝtadresoj gravas. Nerektaj identigantoj, interretaj identigantoj, lokaciaj datumoj kaj ligitaj rekordoj ankaŭ povas identigi personojn.

  • Pseŭdonimigataj datumoj estas anonimaj. Ili ne estas. La ICO diras, ke pseŭdonimigataj datumoj restas personaj datumoj laŭ UK GDPR.

  • Libera teksto estas malalt-riska, ĉar ĝi ne havas fiksitajn kampojn. Libera teksto povas enhavi nomojn, sandetalojn, plendojn, opiniojn, adresojn, referencnumerojn kaj aliajn personajn datumojn.

  • AI-redaktado estas ĉiam fidinda. Aŭtomata detekto povas helpi, sed ĝi povas preteriri kuntekston, nekutimajn nomojn, kombinitajn identigantojn kaj datumojn enkonstruitajn en dokumentojn aŭ bildojn.

Riskoj kaj limoj

La ĉefa risko estas sub-klasifikado. Se teamoj etikedas nur mallarĝan aron da kampoj kiel PII, ili eble lasas personajn datumojn en instigoj, eksportoj, protokoloj kaj trejnaj ekzemploj. La dua risko estas falsa anonimigo. Forigi evidentajn identigantojn eble ne sufiĉas, se la restantaj datumoj ankoraŭ povas identigi la personon per kunteksto aŭ ligado.

Ekzistas ankaŭ limo inter privateca kaj sekureca lingvaĵo. Sekurecaj teamoj ofte uzas PII por decidi pri traktaj kontroloj. Datumprotektaj teamoj devas decidi, ĉu UK GDPR aplikiĝas, kia laŭleĝa bazo estas uzata, kiaj rajtoj aplikiĝas kaj ĉu aldona protekto estas necesa. La du vidpunktoj devus subteni unu la alian anstataŭ konkuri.

Por sentema aŭ alt-efika laborfluksoj, klasifikado ne devus esti lasita al uzantoj konjektantaj ĉe la punkto de instig-enigo. Uzu aprobitajn datumkategoriojn, ekzemplojn, ilajn restriktojn kaj reviziajn paŝojn. Tiu ĉi artikolo ne estas jura konsilo kaj ne anstataŭas datumprotektan takson.

Alia risko estas trakti PII-detektadon kiel pure teknikan aferon. Aŭtomataj redaktaj iloj estas utilaj, sed ili povas malfacile trakti lokajn formatojn, nekutimajn nomojn, kuntekston, bildojn, manskribaĵojn kaj kombinaĵojn de faktoj, kiuj identigas iun nur al personoj ene de la organizo. Homa revizio kaj laborfluksaj limoj ankoraŭ estas necesaj, kie la konsekvencoj de eksponiĝo estas gravaj.

Kion fari poste

Kreu mallongan datumklasifikan gvidiston por AI-uzo. Inkluzivas ekzemplojn de rektaj identigantoj, nerektaj identigantoj, specialkategoriaj datumoj, konfidencaj komercaj datumoj kaj datumoj, kiuj neniam devus esti enigataj en neaprobitan ilojn. Faru la ekzemplojn specifaj al viaj laborfluksoj, ne ĝenerika privateca trejnado.

Poste aldonu kontrolojn ĉe la punktoj, kie datumoj moviĝas. Por instigoj, uzu regulojn kaj ŝablonojn. Por alŝutoj, uzu aprobitajn lokojn kaj redaktajn paŝojn. Por RAG aŭ serĉo, reviziu, kio estas indeksita kaj kiu povas retrovi ĝin. Por vendistoj, kontrolu la DPA kaj konservadajn agordojn. La celo estas redukti nenecesajn personajn datumojn antaŭ ol ili eniras la AI-laborflukson.

Aldonu ekzemplojn al la AI-politiko, kiujn homoj povas tuj rekoni. Ekzemple: ne algluu plenajn klientajn plendojn en malfermitajn ilojn; forigu nomojn kaj kontajn referencojn antaŭ ol peti vortigan helpon; ne alŝutu HR-dosierojn, krom se la ilo kaj laborflukso estas aprobitaj; traktu transskribaĵojn kiel personajn datumojn ĝis reviziitaj. Klaraj ekzemploj reduktas dependon de dungitoj interpretantaj abstraktan privatan lingvaĵon sub premo.

Por gvidantoj, la utila kutimo estas peti konkretajn ekzemplojn de ĉiu teamo. Kiaj personaj datumoj aperas en vendaj notoj, plendoj, transskribaĵoj, fakturoj, HR-rekordoj kaj ekrankopioj? Kiuj ekzemploj estas sekuraj por AI-ilo, kiuj bezonas maskadon, kaj kiuj devus resti ekster tute? Tio transformas klasifikadon en praktikan operacian regulon anstataŭ teoria difino.

Ĉu vi havas demandon aŭ sugeston, aŭ volas kompreni, kiel ni esploras kaj reviziis tiujn ĉi gvidistojn? Legu pri niaj redakciaj normoj kaj kiel kontakti nin.

Oftaj demandoj

Ĉu PII estas UK GDPR-termino?

Kutime ne. UK GDPR kaj ICO-gvidado fokusiĝas sur personaj datumoj. PII restas utila kiel sekureca kaj teknika mallongigo, sed ĝi ne devus anstataŭi UK-personan datuman analizon.

Ĉu retpoŝtadreso estas PII?

Kutime jes, se ĝi identigas aŭ povas esti ligita al individuo. Ĝi ankaŭ povas esti personaj datumoj laŭ UK GDPR, se ĝi rilatas al identigita aŭ identigebla persono.

Ĉu IP-adreso estas personaj datumoj?

Ĝi povas esti. La ICO inkluzivas interretajn identigantojn kiel IP-adresojn kaj kuketajn identigantojn kiel eblajn personajn datumojn, depende de kunteksto.

Ĉu maskataj datumoj estas sekuraj por uzi en AI-iloj?

Tio dependas de la kvalito de maskado kaj la restanta kunteksto. Pseŭdonimigataj aŭ redaktitaj datumoj ankoraŭ povas esti personaj datumoj, se personoj restas identigenblaj.

Kio estas la plej bona unua kontrolo?

Haltu nenecesajn personajn datumojn eniri la laborflukson. Datuma minimumigo estas kutime pli fidinda ol provi purigi ĉion post kiam ĝi disvastiĝis tra iloj, protokoloj kaj eligoj.