Skip to main content

Hur kan språkdata skyddas utan att förlora sitt värde?

Hur kan personuppgifter i språkdata skyddas samtidigt som materialet förblir användbart för forskning? Den frågan står i centrum för ett kommande temanummer av den vetenskapliga tidskriften Language Resources and Evaluation. Nu välkomnar projektet Mormor Karl forskare att skicka in bidrag om tekniska lösningar för effektiv och etiskt ansvarsfull avidentifiering av språkdata.

Behovet av att skydda personuppgifter har blivit allt viktigare när språkdata samlas in, bearbetas och delas. Manuell avidentifiering är både tidskrävande och kostsamt och därför utvecklas automatiska metoder för att identifiera och ersätta personuppgifter. 

Metoderna innebär dock olika möjligheter och utmaningar. Regelbaserade system kan behandla data lokalt och därmed minska risken för att känsliga uppgifter sprids, men har begränsade möjligheter att förstå semantisk kontext och omvärldskunskap. Stora språkmodeller kan i högre grad ta hänsyn till sådana sammanhang, men väcker samtidigt frågor om dataläckage, miljöpåverkan och sociala och könsrelaterade bias. 

Temanumret, Preserving the Privacy of Language Data: Emerging Technologies, Evolving Standards and Beyond kommer att behandla flera aspekter av hur teknik kan användas för effektiv och etiskt ansvarsfull avidentifiering av språkdata. 

Läs mer.