FM Marlon Tobaben puolustaa väitöskirjaansa “Privacy in Data-Efficient Deep Learning” perjantaina 26.6.2026 klo 12 Helsingin yliopiston Physicum-rakennuksen auditoriossa E204 (Gustaf Hällströmin katu 2, 2. kerros). Vastaväittäjänä toimii Tenure Track Faculty Franziska Boenisch (CISPA Helmholtz Center for Information Security, Saksa) ja kustoksena professori Antti Honkela (Helsingin yliopisto). Väitöstilaisuus pidetään englanniksi.
Marlon Tobabenin väitöskirjatyö on osa Helsingin yliopiston tietojenkäsittelytieteen osastolla ja Trustworthy Machine Learning -ryhmässä tehtävää tutkimusta. Väitöskirjan ohjaajana on toiminut professori Antti Honkela (Helsingin yliopisto).
Tietosuoja datatehokkaassa syväoppimisessa
Koneoppimisen tavoitteena on oppia datasta, ja sitä hyödynnetään monilla aloilla. Koneoppismallien käytössä on useita riskejä, joista tässä väitöskirjassa tarkastellaan mallien opetusaineistoon sisältyvien yksilöiden tai ryhmien henkilökohtaisen tiedon paljastumista. Tarkastelemme opetusaineistoon kohdistuvia hyökkäyksiä ja niitä vastaan puolustautumista. Keskitymme datatehokkaaseen syväoppimiseen, jossa neuroverkkoja koulutetaan suhteellisen pienellä määrällä dataaa esimerkiksi siirto-oppimista käyttäen.
Käytämme jäsenyyspäättelyhyökkäyksiä (engl. membership inference attack, MIA) mittaamaan koneoppimismallien tietosuojariskiä. MIA:t pyrkivät päättelemään, onko tietty datapiste osana opetusaineistoa. Puolustuksena MIA:ia vastaan käytämme differentiaalista tietosuojaa, joka antaa formaaliin takeen. Riittävän vahva differentiaalinen tietosuoja varmistaa, että koulutettu koneoppimismalli on samankaltainen riippumatta siitä, onko tietyn yksilön tai ryhmän data osana opetusaineistoa, mikä pienentää tietosuojariskiä.
Väitöskirjan toisessa artikkelissa kehitetään kokeellinen kehys siirto-oppimiselle pienellä määrällä dataa. Kehystä käytetään ensimmäisessä ja toisessa artikkelissa. Kehys keskittyy kuvien luokitteluun esikoulutetuilla koneoppimismalleilla, joita hienosäädetään pienellä määrällä dataa, sisältäen vain pienen määrän esimerkkejä kustakin luokasta.
Ensimmäisessä artikkelissa tutkitaan, kuinka MIA:n tarkkuus muuttuu, kun opetusaineiston ominaisuudet (esimerkkien määrä per luokka ja luokkien määrä) muuttuvat. Sovitamme regressiomallin hyökkäysten tarkkuusdataan. Arvioimme differentiaalisen tietosuojan ja tarkkuuden suhteen avulla, että vahva tietosuoja vaatii pahimmassa tapauksessa äärimmäisen suuren määrän dataa jokaista luokkaa kohti.
Toisessa artikkelissa tutkitaan, kuinka pieni määrä dataa per luokka ja esiopetus- ja hienosäätöaineistojen välinen ero vaikuttavat koulutetun mallin laatuun. Lisäksi vertailemme mallin eri parametrijoukkojen hienosäätöä. Vaaditun datan määrä on yllättävän pieni, jopa vahvan differentiallisen tietosuojan alla, kun esiopetus- ja hienosäätöaineistojen välinen ero on pieni. Tämä määrä on selkeästi pienempi kuin aiemmissa tutkimuksissa tarkastellut määrät. Kun ero on suurempi, tarvitaan enemmän dataa ja ainoastaan viimeisen kerroksen hienosäätäminen ei enää riitä.
Kolmannessa artikkelissa käytämme differentiaalista tietosuojaa visuaalisia dokumentteja koskevien kysymysten vastaamiseen, jossa koneoppimismallin täytyy vastata dokumenttia koskevaan luonnollisella kielellä esitettyyn kysymykseen. Perustelemme, että myös dokumenttiaineistoja täytyy suojata niiden sisältämän yhteisen ja arkaluontoisen tiedon vuoksi, mukautamme opetusalgoritmeja tähän tarkoitukseen ja opetamme laadukkaita malleja.
Väitöskirjan saatavuus
Väitöskirjan elektroninen versio tulee olemaan saatavilla Helsingin yliopiston avoimessa julkaisuarkistossa Heldassa osoitteessa
Painettuja väitöskirjoja voi tiedustella väittelijältä itseltään: