Carte
The Algorithmic Foundations of Differential Privacy
de Cynthia Dwork, Aaron Roth · 2014 · 1 fișă de lectură
1 fișă
The Algorithmic Foundations of Differential Privacy · 2014
Zgomotul se pune pe răspuns, nu pe date, și fiecare răspuns consumă din buget.
Slăbiciunea k-anonimității e că depinde de ce altceva există în lume. Confidențialitatea diferențială schimbă întrebarea: nu „poate fi reidentificat setul?”, ci „se schimbă răspunsul la o interogare dacă o singură persoană intră sau iese din set?”. Dacă răspunsul e aproape același cu sau fără tine, nimeni nu învață nimic despre tine anume, orice ar mai ști. Mecanismul: la fiecare răspuns agregat (o sumă, o medie, un număr) se adaugă zgomot aleatoriu calibrat la cât poate mișca un singur individ rezultatul. Parametrul epsilon e bugetul: mai mic înseamnă mai multă protecție și mai puțină precizie, iar fiecare interogare consumă din el — după ce bugetul s-a terminat, nu mai răspunzi. Pentru depozit e o tehnică de ieșire, nu de stocare: datele brute rămân întregi și protejate ca în lecțiile 18–19; ce se protejează e ce pleacă spre exterior — statistici publice, rapoarte către parteneri, seturi de antrenament. Recensămintele moderne o folosesc exact așa. Costul e real și trebuie spus utilizatorilor: pe grupuri mici, zgomotul e comparabil cu semnalul.
“„Confidențialitatea diferențială” descrie o promisiune făcută de deținătorul datelor, sau curator, persoanei vizate: „Nu vei fi afectat, negativ sau altfel, dacă permiți ca datele tale să fie folosite în orice studiu sau analiză, indiferent ce alte studii, seturi de date sau surse de informație există.””