Ako Danum pracuje s anonymizovanými výsledkami rozborov vody

Výsledky laboratórnych rozborov môžu ukázať, aké problémy sa vo vzorkách vody opakujú, ako sa líšia medzi obdobiami alebo regiónmi a ktoré ukazovatele si zaslúžia bližšiu pozornosť. Samotné množstvo výsledkov však ešte nevytvára spoľahlivú štatistiku.
Pri dátových článkoch preto Danum používa vopred definovaný postup pre anonymizáciu, kontrolu, zoskupovanie a interpretáciu údajov. Cieľom je chrániť súkromie zákazníkov a zároveň jasne oddeliť to, čo dáta skutočne ukazujú, od toho, čo z nich nemožno spoľahlivo vyvodiť.
Táto stránka opisuje metodický rámec. Neanalyzuje konkrétny súbor vzoriek, preto tu zámerne neuvádzame počet vzoriek, sledované obdobie ani regionálne výsledky. Tieto informácie budú uvedené samostatne pri každej konkrétnej dátovej analýze.
Čo považujeme za anonymizované údaje
Odstránenie mena, telefónneho čísla alebo presnej adresy samo osebe nemusí stačiť na to, aby údaje prestali byť identifikovateľné.
Pri posudzovaní anonymizácie je potrebné zohľadniť aj kombinácie ďalších informácií. Napríklad veľmi presná lokalita, dátum odberu, neobvyklý výsledok a ďalšie technické údaje by v malej skupine mohli spoločne uľahčiť identifikáciu konkrétneho prípadu.
GDPR rozlišuje medzi anonymnými a pseudonymizovanými údajmi. Ak možno informáciu pomocou ďalších dostupných údajov opätovne priradiť ku konkrétnej osobe, nejde len vďaka odstráneniu mena automaticky o anonymné údaje. Aktuálne usmernenie EDPB pri hodnotení anonymizácie sleduje okrem iného možnosť izolovať jednotlivý záznam, prepájať ho s ďalšími údajmi alebo z kombinácie údajov odvodiť identitu.
Pre verejné dátové články preto uplatňujeme princíp: zverejniť iba takú podrobnosť, ktorá je potrebná na odborné vysvetlenie výsledku a zároveň neumožňuje neprimerane priblížiť sa ku konkrétnemu zákazníkovi alebo odbernému miestu.
Aké údaje sa pred analýzou kontrolujú
Pred zaradením výsledkov do dátovej analýzy nestačí spojiť laboratórne protokoly do jednej tabuľky. Najprv treba overiť, či jednotlivé záznamy možno zmysluplne porovnávať.
Pri každom dátovom projekte preto podľa dostupnosti kontrolujeme najmä:
- zdroj vody,
- dátum alebo obdobie odberu,
- miesto odberu v potrebnej miere podrobnosti,
- či ide o surovú alebo už upravenú vodu,
- rozsah vykonaného rozboru,
- jednotky jednotlivých ukazovateľov,
- laboratórny zápis výsledku,
- prípadné opakované alebo kontrolné vzorky,
- chýbajúce hodnoty,
- údaje potrebné na odlíšenie rôznych typov vzoriek.
Výsledok pod limitom detekcie alebo kvantifikácie sa napríklad nesmie svojvoľne premeniť na absolútnu nulu. Rovnako nemožno bez kontroly zlúčiť hodnoty, ktoré boli uvedené v rozdielnych jednotkách.
Jedna vzorka nie je automaticky jeden zákazník ani jedna studňa
Pri dátovej analýze musí byť vopred určené, čo predstavuje jeden záznam a čo sa vlastne počíta.
Jeden zákazník môže mať viac vzoriek. Z jednej studne môže byť voda analyzovaná pred úpravou aj po nej. Rovnaký zdroj môže byť skúšaný opakovane v rôznych obdobiach alebo po servisnom zásahu.
Ak by sa všetky tieto výsledky bez rozlíšenia počítali ako samostatné nezávislé studne, výsledok by mohol byť zavádzajúci.
Preto pri každej budúcej analýze uvedieme, či je základnou jednotkou napríklad:
- laboratórna vzorka,
- jedinečný vodný zdroj,
- odberné miesto,
- zákaznícky prípad,
- alebo inak definovaná jednotka.
Ak sú opakované výsledky použité na sledovanie vývoja, budú ako opakované merania aj označené.
Ako pracujeme s duplicitami a opakovanými rozbormi
Kontrolný rozbor po úprave vody nemá rovnaký význam ako prvý rozbor surovej vody. Podobne nie je vhodné bez vysvetlenia spojiť vstupnú a výstupnú vzorku toho istého zariadenia.
Pred analýzou preto určujeme pravidlá pre:
Duplicity – technicky alebo administratívne opakované záznamy sa nemajú započítať viackrát.
Opakované vzorky – ak ide o reálne nové meranie toho istého zdroja, môže zostať súčasťou dát, ale musí byť zohľadnené pri interpretácii.
Kontrolné rozbory – výsledky po realizácii alebo servise sa od vstupných vzoriek oddeľujú, pokiaľ je cieľom analýzy opis neupravenej vody.
Neúplné záznamy – vzorka môže byť použiteľná pre jeden ukazovateľ a nepoužiteľná pre iný. Preto sa počet hodnotených vzoriek môže medzi jednotlivými parametrami líšiť.
Ako chránime lokalitu odberu
Geografická informácia je pri kvalite vody užitočná, pretože umožňuje hľadať regionálne rozdiely. Zároveň môže byť v kombinácii s inými údajmi identifikačná.
Preto neplatí pravidlo, že každú vzorku automaticky zverejníme podľa obce alebo presnej polohy.
Podľa veľkosti a charakteru dát môžeme výsledky:
- zoskupiť podľa okresu alebo kraja,
- spojiť do väčšej geografickej oblasti,
- nezverejniť samostatne pre malú skupinu,
- alebo geografické členenie úplne vynechať.
Rozhodujúce nie je iba to, či sme odstránili adresu, ale aj to, či kombinácia publikovaných údajov neumožňuje konkrétny prípad neprimerane ľahko odlíšiť od ostatných.
Prečo zákaznícke rozbory nereprezentujú automaticky Slovensko
Vzorky, ktoré má Danum k dispozícii, nevznikajú náhodným výberom všetkých studní alebo domácností na Slovensku. Ľudia si rozbor často objednávajú práve preto, že riešia konkrétny problém, potrebujú kolaudáciu, plánujú úpravu vody alebo chcú preveriť vlastný zdroj.
Takýto výber môže byť systematicky odlišný od všetkých studní alebo domácností v krajine.
Pri nepravdepodobnostnom výbere preto nemožno reprezentatívnosť predpokladať automaticky. Eurostat pri takýchto dátach odporúča osobitne posúdiť reprezentatívnosť a riziko výberového skreslenia.
Preto budeme formulovať výsledky napríklad takto:
„V analyzovanom súbore vzoriek Danum sa…“
nie:
„V slovenských studniach sa…“
pokiaľ by na takýto celoslovenský záver neexistoval zodpovedajúci výber a metodický podklad.
Tento princíp je súčasťou stratégie dátového bloku Centra znalostí už od jeho návrhu: zákaznícke vzorky nemajú byť automaticky vydávané za reprezentatívnu populačnú vzorku.
Čo uvedieme pri každej dátovej analýze
Aby bolo možné výsledok správne interpretovať, každý dátový článok Danum má obsahovať minimálne:
Obdobie
Z akého časového úseku údaje pochádzajú.
Počet vzoriek alebo prípadov
A zároveň vysvetlenie, čo tento počet predstavuje.
Geografické pokrytie
Z ktorých oblastí pochádzajú údaje a aká úroveň lokality sa používa.
Spôsob výberu
Ako sa výsledky dostali do analyzovaného súboru.
Kritériá zaradenia a vyradenia
Napríklad ktoré typy zdrojov alebo rozborov boli použité.
Rozsah dostupných parametrov
Nie všetky vzorky musia mať analyzované rovnaké ukazovatele.
Spôsob práce s opakovanými výsledkami
Aby jedna často kontrolovaná studňa nebola nesprávne interpretovaná ako viacero nezávislých zdrojov.
Limity reprezentatívnosti
Čo výsledky opisujú a na akú širšiu populáciu ich nemožno automaticky preniesť.
Pravidlá anonymizácie
V takej miere, aby bolo zrozumiteľné, ako chránime súkromie bez zverejňovania detailov, ktoré by ochranu oslabili.
Takúto transparentnosť vyžaduje aj interný publikačný checklist Danum pre prácu s vlastnými dátami.
Ako budeme prezentovať výsledky
Pri dátach uprednostníme také ukazovatele, ktorým možno rozumieť bez štatistického vzdelania.
Podľa charakteru dát môže ísť napríklad o počet analyzovaných vzoriek, podiel výsledkov spĺňajúcich vopred definované kritérium, medián, rozsah hodnôt alebo rozdelenie do intervalov.
Vždy však musí byť jasné:
- aký parameter sa hodnotí,
- v akej jednotke,
- aký počet platných výsledkov bol použitý,
- čo presne znamená uvádzané percento,
- a či ide o opis dátového súboru alebo o širší odhad.
Ak je skupina príliš malá alebo by jej publikovanie zvyšovalo riziko identifikácie, výsledok sa môže spojiť s väčšou skupinou alebo nezverejniť.
Laboratórne výsledky nemusia byť vždy priamo porovnateľné
Dlhodobé dátové súbory môžu obsahovať výsledky z rozdielnych období, rozsahov rozborov alebo analytických postupov.
Pred spoločným vyhodnotením preto treba overiť, či:
- je hodnotený rovnaký ukazovateľ,
- používajú sa kompatibilné jednotky,
- laboratórny zápis umožňuje porovnanie,
- zmena analytickej metódy nemení význam výsledku,
- a údaje majú dostatočnú kvalitu pre danú otázku.
Ak tieto podmienky nie sú splnené, výsledky sa nemajú spájať len preto, aby vznikol väčší počet vzoriek.
Čo z dát Danum možno vyvodiť
Pri dostatočne kvalitnom súbore možno napríklad opísať:
- ktoré problémy sa medzi analyzovanými vzorkami vyskytovali,
- ako boli výsledky rozdelené v konkrétnom súbore,
- ako sa výsledky líšili medzi definovanými skupinami,
- ktoré parametre boli v dostupných rozboroch často predmetom kontroly,
- alebo ako sa pri dokumentovaných prípadoch zmenil konkrétny parameter pred a po zásahu.
Tieto výsledky môžu byť užitočným praktickým obrazom dát, s ktorými Danum reálne pracuje.
Čo z nich nemožno automaticky vyvodiť
Bez zodpovedajúceho dizajnu dát nemožno tvrdiť napríklad:
- aké percento všetkých studní na Slovensku má konkrétny problém,
- že jeden región má všeobecne horšiu vodu než iný,
- že určitý výsledok spôsobuje konkrétna geologická alebo ľudská príčina,
- že technológia je účinná iba preto, že sa po jej použití zmenil jeden parameter,
- alebo že pozorovaná súvislosť dokazuje príčinu.
Dátová analýza má odpovedať iba na otázky, ktoré dostupné údaje dokážu uniesť.
Metodika sa môže ďalej vyvíjať
Rastúci počet výsledkov, nové typy rozborov alebo zmena právneho a metodického rámca môžu vyžadovať úpravu pravidiel.
Pri významnej zmene metodiky preto uvedieme, čo sa zmenilo a od ktorej verzie. Staršie výsledky nebudeme spätne prezentovať ako priamo porovnateľné, ak sa zásadne zmenil spôsob výberu alebo spracovania dát.
V oblasti anonymizácie sledujeme aj aktuálne európske metodické usmernenia. K dátumu kontroly tohto článku sú Guidelines 02/2026 Európskeho výboru pre ochranu údajov stále vo fáze verejnej konzultácie, preto ich nepovažujeme za finálny metodický dokument.
Základné pravidlo našich dátových článkov
Čím zaujímavejšie číslo vyzerá, tým dôležitejšie je vysvetliť, z akých údajov vzniklo a čo presne znamená.
Pri dátach Danum preto uprednostňujeme transparentný opis vzorky a jej obmedzení pred silným záverom, ktorý dostupné výsledky nedokážu spoľahlivo podporiť.
Danum s.r.o.