Sandbox identifikátoru
Jak by fungoval identifikátor věci nesený celým řízením a pseudonymní identifikátor osoby? A jak moc se statistika pokazí bez nich? Zkoušíme to na vymyšleném světě, kde známe pravdu.
Syntetická data. Všechny osoby, věci i čísla na této stránce vyrobil generátor. Žádný záznam neodpovídá skutečné osobě ani věci. Výsledky ukazují chování modelu při zvolených předpokladech, ne stav českých evidencí.
Tok dat
Základem je oddělení rolí: kdo zná identitu, nevidí události, a kdo počítá statistiky, nevidí identitu.
Čtyři identifikátory
| Co označuje | Kdo ho přidělí | Ukázka ze sandboxu |
|---|---|---|
| Skutek (IDS) | policie při prvním zápisu | CZS-01A7X49VC0YHSKNRHH4B1S9HTSZ |
| Věc, spis (IDV) | policie; při vyloučení věci vzniká nové | CZV-01A7X49VC0A9WSXF4B6AKJB6BY2 |
| Obvinění = osoba × skutek (IDO) | policie; jednotka, na které se měří atrice | CZO-01A7X49VC05A0BMRK3699TEJB6F |
| Osoba (P_ID) | propojovací jednotka; náhodný, nejde z něj nic odvodit | CZP-… |
Identifikátory nenesou žádný význam (útvar, rok, kvalifikaci) a končí kontrolním znakem, který odhalí překlep. Fiktivní rodná čísla v sandboxu, například 7114157193, mají měsíc 13–20. Takový měsíc skutečná rodná čísla nepoužívají, takže se s žádným skutečným člověkem nemohou shodovat.
Vymyšlený svět
- Osob
- 49 813
- Obvinění
- 185 943osoba × skutek, 2016–2025
- Skutků
- 379 407z toho 171 134 se zjištěným pachatelem
- Záznamů osob v evidencích
- 281 884v šesti systémech
Každý ze šesti systémů si vede vlastní evidenci osob a ne vždy pozná, že člověka už eviduje. Proto je záznamů několikanásobně víc než lidí. Při zápisu vznikají chyby: překlep ve jméně (7 801×), chybějící rodné číslo (5 178×), posunuté datum narození (3 545×), přehozené jméno a příjmení (2 100×), jiné příjmení (alias) (2 031×), chybné rodné číslo (778×). Rodné číslo chybí u 50 007 záznamů, hlavně u cizinců.
Jak je svět nakalibrovaný na trychtýř
| Ukazatel | Cíl | V sandboxu | Odkud je cíl |
|---|---|---|---|
| Podíl standardního přípravného řízení | 44,4 % | 44,5 % | trychtýř 2024 |
| Obžaloba z vyřízených ve vyšetřování | 85,5 % | 85,5 % | trychtýř 2024 |
| Návrh na potrestání z vyřízených ve zkráceném řízení | 87,7 % | 87,8 % | trychtýř 2024 |
| Odklony ve vyšetřování (podmíněné zastavení, narovnání) | 8,2 % | 8,1 % | trychtýř 2024 |
| Odsouzení z osob postavených před soud | 73,2 % | 73,4 % | trychtýř 2024 |
| Nepodmíněný trest z odsouzených | 18,8 % | 18,7 % | trychtýř 2024 |
| Recidivisté mezi odsouzenými | 66,7 % | 66,5 % | docs/SPEC.md (předpoklad) |
| Cizinci bez rodného čísla | 14,0 % | 13,7 % | docs/SPEC.md (předpoklad) |
Záznamy podle systémů: Policie 72 539, Státní zastupitelství 60 009, Soudy 88 195, Rejstřík trestů 38 196, Probační a mediační služba 9 419, Vězeňská služba 13 526.
Jak přesně jde složit osoby
Úkol: z 281 884 záznamů poznat, které patří témuž člověku. Přesnost říká, kolik spojených dvojic záznamů opravdu patří k sobě. Úplnost říká, kolik dvojic, které k sobě patří, se podařilo najít.
| Způsob propojení | Přesnost | Úplnost | Osob složených správně | Slitých „osob“ |
|---|---|---|---|---|
| Bez propojení Každý záznam v každé evidenci je „jiný člověk“. | 100,0 % | 0,0 % | 2,9 % | 0 |
| Jen slabé identifikátory Stejný rok narození, pohlaví, iniciály a znění příjmení. Odstrašující příklad. | 43,3 % | 95,5 % | 41,8 % | 8 896 |
| (a) Pseudonym rodného čísla Deterministicky: stejný HMAC rodného čísla, u osob bez RČ HMAC identity. | 99,8 % | 94,7 % | 91,9 % | 74 |
| (b) Pseudonymy + Splink, práh 0,5 Navíc pravděpodobnostní propojení podle částečných shod. | 99,7 % | 96,8 % | 94,8 % | 124 |
| (b) Pseudonymy + Splink, práh 0,9 Navíc pravděpodobnostní propojení podle částečných shod. | 99,7 % | 96,4 % | 93,6 % | 110 |
| (b) Pseudonymy + Splink, práh 0,99 Navíc pravděpodobnostní propojení podle částečných shod. | 99,8 % | 95,0 % | 92,1 % | 86 |
Pseudonym rodného čísla sám složí správně 91,9 % osob a skoro se nemýlí. Selhává tam, kde rodné číslo chybí nebo je špatně: u cizinců, aliasů a překlepů. Splink z částečných shod dohledá část zbytku (93,6 % osob) za cenu o něco většího počtu omylů. Slabé identifikátory samy nestačí: najdou skoro všechno, ale slijí i 8 896 skupin cizích lidí.
Srovnání se skutečným provozem. Ministerstvo spravedlnosti Anglie a Walesu při měření prokázané recidivy páruje záznamy pachatelů s policejní evidencí ve 13 po sobě jdoucích krocích, mimo jiné podle jména, pohlaví a data narození. U kohorty z konce roku 2016 se podařilo spárovat přes 90 % pachatelů; se staršími zdroji dat to v letech 2000 až 2012 bylo 50 až 90 %. Ministerstvo samo uvádí, že důkladně nezkoumalo, zda se nespárovaní pachatelé systematicky neliší od spárovaných.
Není to stejná míra jako naše úplnost: oni počítají spárované osoby, my dvojice záznamů, a jde o jiné evidence. Řádově ale sedí, že propojení bez společného čísla část záznamů ztrácí. Zdroj: Ministry of Justice (UK), Guide to proven reoffending statistics (říjen 2023), s. 22–23.
Jak moc výsledek závisí na kvalitě evidencí a podílu cizinců, si můžete vyzkoušet níže.
Co chyby propojení udělají s recidivou
Otázka: kolik odsouzených je do 2 let odsouzeno znovu? Měříme to ze soudních záznamů, které nemají společnou evidenci osob. Nepropojené záznamy recidivu podhodnocují, falešné shody ji nadsazují.
Proč nestačí identifikátor osoby: atrice potřebuje ID věci
Otázka: jaká část obvinění skončí odsouzením? V sandboxu je to 64,6 % (z 130 525 obvinění zahájených nejpozději tři roky před koncem období).
- S identifikátorem neseným celým řízením stačí záznam policie a rejstříku trestů spojit. Vyjde 62,6 %. Rozdíl proti skutečnosti dělá jen 3 511 věcí, jejichž výsledek se do evidencí nedostal (3,1 % rozhodnutých). Identifikátor bez povinnosti hlásit výsledek nestačí.
- Bez něj zbývá hádat: rozsudek přiřadit některému dřívějšímu obvinění téže osoby. I kdyby osoby byly propojené dokonale, trefí se takové párování správně jen u 47,9 % rozsudků (při párování podle obvyklé délky řízení) nebo u 34,2 % (při párování od nejstaršího obvinění). Lidé s více věcmi se nedají rozplést.
| Jak se páruje obvinění s rozsudkem | Vyjde podíl odsouzených | Správně spárovaných rozsudků |
|---|---|---|
| Skutečnost | 64,6 % | – |
| (c) S ID obvinění | 62,6 % | 100,0 % |
| Bez ID věci, osoby podle (b), od nejstaršího obvinění | 65,4 % | 34,1 % |
| Bez ID věci, osoby podle (b), podle obvyklé délky řízení | 61,1 % | 47,4 % |
| Bez ID věci, osoby propojené dokonale, podle obvyklé délky řízení | 61,9 % | 47,9 % |
Souhrnný podíl může bez ID věci vyjít blízko skutečnosti, protože se omyly navzájem vyruší. Jakmile ale chcete vědět, jak dopadla konkrétní skupina věcí (určitý druh kriminality, určitý rok), špatně složené řetězce se projeví naplno.
Vyzkoušejte: horší evidence, víc cizinců
Četnost chyb ve skutečných evidencích neznáme a podíl osob bez rodného čísla se může lišit. Posuvníky přepínají mezi 25 předem spočítanými běhy sandboxu. Každý běh je menší svět (20 000 osob), proto se čísla při výchozím nastavení mírně liší od hlavního běhu výše.
Jak přesně se složí osoby
| Způsob propojení | Přesnost | Úplnost | Osob složených správně |
|---|---|---|---|
| Jen slabé identifikátory | 64,9 % | 95,3 % | 57,0 % |
| (a) Pseudonym rodného čísla | 100,0 % | 94,7 % | 91,9 % |
| (b) Pseudonymy + Splink, práh 0,9 | 99,7 % | 96,5 % | 93,7 % |
Recidiva do 2 let
Podíl odsouzených, kteří jsou odsouzeni znovu. Osa končí na 55,0 %.
Atrice: podíl obvinění, která skončí odsouzením
| Jak se měří | Vyjde podíl odsouzených | Správně spárovaných rozsudků |
|---|---|---|
| Skutečnost | 64,3 % | – |
| (c) S ID obvinění | 62,4 % | 100,0 % |
| Bez ID věci, osoby podle (b) | 60,7 % | 47,8 % |
| Bez ID věci, osoby propojené dokonale | – | 48,2 % |
Bez ID věci se páruje podle obvyklé délky řízení. S vyšší chybovostí roste i podíl nenahlášených výsledků, proto klesá i hodnota měřená s identifikátorem.
Všechny běhy jako tabulka
| Chybovost | Cizinci | (a) úplnost | (a) osob správně | (b) úplnost | (b) osob správně | Recidiva skutečná | bez propojení | (a) | (b) | Rozsudky bez ID věci |
|---|---|---|---|---|---|---|---|---|---|---|
| 0,5× | 0 % | 99,5 % | 98,7 % | 99,7 % | 98,8 % | 50,6 % | 34,7 % | 50,4 % | 50,4 % | 47,8 % |
| 0,5× | 7 % | 98,4 % | 97,1 % | 98,7 % | 97,4 % | 50,4 % | 33,9 % | 50,1 % | 50,1 % | 47,3 % |
| 0,5× | 14 % | 97,3 % | 95,1 % | 98,3 % | 96,4 % | 50,1 % | 32,3 % | 49,7 % | 49,8 % | 48,7 % |
| 0,5× | 21 % | 96,1 % | 93,2 % | 97,4 % | 94,8 % | 51,0 % | 32,2 % | 50,2 % | 50,4 % | 47,9 % |
| 0,5× | 28 % | 95,5 % | 92,1 % | 96,2 % | 93,0 % | 51,3 % | 29,8 % | 50,4 % | 50,5 % | 47,6 % |
| 1× | 0 % | 99,0 % | 97,3 % | 99,8 % | 99,2 % | 50,5 % | 35,1 % | 50,2 % | 50,3 % | 48,1 % |
| 1× | 7 % | 96,7 % | 94,8 % | 98,4 % | 97,1 % | 50,8 % | 33,7 % | 49,9 % | 50,2 % | 48,0 % |
| 1× | 14 % | 94,7 % | 91,9 % | 96,5 % | 93,7 % | 50,9 % | 32,4 % | 49,7 % | 50,0 % | 48,2 % |
| 1× | 21 % | 92,9 % | 88,7 % | 95,3 % | 91,6 % | 50,6 % | 30,8 % | 49,1 % | 49,4 % | 47,9 % |
| 1× | 28 % | 91,4 % | 86,6 % | 94,2 % | 89,8 % | 50,6 % | 30,3 % | 48,3 % | 48,9 % | 47,7 % |
| 2× | 0 % | 97,1 % | 94,1 % | 99,3 % | 97,6 % | 51,1 % | 34,7 % | 49,9 % | 50,3 % | 47,6 % |
| 2× | 7 % | 93,8 % | 90,0 % | 96,8 % | 94,5 % | 50,7 % | 34,3 % | 48,6 % | 49,2 % | 47,7 % |
| 2× | 14 % | 90,2 % | 86,3 % | 94,1 % | 91,2 % | 50,2 % | 32,6 % | 47,9 % | 48,6 % | 47,9 % |
| 2× | 21 % | 86,6 % | 81,8 % | 91,4 % | 87,5 % | 50,5 % | 31,2 % | 47,7 % | 48,6 % | 48,9 % |
| 2× | 28 % | 83,2 % | 77,8 % | 89,0 % | 84,1 % | 51,0 % | 29,8 % | 47,2 % | 48,3 % | 48,1 % |
| 3× | 0 % | 95,1 % | 90,3 % | 98,7 % | 96,2 % | 51,0 % | 34,2 % | 49,5 % | 50,0 % | 48,3 % |
| 3× | 7 % | 89,6 % | 85,8 % | 94,5 % | 92,0 % | 50,6 % | 33,4 % | 48,0 % | 48,6 % | 47,9 % |
| 3× | 14 % | 84,2 % | 80,7 % | 90,3 % | 87,6 % | 50,3 % | 31,8 % | 46,8 % | 47,9 % | 48,1 % |
| 3× | 21 % | 81,0 % | 75,8 % | 87,8 % | 83,1 % | 50,2 % | 31,0 % | 46,3 % | 47,8 % | 48,1 % |
| 3× | 28 % | 77,0 % | 71,6 % | 84,6 % | 79,4 % | 50,4 % | 29,7 % | 45,2 % | 46,9 % | 48,5 % |
| 4× | 0 % | 93,1 % | 85,8 % | 98,0 % | 93,7 % | 50,2 % | 33,9 % | 48,3 % | 48,8 % | 47,6 % |
| 4× | 7 % | 87,2 % | 81,0 % | 93,3 % | 89,3 % | 50,4 % | 33,2 % | 47,4 % | 48,3 % | 48,8 % |
| 4× | 14 % | 80,8 % | 76,1 % | 88,1 % | 84,3 % | 50,3 % | 31,6 % | 46,1 % | 47,3 % | 48,3 % |
| 4× | 21 % | 76,1 % | 71,2 % | 84,7 % | 79,9 % | 50,8 % | 30,8 % | 44,6 % | 46,3 % | 47,4 % |
| 4× | 28 % | 71,0 % | 65,6 % | 80,6 % | 74,7 % | 50,3 % | 29,5 % | 43,5 % | 45,4 % | 47,5 % |
Co si z toho odnést a co ne
- Pseudonymní identifikátor osoby jde technicky udělat tak, že ho analytik nedokáže převést zpět na jméno.
- V sandboxu vychází recidiva bez propojení osob výrazně níž, než jaká v něm skutečně je. Směr zkreslení je obecný, jeho velikost ne.
- Identifikátor osoby atrici nezměří. K té je potřeba identifikátor věci a povinnost hlásit výsledek.
- Konkrétní procenta nepřenášejte na skutečné evidence. Závisejí na předpokladech, které nemáme čím ověřit:
- 2/3 odsouzených má dřívější odsouzení (docs/SPEC.md; v našem datasetu není)
- 14 % osob jsou cizinci bez rodného čísla (docs/SPEC.md)
- 17 % (docs/STAVBA.md: 83 % odsouzených jsou muži)
- log-normální doby mezi fázemi s mediány 90, 120 a 60 dní (vlastní odhad, bez zdroje)
- 8 % věcí má víc obviněných, 2 % obvinění jsou vyloučena k samostatnému řízení (vlastní odhad)
- četnosti překlepů, chybějících RČ a aliasů v jednotlivých systémech (vlastní odhad, bez zdroje)
Model, parametry i omezení popisuje README sandboxu (repozitář zatím není veřejný). Poměry řízení jsou převzaté z trychtýře. Běh je reprodukovatelný (seed 1).