Zdraví zdrojů hlídač změn CMS / URL schématu
Deterministická kontrola (bez AI), že u každého webu pořád platí, podle čeho poznáváme článek. Když web změní systém, projeví se to tady dřív, než z toho vzniknou duplicity nebo nám články utečou. Prahy: extrakce ID < 50% nebo mrtvá sekce = alert.
zablokováno: 1 alert: 0 warn: 0 ok: 17
| zdroj | stav | článků | ID% | dup dle ID | shodný text | nových/24h | bez textu | medián slov | poznámky | |
|---|---|---|---|---|---|---|---|---|---|---|
ceskenoviny |
Zablokováno vydavatelem | 1158 | České noviny (ČTK) zablokovaly náš přístup — neunesly kritiku a nezávislý dohled nad tím, jak rámují zprávy. Šly tvrdě: firewall na naši IP (zbytek světa je vidí normálně) + v robots.txt navíc vylučují AI boty. Historická data zůstávají k analýze; nové nepřibývají, dokud se nedomluvíme na podmínkách. | |||||||
aktualne |
ok | 1973 | 100% | 24 | 22 | 0% | 436 | 24 článků se shodným textem (boilerplate/ČTK) | ||
cnnprima |
ok | 2258 | 100% | 25 | 0% | 365 | ||||
ct24 |
ok | 1810 | 100% | 22 | 15 | 414 | 22 článků se shodným textem (boilerplate/ČTK) | |||
denik |
ok | 2228 | — | 115 | 27 | 0% | 391 | 115 článků se shodným textem (boilerplate/ČTK) | ||
| ok | 862 | 100% | 6 | 1258 | ||||||
denikto |
ok | 277 | — | 2 | 0% | 546 | ||||
e15 |
ok | 929 | 100% | 8 | 518 | |||||
echo24 |
ok | 1536 | 100% | 10 | 406 | |||||
forum24 |
ok | 1830 | — | 7 | 0% | 397 | ||||
| ok | 1100 | 100% | 2 | 652 | ||||||
idnes |
ok | 7433 | 100% | 10 | 58 | 0% | 382 | 10 článků se shodným textem (boilerplate/ČTK) | ||
irozhlas feed |
ok | 1115 | — | 0 | 3% | 322 | ||||
lidovky |
ok | 2139 | 100% | 4 | 28 | 0% | 369 | 4 článků se shodným textem (boilerplate/ČTK) | ||
| ok | 5167 | 100% | 45 | 0% | 263 | |||||
parlamentnilisty |
ok | 1969 | 100% | 18 | 23 | 0% | 409 | 18 článků se shodným textem (boilerplate/ČTK) | ||
reflex |
ok | 523 | 100% | 6 | 515 | |||||
| ok | 3269 | 97% | 94 | 37 | 0% | 493 | 94 článků se shodným textem (boilerplate/ČTK) | |||
Zdroje bez ID v URL (denik, forum24, denikto) mají ID% „—" — identitu je u nich potřeba dolovat ze stránky (canonical / og:url / JSON-LD). „shodný text" = různé články se shodným extrahovaným textem (boilerplate / agenturní přetisk). Zdroje označené feed jsou externě sycené (iROZHLAS) — data dostáváme přes ingest, takže u nich nehlídáme URL/ID schéma (to je věc původního crawleru), jen jestli feed pořád dodává čerstvé články.













