Mediální výstup už dnes nekončí publikací článku ani jeho distribucí na sociálních sítích. Čím dál důležitější otázkou je, zda se jeho obsah dostane také do odpovědí generativní umělé inteligence. Pokud totiž jazykový model k obsahu konkrétního média nemá přístup, může být článek pro AI prakticky neviditelný – bez ohledu na jeho čtenost, pozici v médiu nebo investici do PR.
Na tento problém se zaměřila analýza agentury New School Communications. Ta zkoumala 11 klíčových českých zpravodajských webů a jejich přístup k 12 LLM nástrojům. Výsledkem je poměrně zajímavý obrázek: šest sledovaných webů umožňuje přístup všem zkoumaným nástrojům, zatímco pět portálů některé z nich selektivně blokuje.
Pro marketéry a PR týmy to znamená další proměnnou, kterou při plánování mediálních výstupů začíná dávat smysl sledovat. Nejde jen o to, kde článek vyjde a kolik lidí ho přečte. V prostředí generativního vyhledávání je relevantní také otázka, zda k němu mají přístup systémy, které z jeho obsahu následně vytvářejí odpovědi uživatelům.
Pět českých médií část AI nástrojů blokuje
Z jedenácti sledovaných portálů nechávají všechny zkoumané nástroje volně procházet Seznam.cz, Novinky.cz, Seznam Zprávy, Česká televize, Forum 24 a Český rozhlas. Selektivní blokování naopak používají Deník.cz, iDNES.cz, Echo24, Aktuálně.cz a HN.cz. Rozdíly mezi jednotlivými weby jsou přitom poměrně výrazné. Deník.cz podle analýzy blokuje devět z 12 sledovaných nástrojů. iDNES.cz a Echo24 blokují šest nástrojů, přičemž jejich seznam je podle autorů analýzy shodný. Aktuálně.cz a HN.cz blokují pouze GPTBot.
Nejčastěji blokovaným nástrojem je GPTBot společnosti OpenAI. Ten slouží ke sběru obsahu pro trénování modelů a blokování jeho přístupu samo o sobě neznamená, že se obsah webu nebude zobrazovat jako zdroj v odpovědích ChatGPT. O to se stará samostatný OAI-SearchBot, který podle analýzy blokuje pouze jeden ze sledovaných webů. To je důležitý rozdíl, který se v debatě o „blokování ChatGPT“ snadno ztratí. Jeden řádek v robots.txt totiž nemusí znamenat totéž co zákaz přístupu generativní AI jako celku. Jiný crawler může mít jiný účel a jiné chování.
llms.txt neměl ani jeden z analyzovaných webů
Přístup jazykových modelů k webu se v analyzovaném vzorku řídí především nastavením souboru robots.txt. Ten určuje, kterým nástrojům web přístup povoluje a kterým ho zakazuje. Druhým sledovaným mechanismem je llms.txt, který má sloužit jako mapa obsahu připravená přímo pro jazykové modely. V analyzovaném vzorku však llms.txt neměl ani jeden z 11 webů.
Právě tady se technické nastavení webu potkává s marketingem. Pokud firma investuje do PR článku s cílem budovat povědomí, reputaci nebo podporovat svou viditelnost v rámci vyhledávání, tradiční mediální metriky už nemusí popisovat celý jeho potenciální dosah. Článek může být dostupný čtenářům, indexovaný ve vyhledávačích a sdílený na sociálních sítích, ale současně nemusí být dostupný konkrétním systémům využívaným pro AI odpovědi.
Pro GEO – tedy optimalizaci obsahu pro generativní vyhledávání – je to poměrně podstatná informace. Kvalita samotného obsahu totiž není jedinou podmínkou jeho dalšího využití. Model k němu musí mít také přístup.





Proč média AI blokují?
Z pohledu vydavatelů přitom nejde nutně o technologický odpor. Důvod je především ekonomický. Zpravodajské weby vydělávají mimo jiné na návštěvnosti a reklamě. Pokud chatbot převezme informace z článku, shrne je uživateli a ten už následně nemá důvod navštívit původní web, médium může přijít o návštěvu a s ní související reklamní příjem.
Ještě odlišnější situace nastává u trénovacích crawlerů. V takovém případě médium poskytuje obsah pro další využití modelu, aniž by z toho nutně získalo návštěvnost nebo jinou přímou protihodnotu. I proto podle analýzy řada vydavatelů blokuje přístup do doby, než jsou s provozovateli AI služeb dohodnuty podmínky využívání obsahu.
Pro marketéra z toho plyne jedna praktická věc: blokování AI není automaticky známkou toho, že médium nerozumí generativnímu vyhledávání. Může jít o vědomou ochranu obchodního modelu vydavatele.
Zajímavý je také rozdíl mezi crawlery určenými pro trénování modelů a nástroji, které reagují na konkrétní dotaz uživatele. Analýza například ukazuje, že Claude-User, Perplexity-User a Claude-SearchBot neblokuje žádný z 11 sledovaných webů. České portály tak podle autorů studie obecně ponechávají otevřenější přístup nástrojům, které mohou přivést uživatele přímo k obsahu.
Současně ale existují rozdíly v tom, jak jednotliví provozovatelé pravidla interpretují. OpenAI například uvádí, že u akcí vyvolaných uživatelem nemusí být robots.txt rozhodující, protože požadavek přichází od člověka v chatu, nikoli od crawleru. Anthropic k nástroji Claude-User přistupuje odlišně. Pro praxi je proto nebezpečné zjednodušit si problematiku na „web AI povoluje“ versus „web AI blokuje“. Rozhodující je, který nástroj, za jakým účelem a jakým způsobem web navštěvuje.
Co to znamená pro PR a obsahové strategie?
Neznamená to, že by marketéři měli přestat nakupovat PR v médiích, která některé AI crawlery blokují. Takový závěr z analýzy neplyne. Význam konkrétního média se stále odvíjí od cílové skupiny, reputace, čtenosti, tematické relevance i dalších faktorů. Pro strategii obsahu je ale užitečné vědět, že mediální výstup může mít vedle klasického publika ještě jednu potenciální vrstvu distribuce – jazykové modely.
Z pohledu značek proto dává smysl průběžně sledovat nejen vlastní obsah a jeho výskyt v odpovědích AI, ale také technické nastavení důležitých zdrojů, ve kterých firma publikuje. Analýza zároveň upozorňuje, že robots.txt není jednou provždy hotový dokument. Některé weby například stále blokují user agenty, které aktuální dokumentace provozovatelů AI služeb už nepoužívá. Pro firmy, které řeší GEO a AI visibility systematicky, tak vzniká nový typ mediálního auditu: nejen kde jsme publikovali, ale také zda má AI k našemu publikovanému obsahu přístup.