Weby
Robots.txt: jeden řádek, kvůli kterému vás AI nevidí
Malý textový soubor rozhoduje, kteří roboti smí číst váš web. Jeden zapomenutý řádek stačí, aby vás ChatGPT nikdy nezmínil. Jak ho zkontrolovat a co v něm má být.
Na každém webu může ležet malý textový soubor robots.txt. Návštěvník ho nikdy neuvidí, ale každý slušný robot, který na web přijde, si ho přečte jako první. Je v něm napsané, kam smí a kam ne.
Většinou je to v pořádku a nikdo se o něj nestará. Jenže když je v něm jeden špatný řádek, web pro vyhledávače a AI prakticky neexistuje. A majitel o tom nemusí vědět roky.
Jak vypadá ten jeden řádek
User-agent: *
Disallow: /
První řádek říká „platí pro všechny roboty“. Druhý říká „nesmíte nikam“. Dohromady to znamená: Google, ChatGPT, Perplexity a všichni ostatní mají celý web zakázaný.
Jak se to tam dostane? Často úplně nevinně. Při stavbě webu se roboti schválně zakazují, aby se rozpracovaná verze nedostala do vyhledávání. Při spuštění se pak zapomene zákaz zrušit. Web vypadá normálně, funguje, jen ho nikdo nenajde.
Jak to zkontrolovat za minutu
Do prohlížeče napište adresu webu a za lomítko robots.txt, například vasefirma.cz/robots.txt. Můžou nastat tři situace:
- Stránka neexistuje. Nevadí, roboti pak smí všude.
- Soubor tam je a
Disallow: /podUser-agent: *v něm není. Pravděpodobně je to v pořádku. Projděte, jestli nezakazuje konkrétní roboty (viz níž). - Soubor obsahuje
Disallow: /pro všechny. Tohle je ten problém. Napište tomu, kdo vám web spravuje.
Pokud máte web na Wixu, Webnode nebo podobné službě, soubor možná přímo upravit nejde. Google k tomu uvádí, že takové systémy mívají místo toho nastavení viditelnosti ve vyhledávačích. Hledejte volbu typu „skrýt web před vyhledávači“ a zkontrolujte, že není zapnutá.
Roboti AI mají vlastní jména
Robots.txt umí zakazovat a povolovat i jednotlivým robotům. OpenAI například používá tři a každý slouží k něčemu jinému:
| Robot | K čemu slouží | Co se stane, když ho zakážete |
|---|---|---|
| OAI-SearchBot | vyhledávání v ChatGPT | web se v odpovědích vyhledávání ChatGPT nezobrazí |
| GPTBot | sběr obsahu pro trénink modelů | obsah se nepoužije k tréninku, vyhledávání to neovlivní |
| ChatGPT-User | otevření stránky na žádost uživatele | robots.txt se na něj vztahovat nemusí |
To je dobrá zpráva pro každého, kdo nechce, aby se jeho texty používaly k tréninku AI, ale chce, aby ho AI doporučovala. Obojí jde zároveň:
User-agent: GPTBot
Disallow: /
User-agent: *
Allow: /
Podle OpenAI se úprava ve vyhledávání ChatGPT projeví zhruba do 24 hodin.
Co robots.txt neumí
Dvě věci se o robots.txt často tvrdí špatně:
- Není to zámek. Google upozorňuje, že pravidla v souboru dodržují slušní roboti, ale nic je k tomu nenutí. Na ochranu soukromých dat slouží heslo, ne robots.txt.
- Nevyřadí stránku z Googlu. Když na zakázanou stránku vede odkaz odjinud, Google ji podle vlastní dokumentace může zaindexovat i bez přečtení, jen bez popisu. Na skutečné vyřazení slouží značka
noindex.
A ještě jedna věc, kterou se vyplatí vědět: kromě robots.txt nepotřebujete pro AI žádný další soubor. Google výslovně píše, že soubory typu llms.txt jeho vyhledávání nepoužívá a jejich vytvoření viditelnosti v Googlu nepomůže ani neuškodí.
Shrnutí
Otevřete si dnes /robots.txt svého webu. Pokud v něm najdete Disallow: / pro všechny roboty, máte nejlevnější možnou opravu: smazat jeden řádek. Pokud chcete AI zakázat trénink, ale ne vyhledávání, zakažte jen GPTBot. A pokud soubor vůbec nemáte, nic se neděje.