Přeskočit na obsah
Kontakt

← Průvodce

Weby

Robots.txt: jeden řádek, kvůli kterému vás AI nevidí

Malý textový soubor rozhoduje, kteří roboti smí číst váš web. Jeden zapomenutý řádek stačí, aby vás ChatGPT nikdy nezmínil. Jak ho zkontrolovat a co v něm má být.

· Matěj Kudrna · 3 min čtení

Na každém webu může ležet malý textový soubor robots.txt. Návštěvník ho nikdy neuvidí, ale každý slušný robot, který na web přijde, si ho přečte jako první. Je v něm napsané, kam smí a kam ne.

Většinou je to v pořádku a nikdo se o něj nestará. Jenže když je v něm jeden špatný řádek, web pro vyhledávače a AI prakticky neexistuje. A majitel o tom nemusí vědět roky.

Jak vypadá ten jeden řádek

User-agent: *
Disallow: /

První řádek říká „platí pro všechny roboty“. Druhý říká „nesmíte nikam“. Dohromady to znamená: Google, ChatGPT, Perplexity a všichni ostatní mají celý web zakázaný.

Jak se to tam dostane? Často úplně nevinně. Při stavbě webu se roboti schválně zakazují, aby se rozpracovaná verze nedostala do vyhledávání. Při spuštění se pak zapomene zákaz zrušit. Web vypadá normálně, funguje, jen ho nikdo nenajde.

Jak to zkontrolovat za minutu

Do prohlížeče napište adresu webu a za lomítko robots.txt, například vasefirma.cz/robots.txt. Můžou nastat tři situace:

  • Stránka neexistuje. Nevadí, roboti pak smí všude.
  • Soubor tam je a Disallow: / pod User-agent: * v něm není. Pravděpodobně je to v pořádku. Projděte, jestli nezakazuje konkrétní roboty (viz níž).
  • Soubor obsahuje Disallow: / pro všechny. Tohle je ten problém. Napište tomu, kdo vám web spravuje.

Pokud máte web na Wixu, Webnode nebo podobné službě, soubor možná přímo upravit nejde. Google k tomu uvádí, že takové systémy mívají místo toho nastavení viditelnosti ve vyhledávačích. Hledejte volbu typu „skrýt web před vyhledávači“ a zkontrolujte, že není zapnutá.

Roboti AI mají vlastní jména

Robots.txt umí zakazovat a povolovat i jednotlivým robotům. OpenAI například používá tři a každý slouží k něčemu jinému:

RobotK čemu sloužíCo se stane, když ho zakážete
OAI-SearchBotvyhledávání v ChatGPTweb se v odpovědích vyhledávání ChatGPT nezobrazí
GPTBotsběr obsahu pro trénink modelůobsah se nepoužije k tréninku, vyhledávání to neovlivní
ChatGPT-Userotevření stránky na žádost uživatelerobots.txt se na něj vztahovat nemusí

To je dobrá zpráva pro každého, kdo nechce, aby se jeho texty používaly k tréninku AI, ale chce, aby ho AI doporučovala. Obojí jde zároveň:

User-agent: GPTBot
Disallow: /

User-agent: *
Allow: /

Podle OpenAI se úprava ve vyhledávání ChatGPT projeví zhruba do 24 hodin.

Co robots.txt neumí

Dvě věci se o robots.txt často tvrdí špatně:

  • Není to zámek. Google upozorňuje, že pravidla v souboru dodržují slušní roboti, ale nic je k tomu nenutí. Na ochranu soukromých dat slouží heslo, ne robots.txt.
  • Nevyřadí stránku z Googlu. Když na zakázanou stránku vede odkaz odjinud, Google ji podle vlastní dokumentace může zaindexovat i bez přečtení, jen bez popisu. Na skutečné vyřazení slouží značka noindex.

A ještě jedna věc, kterou se vyplatí vědět: kromě robots.txt nepotřebujete pro AI žádný další soubor. Google výslovně píše, že soubory typu llms.txt jeho vyhledávání nepoužívá a jejich vytvoření viditelnosti v Googlu nepomůže ani neuškodí.

Shrnutí

Otevřete si dnes /robots.txt svého webu. Pokud v něm najdete Disallow: / pro všechny roboty, máte nejlevnější možnou opravu: smazat jeden řádek. Pokud chcete AI zakázat trénink, ale ne vyhledávání, zakažte jen GPTBot. A pokud soubor vůbec nemáte, nic se neděje.

Zdroje

  1. Google Search Central: Introduction to robots.txt
  2. OpenAI: Overview of OpenAI Crawlers
  3. Google Search Central: Optimizing your website for generative AI features on Google Search