GPTBot, ClaudeBot, PerplexityBot a Google-Extended: čo povoliť alebo zakázať v robots.txt

Ešte pred pár rokmi sa pri súbore robots.txt riešil najmä Googlebot, Bingbot a prípadne niekoľko crawlerov SEO nástrojov. Dnes je situácia výrazne zložitejšia.

Na web prichádzajú GPTBot, OAI-SearchBot, ClaudeBot, Claude-SearchBot, PerplexityBot, Google-Extended a ďalšie AI crawlery. Majiteľ webu preto stojí pred novou otázkou:

Má AI botom obsah povoliť, alebo ich radšej zablokovať?

Jedna univerzálna odpoveď neexistuje. Najväčšou chybou je však blokovať všetky AI roboty len preto, že majú v názve GPT, Claude alebo AI. Niektoré roboty zbierajú obsah pre tréning modelov, iné pomáhajú zobrazovať a citovať web vo výsledkoch AI vyhľadávania.

Ak dnes riešite SEO a zároveň aj GEO – optimalizáciu viditeľnosti v ChatGPT, Gemini a ďalších AI systémoch, robots.txt už nie je iba technickým SEO súborom. Stáva sa súčasťou stratégie AI Visibility.

Najskôr si oddeľme dve úplne rozdielne veci

Pri AI crawleroch je potrebné rozlišovať najmä:

1. Použitie obsahu na tréning AI modelov

a

2. Prehľadávanie obsahu, aby ho AI mohla nájsť, použiť, citovať alebo naň odkázať pri aktuálnej odpovedi

To nie je to isté.

OpenAI napríklad používa GPTBot na získavanie obsahu, ktorý môže byť použitý pri tréningu generatívnych modelov. OAI-SearchBot je naopak určený pre vyhľadávanie v ChatGPT. OpenAI tieto nastavenia uvádza ako nezávislé.

Podobnú logiku používa Anthropic. ClaudeBot súvisí s dátami, ktoré môžu prispieť k tréningu modelov, zatiaľ čo Claude-SearchBot slúži na vyhľadávanie a Claude-User na načítanie obsahu pri požiadavke konkrétneho používateľa.

Pre firmu, ktorá chce byť viditeľná v AI odpovediach, je tento rozdiel zásadný.

GPTBot: povoliť alebo zakázať?

GPTBot patrí spoločnosti OpenAI.

Jeho úlohou nie je primárne zobrazovať váš web v aktuálnych výsledkoch ChatGPT Search. OpenAI uvádza, že GPTBot prehľadáva obsah, ktorý môže byť použitý pri tréningu generatívnych AI modelov. Zablokovanie GPTBotu signalizuje, že obsah webu nemá byť použitý na tento účel.

Ak ho chcete zablokovať:

User-agent: GPTBot
Disallow: /

Ak ho chcete povoliť:

User-agent: GPTBot
Disallow:

Znamená blokovanie GPTBotu, že zmiznete z ChatGPT?

Nie automaticky.

Pre vyhľadávanie používa OpenAI samostatný crawler:

OAI-SearchBot

OpenAI priamo uvádza, že OAI-SearchBot slúži na zobrazovanie webových stránok vo výsledkoch vyhľadávania ChatGPT.

Preto môžete mať napríklad:

User-agent: GPTBot
Disallow: /

User-agent: OAI-SearchBot
Disallow:

Takéto nastavenie dáva zmysel firme, ktorá nechce poskytovať svoj obsah na tréning budúcich základných modelov OpenAI, ale zároveň chce zostať dostupná pre vyhľadávanie ChatGPT.

Z pohľadu GEO a AI Visibility je OAI-SearchBot podstatne dôležitejší než samotný GPTBot.

OAI-SearchBot by sme pri firemnom webe väčšinou neblokovali

Ak chcete, aby sa váš web mohol objavovať medzi zdrojmi a odkazmi v ChatGPT Search, blokovanie OAI-SearchBotu ide proti tomuto cieľu.

OpenAI odporúča webom, ktoré chcú byť zobrazované vo výsledkoch ChatGPT Search, OAI-SearchBot povoliť.

Pre bežný firemný web, e-shop alebo obsahový projekt by preto dávalo zmysel napríklad:

User-agent: OAI-SearchBot
Allow: /

Samotné povolenie crawlera samozrejme negarantuje citáciu ani vysokú AI Visibility.

AI systém musí mať zároveň dôvod váš obsah použiť.

Tu už vstupuje do hry kvalita obsahu, odborná autorita, brandové zmienky, interné prelinkovanie, externé citácie, štruktúrované dáta a ďalšie prvky, ktoré rieši GEO optimalizácia.

ClaudeBot: podobná situácia ako pri GPTBot

Anthropic dnes rozlišuje minimálne tri relevantné roboty:

  • ClaudeBot
  • Claude-SearchBot
  • Claude-User

ClaudeBot získava verejný webový obsah, ktorý môže potenciálne prispievať k tréningu modelov Claude. Claude-SearchBot slúži na zlepšovanie výsledkov vyhľadávania a Claude-User pristupuje na stránky na základe požiadavky používateľa.

Ak nechcete umožniť ClaudeBotu crawling:

User-agent: ClaudeBot
Disallow: /

Ak ho chcete povoliť:

User-agent: ClaudeBot
Disallow:

Anthropic oficiálne uvádza, že jeho roboty rešpektujú pravidlá robots.txt.

Chcete byť viditeľní v Claude? Pozor na Claude-SearchBot

Z pohľadu marketingu je veľmi dôležité nezamieňať si ClaudeBot s Claude-SearchBot.

Ak poviete:

„Nechceme, aby Anthropic používal naše články na tréning.“

môže byť logické blokovať ClaudeBot.

Ale ak zároveň poviete:

„Chceme, aby Claude našiel našu firmu a používal naše stránky ako zdroj.“

potom nemá veľký zmysel automaticky blokovať aj Claude-SearchBot.

Anthropic uvádza, že zakázanie Claude-SearchBotu môže znížiť viditeľnosť a presnosť vášho webu vo výsledkoch jeho vyhľadávania.

Možná konfigurácia teda je:

User-agent: ClaudeBot
Disallow: /

User-agent: Claude-SearchBot
Disallow:

User-agent: Claude-User
Disallow:

Takto oddeľujete tréning modelu od vyhľadávania a používateľského načítania obsahu.

PerplexityBot: tu by sme boli s blokovaním ešte opatrnejší

PerplexityBot funguje inak.

Perplexity vo svojej dokumentácii uvádza, že PerplexityBot slúži na vyhľadávanie, zobrazovanie a odkazovanie na webové stránky vo výsledkoch Perplexity a nie je používaný na crawling obsahu pre tréning foundation modelov.

Pre web, ktorý chce získavať viditeľnosť v Perplexity, je preto jeho plošné blokovanie často kontraproduktívne.

Povolenie:

User-agent: PerplexityBot
Allow: /

Zablokovanie:

User-agent: PerplexityBot
Disallow: /

Ak je vaším cieľom, aby vás zákazník našiel aj v Perplexity, odporúčali by sme PerplexityBot vo väčšine bežných prípadov povoliť.

Perplexity priamo odporúča umožniť PerplexityBotu prístup webom, ktoré sa chcú objavovať vo výsledkoch jeho vyhľadávania.

Perplexity-User je opäť niečo iné

Perplexity používa tiež Perplexity-User.

Ide o prístup vyvolaný konkrétnou požiadavkou používateľa. Perplexity upozorňuje, že preto tento fetcher vo všeobecnosti pravidlá robots.txt ignoruje.

To je ďalší príklad toho, prečo jednoduché pravidlo:

„Zakážeme všetky AI boty.“

v dnešnom prostredí prestáva fungovať ako premyslená stratégia.

Google-Extended je najčastejšie nepochopený AI token

Google-Extended je špecifický prípad.

Nie je to klasický samostatný crawler s vlastným HTTP User-Agentom. Google ho označuje ako samostatný produktový token v robots.txt. Crawling technicky vykonávajú existujúce Google crawlery a Google-Extended následne slúži na kontrolu použitia získaného obsahu.

Nastavenie môže vyzerať napríklad:

User-agent: Google-Extended
Disallow: /

Tým obmedzíte použitie obsahu v určitých systémoch Gemini.

Google uvádza, že Google-Extended umožňuje vydavateľom spravovať, či môže byť obsah použitý pri tréningu budúcich generácií Gemini a pri groundingu v Gemini Apps a vybraných službách Vertex AI.

Ovplyvní zablokovanie Google-Extended klasické SEO?

Podľa Googlu nie.

Google výslovne uvádza, že Google-Extended:

  • neovplyvňuje zaradenie webu do Google Search,
  • nie je rankingovým signálom Google Search.

To je veľmi dôležitá informácia.

Ak máte:

User-agent: Google-Extended
Disallow: /

neznamená to automaticky, že ste zablokovali Googlebot alebo že web vypadne z organických výsledkov.

A čo AI Overviews a AI Mode v Google?

Tu vzniká ďalšie časté nedorozumenie.

Google vysvetľuje, že AI funkcie priamo integrované do Google Search používajú pre crawling pravidlá určené pre Googlebot. Google-Extended slúži na kontrolu tréningu a groundingu v niektorých ďalších systémoch Googlu.

Preto by som z pohľadu SEO a viditeľnosti v Google AI rozhodne neodporúčal bez vážneho dôvodu urobiť:

User-agent: Googlebot
Disallow: /

To už je úplne iný zásah než zablokovanie Google-Extended.

Pri Google-Extended vzniká nepríjemný kompromis

OpenAI umožňuje relatívne čisto oddeliť:

GPTBot = tréning

od:

OAI-SearchBot = vyhľadávanie.

Anthropic podobne oddeľuje ClaudeBot a Claude-SearchBot.

Pri Google-Extended je rozhodnutie komplikovanejšie, pretože jeho nastavenie sa podľa Googlu vzťahuje na tréning budúcich Gemini modelov aj na grounding v niektorých Gemini systémoch.

Ak teda Google-Extended úplne zablokujete, nezakazujete iba tréning. Obmedzujete zároveň určité spôsoby použitia obsahu pri groundingu Gemini.

Pre firmy, ktoré riešia AI Visibility a GEO, je preto potrebné toto rozhodnutie posudzovať strategicky a nie iba právne alebo technicky.

Čo by sme odporučili bežnému firemnému webu?

Ak je primárnym cieľom maximálna organická a AI viditeľnosť, praktické nastavenie môže vyzerať napríklad takto:

User-agent: Googlebot
Allow: /

User-agent: Google-Extended
Allow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: GPTBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: Claude-User
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: PerplexityBot
Allow: /

Toto je variant orientovaný na maximálnu dostupnosť obsahu pre vyhľadávače a AI systémy.

Neznamená však, že je automaticky najlepší pre každú firmu.

Variant: chceme AI Visibility, ale nechceme poskytovať obsah na tréning

Mnohým firmám môže viac vyhovovať konzervatívnejšia stratégia.

Napríklad:

User-agent: Googlebot
Allow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: GPTBot
Disallow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: Claude-User
Allow: /

User-agent: ClaudeBot
Disallow: /

User-agent: PerplexityBot
Allow: /

Tým ponechávate otvorené dôležité kanály pre aktuálne AI vyhľadávanie a zároveň blokujete GPTBot a ClaudeBot určené pre potenciálne tréningové použitie obsahu.

Pri Google-Extended však musíte urobiť samostatné rozhodnutie.

Ak ho povolíte:

User-agent: Google-Extended
Allow: /

umožňujete použitie podľa pravidiel Google-Extended vrátane tréningu a podporovaného groundingu.

Ak ho zakážete:

User-agent: Google-Extended
Disallow: /

obmedzíte tieto použitia, ale podľa Googlu tým neovplyvníte samotné zaradenie webu do Google Search.

Robots.txt nie je bezpečnostný nástroj

Je dôležité pripomenúť ešte jednu vec.

Ak máte na webe obsah, ktorý má byť skutočne neverejný, robots.txt nie je spôsob jeho zabezpečenia.

Súbor robots.txt je verejne dostupný a jeho pravidlá sú pokynom crawlerom, nie autentifikačnou alebo bezpečnostnou bariérou. Aj Google upozorňuje, že robots.txt by sa nemal používať ako spôsob ochrany citlivého obsahu.

Interné dokumenty, účty zákazníkov, administráciu, neveřejné PDF súbory alebo osobné údaje treba chrániť technicky – autentifikáciou, oprávneniami alebo iným spôsobom.

Nestačí však AI bot iba povoliť

Toto je z marketingového pohľadu asi najdôležitejší bod.

Môžete mať dokonale nastavený robots.txt:

User-agent: PerplexityBot
Allow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

a napriek tomu sa vaša značka nemusí objaviť ani v jednej relevantnej AI odpovedi.

Povolenie crawlera iba otvára dvere. Nedáva AI dôvod, aby cez ne vošla práve k vám.

Pre AI viditeľnosť sú dôležité aj:

  • kvalitný a jednoznačný obsah,
  • tematická autorita webu,
  • odborné články,
  • konzistentné informácie o firme,
  • externé zmienky a citácie,
  • odkazy z relevantných zdrojov,
  • kvalitné interné prelinkovanie,
  • správne entity,
  • štruktúrované dáta,
  • technické SEO,
  • dôveryhodnosť autora a značky,
  • odpovede na otázky, ktoré zákazníci skutočne kladú.

Preto v ROI index nevnímame SEO a GEO ako dve izolované disciplíny.

Technická dostupnosť webu, obsah, autorita značky a viditeľnosť v AI odpovediach sa čoraz viac prepájajú.

Najväčšia chyba: blokovať všetko, čo obsahuje AI

V praxi by som sa vyhol všeobecnému pravidlu typu:

User-agent: GPTBot
Disallow: /

User-agent: OAI-SearchBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Claude-SearchBot
Disallow: /

User-agent: PerplexityBot
Disallow: /

User-agent: Google-Extended
Disallow: /

bez toho, aby firma presne vedela, prečo jednotlivé roboty blokuje.

Také nastavenie môže síce maximálne obmedzovať prístup niektorých AI systémov k obsahu, ale zároveň môže ísť priamo proti snahe budovať viditeľnosť značky v novom spôsobe vyhľadávania.

Pred zmenou robots.txt si preto položte tri otázky:

  1. Chceme, aby AI vyhľadávače našu firmu nachádzali?
  2. Chceme, aby mohli náš obsah používať pri aktuálnych odpovediach a citovať ho?
  3. Chceme alebo nechceme poskytovať obsah na potenciálne použitie pri tréningu budúcich modelov?

Až potom má význam rozhodovať o jednotlivých user-agentoch.

Naše odporúčanie pre SEO a GEO

Pre väčšinu firiem, e-shopov a B2B webov, ktorých cieľom je získavať zákazníkov z organického a AI vyhľadávania, by sme dnes prioritne neblokovali roboty slúžiace na vyhľadávanie a zobrazovanie zdrojov.

Najmä:

  • Googlebot
  • OAI-SearchBot
  • Claude-SearchBot
  • PerplexityBot

Blokovanie crawlerov určených na tréning je už strategické rozhodnutie firmy:

  • GPTBot
  • ClaudeBot

Pri Google-Extended treba navyše počítať s tým, že jeho nastavenie podľa Googlu ovplyvňuje nielen tréning Gemini, ale aj grounding v niektorých Gemini systémoch.

Najhorším riešením teda nie je mať jedného AI bota povoleného alebo zakázaného.

Najhorším riešením je meniť robots.txt bez pochopenia toho, aký konkrétny účel daný crawler plní.

Viete, či je váš web pripravený na ChatGPT, Gemini a Perplexity?

Robots.txt je iba jeden malý prvok celej skladačky.

Ak chcete zistiť, či AI systémy dokážu váš web správne prehľadávať, pochopiť, spojiť so značkou a používať ako dôveryhodný zdroj, potrebujete sa pozrieť aj na obsah, technické SEO, entity, autoritu, zmienky a spôsob, akým o vašej firme hovoria iné weby.

V ROI index sa venujeme SEO, GEO a AI Visibility – teda optimalizácii nielen pre Google, ale aj pre prostredie, v ktorom zákazníci čoraz častejšie získavajú odpoveď priamo od AI.

Pozrite si našu službu GEO optimalizácie pre ChatGPT, Gemini a Perplexity alebo nám pošlite nezáväzný dopyt. Pozrieme sa na technické nastavenie aj širší kontext viditeľnosti vášho webu a navrhneme, čo má zmysel povoliť, upraviť alebo zablokovať.

Miloš Vargic
Miloš Vargic
V marketingu sa pohybujem viac ako 22 rokov. Som zakladateľ agentúry ROI index a špecializujeme sa na výkonnostný marketing, ktorý firmám reálne prináša výsledky. Pomáhame značkám rásť vďaka efektívnej reklame na Google, Bingu a Facebooku, výkonnému SEO a GEO, precízne nastaveným marketingovým stratégiám pre B2B aj B2C segment. Pracoval som ako marketingový riaditeľ a spúšťal som reklamy v 23 krajinách a 14 jazykoch, kde sme dosahovali vysokú návratnosť investícií z rozpočtov nad 14 300 € mesačne.