Start › Baza wiedzy › Podstawy
Sterowanie robotami AI w robots.txt
Każdy duży dostawca AI prowadzi własne roboty z własnymi nazwami user agentów. Przez robots.txt decydujesz dla każdego bota, czy może wczytać Twoją treść.
Najważniejsze roboty AI
OpenAI: GPTBot (trenowanie), OAI-SearchBot (wyszukiwanie ChatGPT), ChatGPT-User (pobranie na żądanie użytkownika). Anthropic: ClaudeBot, Claude-SearchBot, Claude-User. Perplexity: PerplexityBot, Perplexity-User. Google: Google-Extended (trenowanie Gemini) — właściwe pobranie do przeglądów AI odbywa się przez zwykły Googlebot. Ponadto Common Crawl (CCBot), Amazonbot, Bytespider, Applebot-Extended i Meta-ExternalAgent.
Celowe dopuszczanie
Dla maksymalnej widoczności w AI nadajesz istotnym botom własny blok z „Allow: /”. Ważne: blok specyficzny dla bota całkowicie zastępuje dla tego bota blok „User-agent: *” — powtórz tam potrzebne reguły disallow.
Celowe wykluczanie
Jeśli odrzucasz trenowanie, ale chcesz pozostać widoczny w wyszukiwaniu AI, możesz zablokować GPTBot i Google-Extended, a dopuścić OAI-SearchBot i Googlebot. To decyzja merytoryczna, nie czysto techniczna.
Dlaczego robots.txt często nie wystarcza
Wiele stron dopuszcza boty w robots.txt, ale blokuje je na poziomie serwera: reguła WAF, „Bot Fight Mode” Cloudflare lub zapora odrzuca robota kodem 403. Bot stosuje się do robots.txt i mimo to nie wchodzi. citeglass uwidacznia tę rozbieżność.
Weryfikacja
Listy dozwolonych powinny zawierać zweryfikowane boty. OpenAI, Anthropic, Perplexity i Google publikują zakresy IP swoich robotów; sprawdzaj dodatkowo przez odwrotny DNS, zamiast polegać tylko na ciągu user agenta.
Sprawdź własną stronę
citeglass pokazuje w około 30 sekund, gdzie Twoja strona jest nieczytelna dla systemów AI — za darmo i bez logowania.
Czytaj dalej
Informacja ogólna, nie porada prawna. GEO to młoda dziedzina — zalecenia mogą się zmieniać.