Polski
citeglass · Kontrola widoczności w AI

StartBaza wiedzy › Podstawy

Sterowanie robotami AI w robots.txt

Każdy duży dostawca AI prowadzi własne roboty z własnymi nazwami user agentów. Przez robots.txt decydujesz dla każdego bota, czy może wczytać Twoją treść.

Najważniejsze roboty AI

OpenAI: GPTBot (trenowanie), OAI-SearchBot (wyszukiwanie ChatGPT), ChatGPT-User (pobranie na żądanie użytkownika). Anthropic: ClaudeBot, Claude-SearchBot, Claude-User. Perplexity: PerplexityBot, Perplexity-User. Google: Google-Extended (trenowanie Gemini) — właściwe pobranie do przeglądów AI odbywa się przez zwykły Googlebot. Ponadto Common Crawl (CCBot), Amazonbot, Bytespider, Applebot-Extended i Meta-ExternalAgent.

Celowe dopuszczanie

Dla maksymalnej widoczności w AI nadajesz istotnym botom własny blok z „Allow: /”. Ważne: blok specyficzny dla bota całkowicie zastępuje dla tego bota blok „User-agent: *” — powtórz tam potrzebne reguły disallow.

Celowe wykluczanie

Jeśli odrzucasz trenowanie, ale chcesz pozostać widoczny w wyszukiwaniu AI, możesz zablokować GPTBot i Google-Extended, a dopuścić OAI-SearchBot i Googlebot. To decyzja merytoryczna, nie czysto techniczna.

Dlaczego robots.txt często nie wystarcza

Wiele stron dopuszcza boty w robots.txt, ale blokuje je na poziomie serwera: reguła WAF, „Bot Fight Mode” Cloudflare lub zapora odrzuca robota kodem 403. Bot stosuje się do robots.txt i mimo to nie wchodzi. citeglass uwidacznia tę rozbieżność.

Weryfikacja

Listy dozwolonych powinny zawierać zweryfikowane boty. OpenAI, Anthropic, Perplexity i Google publikują zakresy IP swoich robotów; sprawdzaj dodatkowo przez odwrotny DNS, zamiast polegać tylko na ciągu user agenta.

Sprawdź własną stronę

citeglass pokazuje w około 30 sekund, gdzie Twoja strona jest nieczytelna dla systemów AI — za darmo i bez logowania.

Czytaj dalej

Informacja ogólna, nie porada prawna. GEO to młoda dziedzina — zalecenia mogą się zmieniać.