Start › Baza wiedzy › Roboty AI w szczegółach
CCBot i Common Crawl
Common Crawl tworzy swobodnie dostępne archiwum sieci, które trafia do danych treningowych licznych modeli językowych.
Dlaczego CCBot jest szczególny
Jeśli zablokujesz tylko GPTBot i ClaudeBot, Twoja treść i tak może trafić do modeli przez zbiór danych Common Crawl. Kto z zasady odrzuca trening, musi uwzględnić CCBot.
Blokowanie
„User-agent: CCBot” i „Disallow: /”. Common Crawl respektuje robots.txt przy kolejnym przejściu; istniejące wpisy w archiwum pozostają do ponownego zebrania zbioru danych.
Kompromis
Common Crawl jest też używany do badań, projektów wyszukiwarek i archiwizacji. Blokada dotyczy wszystkich tych celów, nie tylko komercyjnego treningu AI.
Sprawdzenie reguły
citeglass pokazuje, czy Twój robots.txt zezwala na CCBot czy go blokuje i czy reguła jest specyficzna dla bota, czy działa tylko przez blok „User-agent: *”.
Sprawdź własną stronę
citeglass pokazuje w około 30 sekund, gdzie Twoja strona jest nieczytelna dla systemów AI — za darmo i bez logowania.
Czytaj dalej
Informacja ogólna, nie porada prawna. GEO to młoda dziedzina — zalecenia mogą się zmieniać.