العربية
citeglass · فحص الظهور للذكاء الاصطناعي

الرئيسيةقاعدة المعرفة › الأساسيات

التحكم في زواحف الذكاء الاصطناعي في robots.txt

يُشغِّل كل مزوّد ذكاء اصطناعي كبير زواحفه الخاصة بأسماء وكلاء مستخدم خاصة. عبر robots.txt تقرر لكل روبوت ما إذا كان يستطيع تحميل محتواك.

أهم زواحف الذكاء الاصطناعي

OpenAI: GPTBot (التدريب)، OAI-SearchBot (بحث ChatGPT)، ChatGPT-User (الجلب بناءً على طلب المستخدم). Anthropic: ClaudeBot، Claude-SearchBot، Claude-User. Perplexity: PerplexityBot، Perplexity-User. Google: Google-Extended (تدريب Gemini) — يتم الجلب الفعلي لنظرات الذكاء الاصطناعي عبر Googlebot العادي. إضافةً إلى Common Crawl (CCBot) وAmazonbot وBytespider وApplebot-Extended وMeta-ExternalAgent.

السماح بشكل هادف

لأقصى ظهور في الذكاء الاصطناعي، امنح الروبوتات المعنية كتلة خاصة بها بـ «Allow: /». مهم: تحل الكتلة الخاصة بروبوت محل كتلة «User-agent: *» بالكامل لذلك الروبوت — كرِّر قواعد disallow اللازمة هناك.

الاستبعاد بشكل هادف

إذا رفضت التدريب لكنك تريد البقاء ظاهرًا في بحث الذكاء الاصطناعي، يمكنك حجب GPTBot وGoogle-Extended والسماح لـ OAI-SearchBot وGooglebot. هذا قرار متعلق بالمحتوى، لا قرار تقني بحت.

لماذا لا يكفي robots.txt غالبًا

تسمح مواقع كثيرة بالروبوتات في robots.txt لكنها تحجبها على مستوى الخادم: قاعدة WAF أو «Bot Fight Mode» من Cloudflare أو جدار حماية يرفض الزاحف بـ 403. يلتزم الروبوت بـ robots.txt ومع ذلك لا يدخل. يُظهِر citeglass هذا التعارض.

التحقق

ينبغي أن تحتوي قوائم السماح على روبوتات مُتحقَّق منها. تنشر OpenAI وAnthropic وPerplexity وGoogle نطاقات IP لزواحفها؛ تحقق إضافةً عبر DNS العكسي بدلاً من الاعتماد على سلسلة وكيل المستخدم فقط.

افحص موقعك أنت

يوضح citeglass في نحو 30 ثانية أين يكون موقعك غير قابل للقراءة لأنظمة الذكاء الاصطناعي — مجانًا ودون تسجيل دخول.

تابع القراءة

معلومات عامة، وليست استشارة قانونية. GEO مجال حديث — قد تتغير التوصيات.