العربية
citeglass · فحص الظهور للذكاء الاصطناعي

فُحص في 4‏/9‏/2026 · https://www.nytimes.com/

توجد 2 عوائق حرجة أمام قابلية الاكتشاف بالذكاء الاصطناعي — أصلحها أولاً.

F
38 / 100
2 حرجة · 1 بحاجة إلى مراجعة

مصفوفة زواحف الذكاء الاصطناعي

لكل روبوت: ماذا يسمح به robots.txt الخاص بك — وماذا يُرجع خادمك فعليًا إلى وكيل المستخدم للروبوت. الصفوف المُظللة بالأحمر: robots يسمح، لكن الخادم يحجب (عادةً قاعدة WAF أو حماية من الروبوتات).

الروبوتالمُشغِّلrobots.txtاستجابة الخادم
GPTBotOpenAIمحجوبمحجوب (403 / WAF)
OAI-SearchBotOpenAIمحجوبمحجوب (403 / WAF)
ChatGPT-UserOpenAIمحجوبمحجوب (403 / WAF)
ClaudeBotAnthropicمحجوبمحجوب (403 / WAF)
Claude-SearchBotAnthropicمحجوبمحجوب (403 / WAF)
Claude-UserAnthropicمحجوبمحجوب (403 / WAF)
PerplexityBotPerplexityمحجوبمحجوب (403 / WAF)
Perplexity-UserPerplexityمحجوبمحجوب (403 / WAF)
Google-ExtendedGoogle (Gemini-Training)محجوب
GooglebotGoogle (KI-Übersichten)مسموح200 + محتوى
CCBotCommon Crawl (Trainingsdaten vieler LLMs)محجوبمحجوب (403 / WAF)
BytespiderByteDance (Doubao)محجوبمحجوب (403 / WAF)
AmazonbotAmazon (Alexa/Rufus)مسموحمحجوب (403 / WAF)
Applebot-ExtendedApple (Intelligence-Training)محجوب
Meta-ExternalAgentMeta (Llama/Meta AI)محجوبمحجوب (403 / WAF)
كيف تنشأ الدرجة؟
زواحف ذكاء اصطناعي مهمة محجوبة في robots.txt-32
الخادم يحجب الروبوتات رغم أن robots.txt يسمح بها-6
عنوان الصفحة قصير جدًا أو طويل جدًا-6
لا llms.txt-5
لا مخطط Organization-4
لا إشارة مؤلف أو تأليف-4
لا تاريخ مرئي أو مُرمَّز-3
لا ترميز FAQ أو HowTo-2
النتيجة38 / 100

الوصول لزواحف الذكاء الاصطناعي

حرج

زواحف ذكاء اصطناعي مهمة محجوبة في robots.txt

يمنع robots.txt الخاص بك الوصول عن 5 من زواحف الذكاء الاصطناعي المحورية: GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Google-Extended. عندها لا تستطيع هذه الأنظمة تحميل محتواك أو استخدامه مصدرًا.

ما ينبغي أن تفعله: تحقق لكل روبوت مما إذا كان الحجب مقصودًا. لأجل الظهور في الذكاء الاصطناعي ينبغي السماح على الأقل لـ GPTBot وOAI-SearchBot وClaudeBot وPerplexityBot وGoogle-Extended.

User-agent: GPTBot
Allow: /

User-agent: PerplexityBot
Allow: /
حرج

الخادم يحجب الروبوتات رغم أن robots.txt يسمح بها

بالنسبة إلى 1 روبوت من Amazon (Alexa/Rufus)، يقول robots.txt «مسموح»، لكن الخادم يردّ بـ 403 أو بصفحة حماية من الروبوتات. عادةً قاعدة WAF أو جدار حماية أو CDN تُغلق الباب أمام الزاحف متجاوزةً robots.txt.

ما ينبغي أن تفعله: أضِف وكلاء المستخدم و/أو نطاقات IP لزواحف الذكاء الاصطناعي المطلوبة إلى قائمة سماح في WAF / Cloudflare / جدار الحماية لديك. تحقق منها عبر DNS العكسي، لا بسلسلة وكيل المستخدم فقط.

البنية وقابلية الفهم الآلي

بحاجة إلى مراجعة

عنوان الصفحة قصير جدًا أو طويل جدًا

طول <title> هو 66 حرفًا. نحو 30–60 حرفًا معقول: وصفي بما يكفي لتسمية الموضوع، قصير بما يكفي كي لا يُقتطع.

ما ينبغي أن تفعله: اكتب عنوانًا مقتضبًا يحتوي على الموضوع والعلامة التجارية عند الحاجة.

ملاحظة

لا llms.txt

لا يوجد ملف على /llms.txt. llms.txt نظرة عامة قصيرة بصيغة Markdown لمحتواك المحوري تستخدمها بعض أنظمة الذكاء الاصطناعي للتوجُّه.

ما ينبغي أن تفعله: أنشئ /llms.txt: عنوان H1 بالاسم، وفقرة قصيرة عن العرض، وقائمة روابط إلى الصفحات المحورية.

# شركتك

> وصف في جملة واحدة.

## صفحات مهمة
- [المنتج](https://نطاقك.example/product): …
- [الأسعار](https://نطاقك.example/pricing): …
- [من نحن](https://نطاقك.example/about): …
ملاحظة

لا مخطط Organization

يوجد JSON-LD، لكن لا مُدخل «Organization». عندها تُموضِع أنظمة الذكاء الاصطناعي علامتك التجارية بشكل أضعف ككيان مستقل وتربطها بشكل أضعف بمصادر خارجية.

ما ينبغي أن تفعله: أضِف مخطط «Organization» يتضمن name وurl وlogo وsameAs (روابط إلى ملفاتك الرسمية).

ملاحظة

لا ترميز FAQ أو HowTo

المحتوى على هيئة سؤال وجواب وخطوة بخطوة أصعب على أنظمة الذكاء الاصطناعي في التعرف عليه كإجابة قابلة للاقتباس مباشرةً دون ترميز FAQPage أو HowTo.

ما ينبغي أن تفعله: حيث تجيب الصفحة عن أسئلة حقيقية أو تقدم تعليمات، رمِّزها كـ FAQPage أو HowTo (لا ترميز دون محتوى مطابق مرئي).

إشارات الثقة والكيان (E-E-A-T)

ملاحظة

لا إشارة مؤلف أو تأليف

لا يمكن التعرف على مؤلف (لا وسم meta، ولا rel=author، ولا JSON-LD Person). لأجل «الخبرة» و«الاختصاص» بمعنى E-E-A-T يُحتسب تأليف مُسمّى وقابل للتتبع.

ما ينبغي أن تفعله: للمحتوى التحريري سمِّ مؤلفًا بالاسم واربط صفحة مؤلف؛ رمِّزه أيضًا كـ JSON-LD «Person».

ملاحظة

لا تاريخ مرئي أو مُرمَّز

لا يمكن التعرف على تاريخ نشر أو تعديل (لا <time>، ولا article:published_time، ولا datePublished في JSON-LD). في كثير من الأسئلة تُفضِّل أنظمة الذكاء الاصطناعي المصادر الحديثة.

ما ينبغي أن تفعله: للمحتوى المرتبط بالزمن اعرض تاريخًا بشكل مرئي ورمِّز datePublished / dateModified في JSON-LD.

سليم (7)
  • المحتوى الرئيسي في HTML دون JavaScript.
  • توجد بيانات منظَّمة (JSON-LD). — WebSite, NewsMediaOrganization
  • عنوان H1 واحد بالضبط.
  • تم ضبط عنوان canonical.
  • يمكن الوصول إلى خريطة الموقع.
  • زمن استجابة سريع من الخادم.
  • لا noindex — يمكن فهرسة الصفحة.

الخطوات التالية

  1. زواحف ذكاء اصطناعي مهمة محجوبة في robots.txt. تحقق لكل روبوت مما إذا كان الحجب مقصودًا. لأجل الظهور في الذكاء الاصطناعي ينبغي السماح على الأقل لـ GPTBot وOAI-SearchBot وClaudeBot وPerplexityBot وGoogle-Extended.
  2. الخادم يحجب الروبوتات رغم أن robots.txt يسمح بها. أضِف وكلاء المستخدم و/أو نطاقات IP لزواحف الذكاء الاصطناعي المطلوبة إلى قائمة سماح في WAF / Cloudflare / جدار الحماية لديك. تحقق منها عبر DNS العكسي، لا بسلسلة وكيل المستخدم فقط.
  3. عنوان الصفحة قصير جدًا أو طويل جدًا. اكتب عنوانًا مقتضبًا يحتوي على الموضوع والعلامة التجارية عند الحاجة.
راقب هذه الصفحة

إعادة فحص أسبوعية مع تنبيه بالبريد الإلكتروني عند كل تغيير. قيد الإعداد — أدخل عنوانك.

المنهجية والحدود

فُحص في 4‏/9‏/2026. يجلب citeglass nytimes.com والملفات المرتبطة (robots.txt وllms.txt وsitemap.xml) عبر HTTP — مرة كمتصفح عادي، ومرة لكل وكيل مستخدم لزاحف ذكاء اصطناعي. لا يُنفَّذ JavaScript. الزمن حتى أول بايت: 235 مللي ثانية.

ما هذا ليس عليه: لا تتبُّع للترتيب أو الاقتباسات، ولا تصريح بما إذا كان نموذج يذكرك فعلاً، ولا فحص لمحتوى يُحمَّل عبر JavaScript. لقطة من منظور عنوان IP واحد للخادم.

افحص موقعًا آخر