العربية
citeglass · فحص الظهور للذكاء الاصطناعي

فُحص في 24‏/9‏/2026 · https://www.nytimes.com/

توجد 2 عوائق حرجة أمام قابلية الاكتشاف بالذكاء الاصطناعي — أصلحها أولاً.

F
1 / 100
2 حرجة · 5 بحاجة إلى مراجعة
أنت تعمل على موقعك — هل نفحصه أسبوعيًا؟

3 عمليات فحص لهذا الموقع، والنتيجة -37 منذ الفحص الأول. مع المراقبة يفحص citeglass الموقع تلقائيًا كل أسبوع وينبّهك إذا ساء شيء — سجّل لتُبلَّغ عند الإطلاق.

منذ آخر مسح: 1 مُصلَحة

مصفوفة زواحف الذكاء الاصطناعي

لكل روبوت: ماذا يسمح به robots.txt الخاص بك — وماذا يُرجع خادمك فعليًا إلى وكيل المستخدم للروبوت. الصفوف المُظللة بالأحمر: robots يسمح، لكن الخادم يحجب (عادةً قاعدة WAF أو حماية من الروبوتات).

الروبوتالمُشغِّلrobots.txtاستجابة الخادم
GPTBotOpenAIمحجوبمحجوب (403 / WAF)
OAI-SearchBotOpenAIمحجوبمحجوب (403 / WAF)
ChatGPT-UserOpenAIمحجوبمحجوب (403 / WAF)
ClaudeBotAnthropicمحجوبمحجوب (403 / WAF)
Claude-SearchBotAnthropicمحجوبمحجوب (403 / WAF)
Claude-UserAnthropicمحجوبمحجوب (403 / WAF)
PerplexityBotPerplexityمحجوبمحجوب (403 / WAF)
Perplexity-UserPerplexityمحجوبمحجوب (403 / WAF)
Google-ExtendedGoogle (Gemini-Training)محجوب—
GooglebotGoogle (KI-Übersichten)مسموحمحجوب (403 / WAF)
CCBotCommon Crawl (Trainingsdaten vieler LLMs)محجوبمحجوب (403 / WAF)
BytespiderByteDance (Doubao)محجوبمحجوب (403 / WAF)
AmazonbotAmazon (Alexa/Rufus)مسموحمحجوب (403 / WAF)
Applebot-ExtendedApple (Intelligence-Training)محجوب—
Meta-ExternalAgentMeta (Llama/Meta AI)محجوبمحجوب (403 / WAF)
كيف تنشأ الدرجة؟
روبوتات البحث بالذكاء الاصطناعي محظورة في robots.txt-32
الخادم يحجب الروبوتات رغم أن robots.txt يسمح بها-12
نص قليل جدًا في HTML-10
لا بيانات منظَّمة (JSON-LD)-8
عنوان الصفحة قصير جدًا أو طويل جدًا-6
ليس عنوان H1 واحدًا بالضبط-5
وصف meta مفقود أو غير مناسب-5
لا llms.txt-5
لا إشارة مؤلف أو تأليف-4
لا روابط sameAs-3
لا رابط إلى المعلومات القانونية / من نحن / اتصل بنا-3
لا تاريخ مرئي أو مُرمَّز-3
لا عنوان canonical-3
النتيجة1 / 100

الوصول لزواحف الذكاء الاصطناعي

حرج

روبوتات البحث بالذكاء الاصطناعي محظورة في robots.txt

يحظر ملف robots.txt لديك 6 من الروبوتات التي تجلب المحتوى لإجابات مساعدات الذكاء الاصطناعي ومحركات البحث: OAI-SearchBot, ChatGPT-User, Claude-SearchBot, Claude-User, PerplexityBot, Perplexity-User. ما دامت محظورة، لا يمكن أن يظهر موقعك هناك كمصدر.

ما ينبغي أن تفعله: تحقّق لكل روبوت مما إذا كان الحظر مقصودًا. إذا أردت استبعاد تدريب الذكاء الاصطناعي فقط، فاحظر روبوتات التدريب (GPTBot وClaudeBot وGoogle-Extended) واسمح لروبوتات البحث.

User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: Claude-User
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Perplexity-User
Allow: /
حرج

الخادم يحجب الروبوتات رغم أن robots.txt يسمح بها

بالنسبة إلى 2 روبوت من Google (KI-Übersichten), Amazon (Alexa/Rufus)، يقول robots.txt «مسموح»، لكن الخادم يردّ بـ 403 أو بصفحة حماية من الروبوتات. عادةً قاعدة WAF أو جدار حماية أو CDN تُغلق الباب أمام الزاحف متجاوزةً robots.txt.

ما ينبغي أن تفعله: أضِف وكلاء المستخدم و/أو نطاقات IP لزواحف الذكاء الاصطناعي المطلوبة إلى قائمة سماح في WAF / Cloudflare / جدار الحماية لديك. تحقق منها عبر DNS العكسي، لا بسلسلة وكيل المستخدم فقط.

المحتوى دون JavaScript

بحاجة إلى مراجعة

نص قليل جدًا في HTML

يحتوي HTML الأولي على نحو 55 حرفًا فقط من النص المرئي. يكاد لا يكفي لأنظمة الذكاء الاصطناعي لتدرك موضوع الصفحة بثقة.

ما ينبغي أن تفعله: تأكد من أن المحتوى الفعلي موجود كاملاً في HTML وليس في صور أو إطارات iframe أو كتل تُحمَّل عبر JavaScript.

البنية وقابلية الفهم الآلي

بحاجة إلى مراجعة

لا بيانات منظَّمة (JSON-LD)

لا تحتوي الصفحة على JSON-LD. تساعد البيانات المنظَّمة أنظمة الذكاء الاصطناعي على التعرف بوضوح على الكيانات والمؤلف والمؤسسة والتاريخ ونوع الصفحة — بدونها يجب تخمين كل شيء من النص.

ما ينبغي أن تفعله: أضِف على الأقل مخطط «Organization» ومخططًا يناسب نوع الصفحة (Article، Product، FAQPage …) بوصفه JSON-LD في <head>.

<script type="application/ld+json">
{"@context":"https://schema.org","@type":"Organization",
 "name":"شركتك","url":"https://نطاقك.example",
 "sameAs":["https://www.linkedin.com/company/…"]}
</script>
بحاجة إلى مراجعة

عنوان الصفحة قصير جدًا أو طويل جدًا

طول <title> هو 11 حرفًا. نحو 30–60 حرفًا معقول: وصفي بما يكفي لتسمية الموضوع، قصير بما يكفي كي لا يُقتطع.

ما ينبغي أن تفعله: اكتب عنوانًا مقتضبًا يحتوي على الموضوع والعلامة التجارية عند الحاجة.

بحاجة إلى مراجعة

ليس عنوان H1 واحدًا بالضبط

تحتوي الصفحة على 0 من عناوين H1. عنوان H1 واحد واضح يخبر البشر والآلات عمّا تدور الصفحة أساسًا.

ما ينبغي أن تفعله: اضبط عنوان H1 واحدًا بالضبط يسمّي الموضوع الرئيسي للصفحة. وكل ما تحته يبدأ من H2.

بحاجة إلى مراجعة

وصف meta مفقود أو غير مناسب

طول وصف meta هو 0 حرفًا. غالبًا ما يكون أول ما تقرؤه أنظمة الذكاء الاصطناعي ومحركات البحث كملخص للصفحة.

ما ينبغي أن تفعله: اكتب ملخصًا مستقلاً للصفحة في جملة أو جملتين (نحو 120–200 حرف)، لا سلسلة كلمات مفتاحية.

ملاحظة

لا llms.txt

لا يوجد ملف على /llms.txt. llms.txt نظرة عامة قصيرة بصيغة Markdown لمحتواك المحوري تستخدمها بعض أنظمة الذكاء الاصطناعي للتوجُّه.

ما ينبغي أن تفعله: أنشئ /llms.txt: عنوان H1 بالاسم، وفقرة قصيرة عن العرض، وقائمة روابط إلى الصفحات المحورية.

# شركتك

> وصف في جملة واحدة.

## صفحات مهمة
- [المنتج](https://نطاقك.example/product): …
- [الأسعار](https://نطاقك.example/pricing): …
- [من نحن](https://نطاقك.example/about): …

إشارات الثقة والكيان (E-E-A-T)

ملاحظة

لا إشارة مؤلف أو تأليف

لا يمكن التعرف على مؤلف (لا وسم meta، ولا rel=author، ولا JSON-LD Person). لأجل «الخبرة» و«الاختصاص» بمعنى E-E-A-T يُحتسب تأليف مُسمّى وقابل للتتبع.

ما ينبغي أن تفعله: للمحتوى التحريري سمِّ مؤلفًا بالاسم واربط صفحة مؤلف؛ رمِّزه أيضًا كـ JSON-LD «Person».

ملاحظة

لا روابط sameAs

يفتقر JSON-LD إلى «sameAs». بها تربط أنظمة الذكاء الاصطناعي علامتك أو شخصك بوضوح بكيانات معروفة (Wikidata، LinkedIn، أدلة القطاع).

ما ينبغي أن تفعله: أضِف «sameAs» في Organization أو Person بعناوين URL لملفاتك الرسمية ومُدخلات الأدلة.

ملاحظة

لا رابط إلى المعلومات القانونية / من نحن / اتصل بنا

على الصفحة المفحوصة لا يمكن التعرف على رابط إلى المعلومات القانونية أو صفحة «من نحن» أو الاتصال. هذه الصفحات إشارة ثقة قوية وتساعد على ربط الكيان.

ما ينبغي أن تفعله: اربط المعلومات القانونية أو «من نحن» والاتصال بشكل مرئي، عادةً في تذييل كل صفحة.

ملاحظة

لا تاريخ مرئي أو مُرمَّز

لا يمكن التعرف على تاريخ نشر أو تعديل (لا <time>، ولا article:published_time، ولا datePublished في JSON-LD). في كثير من الأسئلة تُفضِّل أنظمة الذكاء الاصطناعي المصادر الحديثة.

ما ينبغي أن تفعله: للمحتوى المرتبط بالزمن اعرض تاريخًا بشكل مرئي ورمِّز datePublished / dateModified في JSON-LD.

الأساس التقني

ملاحظة

لا عنوان canonical

لا تضبط الصفحة <link rel="canonical">. بدون canonical قد يبقى غير واضح أي نسخة هي المرجعية عند وجود عدة صيغ لعنوان URL.

ما ينبغي أن تفعله: اضبط في كل صفحة <link rel="canonical"> ذاتي المرجعية بعنوان URL المفضل.

سليم (3)
  • يمكن الوصول إلى خريطة الموقع.
  • زمن استجابة سريع من الخادم.
  • لا noindex — يمكن فهرسة الصفحة.

الخطوات التالية

  1. روبوتات البحث بالذكاء الاصطناعي محظورة في robots.txt. تحقّق لكل روبوت مما إذا كان الحظر مقصودًا. إذا أردت استبعاد تدريب الذكاء الاصطناعي فقط، فاحظر روبوتات التدريب (GPTBot وClaudeBot وGoogle-Extended) واسمح لروبوتات البحث.
  2. الخادم يحجب الروبوتات رغم أن robots.txt يسمح بها. أضِف وكلاء المستخدم و/أو نطاقات IP لزواحف الذكاء الاصطناعي المطلوبة إلى قائمة سماح في WAF / Cloudflare / جدار الحماية لديك. تحقق منها عبر DNS العكسي، لا بسلسلة وكيل المستخدم فقط.
  3. نص قليل جدًا في HTML. تأكد من أن المحتوى الفعلي موجود كاملاً في HTML وليس في صور أو إطارات iframe أو كتل تُحمَّل عبر JavaScript.

المنهجية والحدود

فُحص في 24‏/9‏/2026. يجلب citeglass nytimes.com والملفات المرتبطة (robots.txt وllms.txt وsitemap.xml) عبر HTTP — مرة كمتصفح عادي، ومرة لكل وكيل مستخدم لزاحف ذكاء اصطناعي. لا يُنفَّذ JavaScript. الزمن حتى أول بايت: 123 مللي ثانية.

ما هذا ليس عليه: لا تتبُّع للترتيب أو الاقتباسات، ولا تصريح بما إذا كان نموذج يذكرك فعلاً، ولا فحص لمحتوى يُحمَّل عبر JavaScript. لقطة من منظور عنوان IP واحد للخادم.

افحص موقعًا آخر