עברית
citeglass · בדיקת נראות ל-בינה מלאכותית

נבדק ב-24.9.2026 · https://www.nytimes.com/

יש 2 חסמים קריטיים למציאוּת בבינה מלאכותית — תקן אותם קודם.

F
1 / 100
2 קריטיים · 5 לבדיקה
אתם עובדים על האתר — שנבדוק אותו כל שבוע?

3 סריקות של האתר, ציון -37 מאז הסריקה הראשונה. עם הניטור, citeglass בודק את האתר אוטומטית כל שבוע ומתריע אם משהו מתדרדר — הירשמו כדי לקבל הודעה עם ההשקה.

מאז הסריקה האחרונה: 1 תוקנו

מטריצת סורקי בינה מלאכותית

לכל בוט: מה robots.txt שלך מתיר — ומה השרת שלך באמת מחזיר לסוכן המשתמש של הבוט. שורות מודגשות באדום: robots מתיר, אך השרת חוסם (בדרך כלל כלל WAF או הגנה מפני בוטים).

בוטמפעילrobots.txtתגובת השרת
GPTBotOpenAIחסוםחסום (403 / WAF)
OAI-SearchBotOpenAIחסוםחסום (403 / WAF)
ChatGPT-UserOpenAIחסוםחסום (403 / WAF)
ClaudeBotAnthropicחסוםחסום (403 / WAF)
Claude-SearchBotAnthropicחסוםחסום (403 / WAF)
Claude-UserAnthropicחסוםחסום (403 / WAF)
PerplexityBotPerplexityחסוםחסום (403 / WAF)
Perplexity-UserPerplexityחסוםחסום (403 / WAF)
Google-ExtendedGoogle (Gemini-Training)חסום—
GooglebotGoogle (KI-Übersichten)מותרחסום (403 / WAF)
CCBotCommon Crawl (Trainingsdaten vieler LLMs)חסוםחסום (403 / WAF)
BytespiderByteDance (Doubao)חסוםחסום (403 / WAF)
AmazonbotAmazon (Alexa/Rufus)מותרחסום (403 / WAF)
Applebot-ExtendedApple (Intelligence-Training)חסום—
Meta-ExternalAgentMeta (Llama/Meta AI)חסוםחסום (403 / WAF)
כיצד נוצר הציון?
בוטי חיפוש של AI חסומים ב-robots.txt-32
השרת חוסם בוטים למרות ש-robots.txt מתיר אותם-12
מעט מאוד טקסט ב-HTML-10
אין נתונים מובְנים (JSON-LD)-8
כותרת העמוד קצרה מדי או ארוכה מדי-6
לא בדיוק כותרת H1 אחת-5
meta description חסר או לא מתאים-5
אין llms.txt-5
אין אות מחבר או מחברוּת-4
אין קישורי sameAs-3
אין קישור למידע משפטי / אודות / צור קשר-3
אין תאריך נראה או מסומן-3
אין כתובת canonical-3
תוצאה1 / 100

גישה לסורקי בינה מלאכותית

קריטי

בוטי חיפוש של AI חסומים ב-robots.txt

קובץ ה-robots.txt שלך חוסם 6 בוטים שמביאים תוכן לתשובות של עוזרי AI ומנועי חיפוש: OAI-SearchBot, ChatGPT-User, Claude-SearchBot, Claude-User, PerplexityBot, Perplexity-User. כל עוד הם חסומים, האתר שלך לא יכול להופיע שם כמקור.

מה שכדאי לך לעשות: בדקו לגבי כל בוט אם החסימה מכוונת. אם רוצים רק לסרב לאימון AI, חוסמים את בוטי האימון (GPTBot,‏ ClaudeBot,‏ Google-Extended) ומתירים את בוטי החיפוש.

User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: Claude-User
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Perplexity-User
Allow: /
קריטי

השרת חוסם בוטים למרות ש-robots.txt מתיר אותם

עבור 2 בוט(ים) מ-Google (KI-Übersichten), Amazon (Alexa/Rufus), robots.txt אומר «מותר», אך השרת מגיב עם 403 או עם עמוד הגנה מפני בוטים. בדרך כלל כלל WAF, חומת אש או CDN שנועל בחוץ את הסורק תוך עקיפת robots.txt.

מה שכדאי לך לעשות: הוסף את סוכני המשתמש ו/או טווחי ה-IP של סורקי הבינה המלאכותית הרצויים לרשימת היתר ב-WAF / Cloudflare / חומת האש שלך. אמת אותם דרך DNS הפוך, לא רק לפי מחרוזת סוכן המשתמש.

תוכן ללא JavaScript

לבדיקה

מעט מאוד טקסט ב-HTML

ה-HTML הראשוני מכיל רק כ-55 תווים של טקסט נראה. זה בקושי מספיק כדי שמערכות בינה מלאכותית יתפסו בביטחון את נושא העמוד.

מה שכדאי לך לעשות: ודא שהתוכן האמיתי נמצא במלואו ב-HTML ולא בתמונות, ב-iframe או בבלוקים הנטענים דרך JavaScript.

מבנה והבנה מכונתית

לבדיקה

אין נתונים מובְנים (JSON-LD)

העמוד אינו מכיל JSON-LD. נתונים מובְנים עוזרים למערכות בינה מלאכותית לזהות באופן חד-משמעי ישויות, מחבר, ארגון, תאריך וסוג עמוד — בלעדיהם צריך לנחש הכול מהטקסט.

מה שכדאי לך לעשות: הוסף לפחות סכמת «Organization» וסכמה המתאימה לסוג העמוד (Article, Product, FAQPage …) כ-JSON-LD ב-<head>.

<script type="application/ld+json">
{"@context":"https://schema.org","@type":"Organization",
 "name":"החברה שלך","url":"https://הדומיין-שלך.example",
 "sameAs":["https://www.linkedin.com/company/…"]}
</script>
לבדיקה

כותרת העמוד קצרה מדי או ארוכה מדי

אורך ה-<title> הוא 11 תווים. כ-30–60 תווים סביר: מתאר מספיק כדי לנקוב בנושא, קצר מספיק כדי שלא ייחתך.

מה שכדאי לך לעשות: כתוב כותרת תמציתית המכילה את הנושא ובמידת הצורך את המותג.

לבדיקה

לא בדיוק כותרת H1 אחת

לעמוד יש 0 כותרות H1. H1 אחת חד-משמעית אומרת לבני אדם ולמכונות על מה העמוד בעיקרו.

מה שכדאי לך לעשות: הגדר בדיוק H1 אחת שנוקבת בנושא הראשי של העמוד. כל מה שמתחתיה מתחיל מ-H2.

לבדיקה

meta description חסר או לא מתאים

אורך ה-meta description הוא 0 תווים. לעיתים קרובות זה הדבר הראשון שמערכות בינה מלאכותית ומנועי חיפוש קוראים כתקציר של העמוד.

מה שכדאי לך לעשות: כתוב תקציר עצמאי של העמוד במשפט או שניים (כ-120–200 תווים), לא רצף מילות מפתח.

הערה

אין llms.txt

בכתובת /llms.txt אין קובץ. llms.txt הוא סקירה קצרה ב-Markdown של התוכן המרכזי שלך שחלק ממערכות הבינה המלאכותית משתמשות בה להתמצאות.

מה שכדאי לך לעשות: צור /llms.txt: H1 עם השם, פסקה קצרה על ההצעה, ורשימת קישורים לעמודים המרכזיים.

# החברה שלך

> תיאור במשפט אחד.

## עמודים חשובים
- [מוצר](https://הדומיין-שלך.example/product): …
- [מחירים](https://הדומיין-שלך.example/pricing): …
- [אודות](https://הדומיין-שלך.example/about): …

אותות אמון וישות (E-E-A-T)

הערה

אין אות מחבר או מחברוּת

לא ניתן לזהות מחבר (לא meta tag, לא rel=author ולא JSON-LD Person). עבור «ניסיון» ו«מומחיות» במובן E-E-A-T נחשבת מחברוּת נקובה שניתן לעקוב אחריה.

מה שכדאי לך לעשות: בתוכן עריכתי, נקוב בשם מחבר וקשר עמוד מחבר; סמן אותו גם כ-JSON-LD «Person».

הערה

אין קישורי sameAs

ב-JSON-LD חסר «sameAs». באמצעותו מערכות בינה מלאכותית ממפות בבירור את המותג או האדם שלך לישויות מוכרות (Wikidata, LinkedIn, מדריכי ענף).

מה שכדאי לך לעשות: הוסף «sameAs» ב-Organization או ב-Person עם כתובות ה-URL של הפרופילים הרשמיים ורשומות המדריכים שלך.

הערה

אין קישור למידע משפטי / אודות / צור קשר

בעמוד שנבדק לא ניתן לזהות קישור למידע משפטי, לעמוד «אודות» או לצור קשר. עמודים כאלה הם אות אמון חזק ומסייעים במיפוי ישות.

מה שכדאי לך לעשות: קשר את המידע המשפטי או «אודות» ואת צור הקשר באופן נראה, בדרך כלל בכותרת התחתונה של כל עמוד.

הערה

אין תאריך נראה או מסומן

לא ניתן לזהות תאריך פרסום או שינוי (לא <time>, לא article:published_time ולא datePublished ב-JSON-LD). בשאלות רבות מערכות בינה מלאכותית מעדיפות מקורות עדכניים.

מה שכדאי לך לעשות: בתוכן הקשור בזמן, הצג תאריך באופן נראה וסמן datePublished / dateModified ב-JSON-LD.

בסיס טכני

הערה

אין כתובת canonical

העמוד אינו מגדיר <link rel="canonical">. ללא canonical עשוי להישאר לא ברור איזו גרסה קובעת כשקיימות כמה וריאציות של כתובת URL.

מה שכדאי לך לעשות: הגדר בכל עמוד <link rel="canonical"> המפנה לעצמו עם כתובת ה-URL המועדפת.

תקין (3)
  • מפת האתר נגישה.
  • זמן תגובה מהיר מהשרת.
  • אין noindex — מותר לאנדקס את העמוד.

הצעדים הבאים

  1. בוטי חיפוש של AI חסומים ב-robots.txt. בדקו לגבי כל בוט אם החסימה מכוונת. אם רוצים רק לסרב לאימון AI, חוסמים את בוטי האימון (GPTBot,‏ ClaudeBot,‏ Google-Extended) ומתירים את בוטי החיפוש.
  2. השרת חוסם בוטים למרות ש-robots.txt מתיר אותם. הוסף את סוכני המשתמש ו/או טווחי ה-IP של סורקי הבינה המלאכותית הרצויים לרשימת היתר ב-WAF / Cloudflare / חומת האש שלך. אמת אותם דרך DNS הפוך, לא רק לפי מחרוזת סוכן המשתמש.
  3. מעט מאוד טקסט ב-HTML. ודא שהתוכן האמיתי נמצא במלואו ב-HTML ולא בתמונות, ב-iframe או בבלוקים הנטענים דרך JavaScript.

שיטה וגבולות

נבדק ב-24.9.2026. citeglass מביא את nytimes.com ואת הקבצים הקשורים (robots.txt, llms.txt, sitemap.xml) דרך HTTP — פעם כדפדפן רגיל, פעם לכל סוכן משתמש של סורק בינה מלאכותית. JavaScript אינו מורץ. זמן עד הבייט הראשון: 123 מ"ש.

מה זה לא: אין מעקב אחר דירוגים או ציטוטים, אין קביעה אם מודל באמת מזכיר אותך, ואין בדיקת תוכן הנטען דרך JavaScript. תצלום מצב מנקודת מבט של כתובת IP אחת של שרת.

בדוק אתר אחר