נבדק ב-4.9.2026 · https://www.nytimes.com/
יש 2 חסמים קריטיים למציאוּת בבינה מלאכותית — תקן אותם קודם.
מטריצת סורקי בינה מלאכותית
לכל בוט: מה robots.txt שלך מתיר — ומה השרת שלך באמת מחזיר לסוכן המשתמש של הבוט. שורות מודגשות באדום: robots מתיר, אך השרת חוסם (בדרך כלל כלל WAF או הגנה מפני בוטים).
| בוט | מפעיל | robots.txt | תגובת השרת |
|---|---|---|---|
| GPTBot | OpenAI | חסום | חסום (403 / WAF) |
| OAI-SearchBot | OpenAI | חסום | חסום (403 / WAF) |
| ChatGPT-User | OpenAI | חסום | חסום (403 / WAF) |
| ClaudeBot | Anthropic | חסום | חסום (403 / WAF) |
| Claude-SearchBot | Anthropic | חסום | חסום (403 / WAF) |
| Claude-User | Anthropic | חסום | חסום (403 / WAF) |
| PerplexityBot | Perplexity | חסום | חסום (403 / WAF) |
| Perplexity-User | Perplexity | חסום | חסום (403 / WAF) |
| Google-Extended | Google (Gemini-Training) | חסום | — |
| Googlebot | Google (KI-Übersichten) | מותר | 200 + תוכן |
| CCBot | Common Crawl (Trainingsdaten vieler LLMs) | חסום | חסום (403 / WAF) |
| Bytespider | ByteDance (Doubao) | חסום | חסום (403 / WAF) |
| Amazonbot | Amazon (Alexa/Rufus) | מותר | חסום (403 / WAF) |
| Applebot-Extended | Apple (Intelligence-Training) | חסום | — |
| Meta-ExternalAgent | Meta (Llama/Meta AI) | חסום | חסום (403 / WAF) |
כיצד נוצר הציון?
| סורקי בינה מלאכותית חשובים חסומים ב-robots.txt | -32 |
| השרת חוסם בוטים למרות ש-robots.txt מתיר אותם | -6 |
| כותרת העמוד קצרה מדי או ארוכה מדי | -6 |
| אין llms.txt | -5 |
| אין סכמת Organization | -4 |
| אין אות מחבר או מחברוּת | -4 |
| אין תאריך נראה או מסומן | -3 |
| אין סימון FAQ או HowTo | -2 |
| תוצאה | 38 / 100 |
גישה לסורקי בינה מלאכותית
סורקי בינה מלאכותית חשובים חסומים ב-robots.txt
robots.txt שלך אוסר גישה מ-5 סורקי בינה מלאכותית מרכזיים: GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Google-Extended. מערכות אלה אז אינן יכולות לטעון את התוכן שלך או להשתמש בו כמקור.
מה שכדאי לך לעשות: בדוק לכל בוט אם החסימה מכוונת. לנראות בבינה מלאכותית יש להתיר לפחות ל-GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot ו-Google-Extended.
User-agent: GPTBot Allow: / User-agent: PerplexityBot Allow: /
השרת חוסם בוטים למרות ש-robots.txt מתיר אותם
עבור 1 בוט(ים) מ-Amazon (Alexa/Rufus), robots.txt אומר «מותר», אך השרת מגיב עם 403 או עם עמוד הגנה מפני בוטים. בדרך כלל כלל WAF, חומת אש או CDN שנועל בחוץ את הסורק תוך עקיפת robots.txt.
מה שכדאי לך לעשות: הוסף את סוכני המשתמש ו/או טווחי ה-IP של סורקי הבינה המלאכותית הרצויים לרשימת היתר ב-WAF / Cloudflare / חומת האש שלך. אמת אותם דרך DNS הפוך, לא רק לפי מחרוזת סוכן המשתמש.
מבנה והבנה מכונתית
כותרת העמוד קצרה מדי או ארוכה מדי
אורך ה-<title> הוא 66 תווים. כ-30–60 תווים סביר: מתאר מספיק כדי לנקוב בנושא, קצר מספיק כדי שלא ייחתך.
מה שכדאי לך לעשות: כתוב כותרת תמציתית המכילה את הנושא ובמידת הצורך את המותג.
אין llms.txt
בכתובת /llms.txt אין קובץ. llms.txt הוא סקירה קצרה ב-Markdown של התוכן המרכזי שלך שחלק ממערכות הבינה המלאכותית משתמשות בה להתמצאות.
מה שכדאי לך לעשות: צור /llms.txt: H1 עם השם, פסקה קצרה על ההצעה, ורשימת קישורים לעמודים המרכזיים.
# החברה שלך > תיאור במשפט אחד. ## עמודים חשובים - [מוצר](https://הדומיין-שלך.example/product): … - [מחירים](https://הדומיין-שלך.example/pricing): … - [אודות](https://הדומיין-שלך.example/about): …
אין סכמת Organization
יש JSON-LD, אך אין רשומת «Organization». מערכות בינה מלאכותית אז ממקמות את המותג שלך פחות טוב כישות נפרדת ומקשרות אותו פחות טוב למקורות חיצוניים.
מה שכדאי לך לעשות: הוסף סכמת «Organization» עם name, url, logo ו-sameAs (קישורים לפרופילים הרשמיים שלך).
אין סימון FAQ או HowTo
תוכן בפורמט שאלה-תשובה ושלב-אחר-שלב קשה יותר למערכות בינה מלאכותית לזהות כתשובה שניתן לצטט ישירות ללא סימון FAQPage או HowTo.
מה שכדאי לך לעשות: היכן שהעמוד עונה על שאלות אמיתיות או נותן הוראות, סמן אותו כ-FAQPage או HowTo (אין סימון ללא תוכן תואם נראה).
אותות אמון וישות (E-E-A-T)
אין אות מחבר או מחברוּת
לא ניתן לזהות מחבר (לא meta tag, לא rel=author ולא JSON-LD Person). עבור «ניסיון» ו«מומחיות» במובן E-E-A-T נחשבת מחברוּת נקובה שניתן לעקוב אחריה.
מה שכדאי לך לעשות: בתוכן עריכתי, נקוב בשם מחבר וקשר עמוד מחבר; סמן אותו גם כ-JSON-LD «Person».
אין תאריך נראה או מסומן
לא ניתן לזהות תאריך פרסום או שינוי (לא <time>, לא article:published_time ולא datePublished ב-JSON-LD). בשאלות רבות מערכות בינה מלאכותית מעדיפות מקורות עדכניים.
מה שכדאי לך לעשות: בתוכן הקשור בזמן, הצג תאריך באופן נראה וסמן datePublished / dateModified ב-JSON-LD.
תקין (7)
- התוכן העיקרי נמצא ב-HTML ללא JavaScript.
- קיימים נתונים מובְנים (JSON-LD). — WebSite, NewsMediaOrganization
- בדיוק כותרת H1 אחת.
- הוגדרה כתובת canonical.
- מפת האתר נגישה.
- זמן תגובה מהיר מהשרת.
- אין noindex — מותר לאנדקס את העמוד.
הצעדים הבאים
- סורקי בינה מלאכותית חשובים חסומים ב-robots.txt. בדוק לכל בוט אם החסימה מכוונת. לנראות בבינה מלאכותית יש להתיר לפחות ל-GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot ו-Google-Extended.
- השרת חוסם בוטים למרות ש-robots.txt מתיר אותם. הוסף את סוכני המשתמש ו/או טווחי ה-IP של סורקי הבינה המלאכותית הרצויים לרשימת היתר ב-WAF / Cloudflare / חומת האש שלך. אמת אותם דרך DNS הפוך, לא רק לפי מחרוזת סוכן המשתמש.
- כותרת העמוד קצרה מדי או ארוכה מדי. כתוב כותרת תמציתית המכילה את הנושא ובמידת הצורך את המותג.
סריקה חוזרת שבועית עם התראה במייל בכל שינוי. בהכנה — הזן את הכתובת שלך.
שיטה וגבולות
נבדק ב-4.9.2026. citeglass מביא את nytimes.com ואת הקבצים הקשורים (robots.txt, llms.txt, sitemap.xml) דרך HTTP — פעם כדפדפן רגיל, פעם לכל סוכן משתמש של סורק בינה מלאכותית. JavaScript אינו מורץ. זמן עד הבייט הראשון: 235 מ"ש.
מה זה לא: אין מעקב אחר דירוגים או ציטוטים, אין קביעה אם מודל באמת מזכיר אותך, ואין בדיקת תוכן הנטען דרך JavaScript. תצלום מצב מנקודת מבט של כתובת IP אחת של שרת.