נבדק ב-24.9.2026 · https://www.nytimes.com/
יש 2 חסמים קריטיים למציאוּת בבינה מלאכותית — תקן אותם קודם.
מטריצת סורקי בינה מלאכותית
לכל בוט: מה robots.txt שלך מתיר — ומה השרת שלך באמת מחזיר לסוכן המשתמש של הבוט. שורות מודגשות באדום: robots מתיר, אך השרת חוסם (בדרך כלל כלל WAF או הגנה מפני בוטים).
| בוט | מפעיל | robots.txt | תגובת השרת |
|---|---|---|---|
| GPTBot | OpenAI | חסום | חסום (403 / WAF) |
| OAI-SearchBot | OpenAI | חסום | חסום (403 / WAF) |
| ChatGPT-User | OpenAI | חסום | חסום (403 / WAF) |
| ClaudeBot | Anthropic | חסום | חסום (403 / WAF) |
| Claude-SearchBot | Anthropic | חסום | חסום (403 / WAF) |
| Claude-User | Anthropic | חסום | חסום (403 / WAF) |
| PerplexityBot | Perplexity | חסום | חסום (403 / WAF) |
| Perplexity-User | Perplexity | חסום | חסום (403 / WAF) |
| Google-Extended | Google (Gemini-Training) | חסום | — |
| Googlebot | Google (KI-Übersichten) | מותר | חסום (403 / WAF) |
| CCBot | Common Crawl (Trainingsdaten vieler LLMs) | חסום | חסום (403 / WAF) |
| Bytespider | ByteDance (Doubao) | חסום | חסום (403 / WAF) |
| Amazonbot | Amazon (Alexa/Rufus) | מותר | חסום (403 / WAF) |
| Applebot-Extended | Apple (Intelligence-Training) | חסום | — |
| Meta-ExternalAgent | Meta (Llama/Meta AI) | חסום | חסום (403 / WAF) |
כיצד נוצר הציון?
| בוטי חיפוש של AI חסומים ב-robots.txt | -32 |
| השרת חוסם בוטים למרות ש-robots.txt מתיר אותם | -12 |
| מעט מאוד טקסט ב-HTML | -10 |
| אין נתונים מובְנים (JSON-LD) | -8 |
| כותרת העמוד קצרה מדי או ארוכה מדי | -6 |
| לא בדיוק כותרת H1 אחת | -5 |
| meta description חסר או לא מתאים | -5 |
| אין llms.txt | -5 |
| אין אות מחבר או מחברוּת | -4 |
| אין קישורי sameAs | -3 |
| אין קישור למידע משפטי / אודות / צור קשר | -3 |
| אין תאריך נראה או מסומן | -3 |
| אין כתובת canonical | -3 |
| תוצאה | 1 / 100 |
גישה לסורקי בינה מלאכותית
בוטי חיפוש של AI חסומים ב-robots.txt
קובץ ה-robots.txt שלך חוסם 6 בוטים שמביאים תוכן לתשובות של עוזרי AI ומנועי חיפוש: OAI-SearchBot, ChatGPT-User, Claude-SearchBot, Claude-User, PerplexityBot, Perplexity-User. כל עוד הם חסומים, האתר שלך לא יכול להופיע שם כמקור.
מה שכדאי לך לעשות: בדקו לגבי כל בוט אם החסימה מכוונת. אם רוצים רק לסרב לאימון AI, חוסמים את בוטי האימון (GPTBot, ClaudeBot, Google-Extended) ומתירים את בוטי החיפוש.
User-agent: OAI-SearchBot Allow: / User-agent: ChatGPT-User Allow: / User-agent: Claude-SearchBot Allow: / User-agent: Claude-User Allow: / User-agent: PerplexityBot Allow: / User-agent: Perplexity-User Allow: /
השרת חוסם בוטים למרות ש-robots.txt מתיר אותם
עבור 2 בוט(ים) מ-Google (KI-Übersichten), Amazon (Alexa/Rufus), robots.txt אומר «מותר», אך השרת מגיב עם 403 או עם עמוד הגנה מפני בוטים. בדרך כלל כלל WAF, חומת אש או CDN שנועל בחוץ את הסורק תוך עקיפת robots.txt.
מה שכדאי לך לעשות: הוסף את סוכני המשתמש ו/או טווחי ה-IP של סורקי הבינה המלאכותית הרצויים לרשימת היתר ב-WAF / Cloudflare / חומת האש שלך. אמת אותם דרך DNS הפוך, לא רק לפי מחרוזת סוכן המשתמש.
אימון AI נחסם
קובץ ה-robots.txt שלך חוסם סורקים שאוספים תוכן לאימון מודלי שפה: GPTBot, ClaudeBot, Google-Extended, CCBot, Applebot-Extended. זה לא מונע ציטוט — בוטי חיפוש ואחזור כמו OAI-SearchBot, PerplexityBot ו-Googlebot עבור סקירות AI נפרדים מהם.
מה שכדאי לך לעשות: אין צורך בפעולה אם החסימה מכוונת. רק ודאו שבוטי החיפוש נשארים מותרים.
תוכן ללא JavaScript
מעט מאוד טקסט ב-HTML
ה-HTML הראשוני מכיל רק כ-55 תווים של טקסט נראה. זה בקושי מספיק כדי שמערכות בינה מלאכותית יתפסו בביטחון את נושא העמוד.
מה שכדאי לך לעשות: ודא שהתוכן האמיתי נמצא במלואו ב-HTML ולא בתמונות, ב-iframe או בבלוקים הנטענים דרך JavaScript.
מבנה והבנה מכונתית
אין נתונים מובְנים (JSON-LD)
העמוד אינו מכיל JSON-LD. נתונים מובְנים עוזרים למערכות בינה מלאכותית לזהות באופן חד-משמעי ישויות, מחבר, ארגון, תאריך וסוג עמוד — בלעדיהם צריך לנחש הכול מהטקסט.
מה שכדאי לך לעשות: הוסף לפחות סכמת «Organization» וסכמה המתאימה לסוג העמוד (Article, Product, FAQPage …) כ-JSON-LD ב-<head>.
<script type="application/ld+json">
{"@context":"https://schema.org","@type":"Organization",
"name":"החברה שלך","url":"https://הדומיין-שלך.example",
"sameAs":["https://www.linkedin.com/company/…"]}
</script>כותרת העמוד קצרה מדי או ארוכה מדי
אורך ה-<title> הוא 11 תווים. כ-30–60 תווים סביר: מתאר מספיק כדי לנקוב בנושא, קצר מספיק כדי שלא ייחתך.
מה שכדאי לך לעשות: כתוב כותרת תמציתית המכילה את הנושא ובמידת הצורך את המותג.
לא בדיוק כותרת H1 אחת
לעמוד יש 0 כותרות H1. H1 אחת חד-משמעית אומרת לבני אדם ולמכונות על מה העמוד בעיקרו.
מה שכדאי לך לעשות: הגדר בדיוק H1 אחת שנוקבת בנושא הראשי של העמוד. כל מה שמתחתיה מתחיל מ-H2.
meta description חסר או לא מתאים
אורך ה-meta description הוא 0 תווים. לעיתים קרובות זה הדבר הראשון שמערכות בינה מלאכותית ומנועי חיפוש קוראים כתקציר של העמוד.
מה שכדאי לך לעשות: כתוב תקציר עצמאי של העמוד במשפט או שניים (כ-120–200 תווים), לא רצף מילות מפתח.
אין llms.txt
בכתובת /llms.txt אין קובץ. llms.txt הוא סקירה קצרה ב-Markdown של התוכן המרכזי שלך שחלק ממערכות הבינה המלאכותית משתמשות בה להתמצאות.
מה שכדאי לך לעשות: צור /llms.txt: H1 עם השם, פסקה קצרה על ההצעה, ורשימת קישורים לעמודים המרכזיים.
# החברה שלך > תיאור במשפט אחד. ## עמודים חשובים - [מוצר](https://הדומיין-שלך.example/product): … - [מחירים](https://הדומיין-שלך.example/pricing): … - [אודות](https://הדומיין-שלך.example/about): …
אותות אמון וישות (E-E-A-T)
אין אות מחבר או מחברוּת
לא ניתן לזהות מחבר (לא meta tag, לא rel=author ולא JSON-LD Person). עבור «ניסיון» ו«מומחיות» במובן E-E-A-T נחשבת מחברוּת נקובה שניתן לעקוב אחריה.
מה שכדאי לך לעשות: בתוכן עריכתי, נקוב בשם מחבר וקשר עמוד מחבר; סמן אותו גם כ-JSON-LD «Person».
אין קישורי sameAs
ב-JSON-LD חסר «sameAs». באמצעותו מערכות בינה מלאכותית ממפות בבירור את המותג או האדם שלך לישויות מוכרות (Wikidata, LinkedIn, מדריכי ענף).
מה שכדאי לך לעשות: הוסף «sameAs» ב-Organization או ב-Person עם כתובות ה-URL של הפרופילים הרשמיים ורשומות המדריכים שלך.
אין קישור למידע משפטי / אודות / צור קשר
בעמוד שנבדק לא ניתן לזהות קישור למידע משפטי, לעמוד «אודות» או לצור קשר. עמודים כאלה הם אות אמון חזק ומסייעים במיפוי ישות.
מה שכדאי לך לעשות: קשר את המידע המשפטי או «אודות» ואת צור הקשר באופן נראה, בדרך כלל בכותרת התחתונה של כל עמוד.
אין תאריך נראה או מסומן
לא ניתן לזהות תאריך פרסום או שינוי (לא <time>, לא article:published_time ולא datePublished ב-JSON-LD). בשאלות רבות מערכות בינה מלאכותית מעדיפות מקורות עדכניים.
מה שכדאי לך לעשות: בתוכן הקשור בזמן, הצג תאריך באופן נראה וסמן datePublished / dateModified ב-JSON-LD.
בסיס טכני
אין כתובת canonical
העמוד אינו מגדיר <link rel="canonical">. ללא canonical עשוי להישאר לא ברור איזו גרסה קובעת כשקיימות כמה וריאציות של כתובת URL.
מה שכדאי לך לעשות: הגדר בכל עמוד <link rel="canonical"> המפנה לעצמו עם כתובת ה-URL המועדפת.
תקין (3)
- מפת האתר נגישה.
- זמן תגובה מהיר מהשרת.
- אין noindex — מותר לאנדקס את העמוד.
הצעדים הבאים
- בוטי חיפוש של AI חסומים ב-robots.txt. בדקו לגבי כל בוט אם החסימה מכוונת. אם רוצים רק לסרב לאימון AI, חוסמים את בוטי האימון (GPTBot, ClaudeBot, Google-Extended) ומתירים את בוטי החיפוש.
- השרת חוסם בוטים למרות ש-robots.txt מתיר אותם. הוסף את סוכני המשתמש ו/או טווחי ה-IP של סורקי הבינה המלאכותית הרצויים לרשימת היתר ב-WAF / Cloudflare / חומת האש שלך. אמת אותם דרך DNS הפוך, לא רק לפי מחרוזת סוכן המשתמש.
- מעט מאוד טקסט ב-HTML. ודא שהתוכן האמיתי נמצא במלואו ב-HTML ולא בתמונות, ב-iframe או בבלוקים הנטענים דרך JavaScript.
סריקה חוזרת שבועית עם התראה במייל בכל שינוי. בהכנה — הזן את הכתובת שלך.
שיטה וגבולות
נבדק ב-24.9.2026. citeglass מביא את nytimes.com ואת הקבצים הקשורים (robots.txt, llms.txt, sitemap.xml) דרך HTTP — פעם כדפדפן רגיל, פעם לכל סוכן משתמש של סורק בינה מלאכותית. JavaScript אינו מורץ. זמן עד הבייט הראשון: 99 מ"ש.
מה זה לא: אין מעקב אחר דירוגים או ציטוטים, אין קביעה אם מודל באמת מזכיר אותך, ואין בדיקת תוכן הנטען דרך JavaScript. תצלום מצב מנקודת מבט של כתובת IP אחת של שרת.