Comprobado el 4/9/2026 · https://www.nytimes.com/
Hay 2 bloqueos críticos para la localización por IA — corrígelos primero.
Matriz de rastreadores de IA
Por cada bot: qué permite tu robots.txt — y qué devuelve realmente tu servidor al agente de usuario del bot. Filas resaltadas en rojo: robots lo permite, pero el servidor lo bloquea (normalmente una regla de WAF o de protección anti-bots).
| Bot | Operador | robots.txt | Respuesta del servidor |
|---|---|---|---|
| GPTBot | OpenAI | bloqueado | bloqueado (403 / WAF) |
| OAI-SearchBot | OpenAI | bloqueado | bloqueado (403 / WAF) |
| ChatGPT-User | OpenAI | bloqueado | bloqueado (403 / WAF) |
| ClaudeBot | Anthropic | bloqueado | bloqueado (403 / WAF) |
| Claude-SearchBot | Anthropic | bloqueado | bloqueado (403 / WAF) |
| Claude-User | Anthropic | bloqueado | bloqueado (403 / WAF) |
| PerplexityBot | Perplexity | bloqueado | bloqueado (403 / WAF) |
| Perplexity-User | Perplexity | bloqueado | bloqueado (403 / WAF) |
| Google-Extended | Google (Gemini-Training) | bloqueado | — |
| Googlebot | Google (KI-Übersichten) | permitido | 200 + contenido |
| CCBot | Common Crawl (Trainingsdaten vieler LLMs) | bloqueado | bloqueado (403 / WAF) |
| Bytespider | ByteDance (Doubao) | bloqueado | bloqueado (403 / WAF) |
| Amazonbot | Amazon (Alexa/Rufus) | permitido | bloqueado (403 / WAF) |
| Applebot-Extended | Apple (Intelligence-Training) | bloqueado | — |
| Meta-ExternalAgent | Meta (Llama/Meta AI) | bloqueado | bloqueado (403 / WAF) |
¿Cómo se calcula la puntuación?
| Rastreadores de IA importantes están bloqueados en robots.txt | -32 |
| El servidor bloquea bots aunque robots.txt los permite | -6 |
| Título de página demasiado corto o largo | -6 |
| Sin llms.txt | -5 |
| Sin esquema Organization | -4 |
| Sin señal de autor o autoría | -4 |
| Sin fecha visible ni marcada | -3 |
| Sin marcado FAQ o HowTo | -2 |
| Resultado | 38 / 100 |
Acceso para rastreadores de IA
Rastreadores de IA importantes están bloqueados en robots.txt
Tu robots.txt prohíbe el acceso a 5 rastreadores de IA centrales: GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Google-Extended. Esos sistemas no pueden entonces cargar tu contenido ni usarlo como fuente.
Esto es lo que deberías hacer: Comprueba por bot si el bloqueo es intencionado. Para la visibilidad en IA deberían estar permitidos al menos GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot y Google-Extended.
User-agent: GPTBot Allow: / User-agent: PerplexityBot Allow: /
El servidor bloquea bots aunque robots.txt los permite
Para 1 bot(s) de Amazon (Alexa/Rufus), robots.txt dice «permitido», pero el servidor responde con un 403 o una página de protección anti-bots. Suele ser una regla de WAF, cortafuegos o CDN que excluye al rastreador saltándose robots.txt.
Esto es lo que deberías hacer: Añade los agentes de usuario o rangos de IP de los rastreadores de IA deseados a una lista de permitidos en tu WAF / Cloudflare / cortafuegos. Verifícalos por DNS inverso, no solo por la cadena de agente de usuario.
Estructura y comprensión por la máquina
Título de página demasiado corto o largo
El <title> tiene 66 caracteres. Unos 30 a 60 caracteres son razonables: lo bastante descriptivo para nombrar el tema, lo bastante corto para no cortarse.
Esto es lo que deberías hacer: Redacta un título conciso que contenga el tema y, si procede, la marca.
Sin llms.txt
No hay ningún archivo en /llms.txt. llms.txt es un breve resumen en Markdown de tus contenidos clave que algunos sistemas de IA usan para orientarse.
Esto es lo que deberías hacer: Crea un /llms.txt: un H1 con el nombre, un párrafo corto sobre la oferta y una lista de enlaces a las páginas centrales.
# Tu empresa > Descripción en una frase. ## Páginas clave - [Producto](https://tu-dominio.es/producto): … - [Precios](https://tu-dominio.es/precios): … - [Quiénes somos](https://tu-dominio.es/quienes-somos): …
Sin esquema Organization
Hay JSON-LD, pero ninguna entrada «Organization». Los sistemas de IA sitúan entonces peor tu marca como entidad distinta y la vinculan peor con fuentes externas.
Esto es lo que deberías hacer: Añade un esquema «Organization» con name, url, logo y sameAs (enlaces a tus perfiles oficiales).
Sin marcado FAQ o HowTo
El contenido de preguntas y respuestas y de paso a paso es más difícil de reconocer como respuesta directamente citable para los sistemas de IA sin marcado FAQPage o HowTo.
Esto es lo que deberías hacer: Donde la página responda preguntas reales o dé instrucciones, márcala como FAQPage o HowTo (sin marcado sin contenido visiblemente correspondiente).
Señales de confianza y de entidad (E-E-A-T)
Sin señal de autor o autoría
No hay autor reconocible (ni meta etiqueta, ni rel=author, ni JSON-LD Person). Para la «experiencia» y la «pericia» en el sentido E-E-A-T importa una autoría nombrada y verificable.
Esto es lo que deberías hacer: En contenidos editoriales, nombra a un autor y enlaza una página de autor; márcalo también como JSON-LD «Person».
Sin fecha visible ni marcada
No hay fecha de publicación ni de modificación reconocible (ni <time>, ni article:published_time, ni datePublished en el JSON-LD). Para muchas preguntas, los sistemas de IA prefieren fuentes actuales.
Esto es lo que deberías hacer: En contenidos con referencia temporal, muestra una fecha visiblemente y marca datePublished / dateModified en el JSON-LD.
Correcto (7)
- El contenido principal está en el HTML sin JavaScript.
- Hay datos estructurados (JSON-LD). — WebSite, NewsMediaOrganization
- Exactamente un encabezado H1.
- Hay una URL canónica definida.
- El sitemap es accesible.
- Tiempo de respuesta del servidor rápido.
- Sin noindex — la página puede indexarse.
Próximos pasos
- Rastreadores de IA importantes están bloqueados en robots.txt. Comprueba por bot si el bloqueo es intencionado. Para la visibilidad en IA deberían estar permitidos al menos GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot y Google-Extended.
- El servidor bloquea bots aunque robots.txt los permite. Añade los agentes de usuario o rangos de IP de los rastreadores de IA deseados a una lista de permitidos en tu WAF / Cloudflare / cortafuegos. Verifícalos por DNS inverso, no solo por la cadena de agente de usuario.
- Título de página demasiado corto o largo. Redacta un título conciso que contenga el tema y, si procede, la marca.
Reanálisis semanal con aviso por correo ante cada cambio. En preparación — apunta tu dirección.
Método y límites
Comprobado el 4/9/2026. citeglass obtiene nytimes.com y sus archivos asociados (robots.txt, llms.txt, sitemap.xml) por HTTP — una vez como navegador normal, una vez por cada agente de usuario de rastreador de IA. No se ejecuta JavaScript. Tiempo hasta el primer byte: 235 ms.
Lo que esto no es: Ningún seguimiento de posiciones ni de citas, ninguna afirmación sobre si un modelo te nombra realmente, y ninguna comprobación de contenido cargado mediante JavaScript. Una instantánea desde la perspectiva de una IP de servidor.