Español
citeglass · Comprobación de visibilidad en IA

Comprobado el 4/9/2026 · https://www.nytimes.com/

Hay 2 bloqueos críticos para la localización por IA — corrígelos primero.

F
38 / 100
2 críticos · 1 por revisar

Matriz de rastreadores de IA

Por cada bot: qué permite tu robots.txt — y qué devuelve realmente tu servidor al agente de usuario del bot. Filas resaltadas en rojo: robots lo permite, pero el servidor lo bloquea (normalmente una regla de WAF o de protección anti-bots).

BotOperadorrobots.txtRespuesta del servidor
GPTBotOpenAIbloqueadobloqueado (403 / WAF)
OAI-SearchBotOpenAIbloqueadobloqueado (403 / WAF)
ChatGPT-UserOpenAIbloqueadobloqueado (403 / WAF)
ClaudeBotAnthropicbloqueadobloqueado (403 / WAF)
Claude-SearchBotAnthropicbloqueadobloqueado (403 / WAF)
Claude-UserAnthropicbloqueadobloqueado (403 / WAF)
PerplexityBotPerplexitybloqueadobloqueado (403 / WAF)
Perplexity-UserPerplexitybloqueadobloqueado (403 / WAF)
Google-ExtendedGoogle (Gemini-Training)bloqueado
GooglebotGoogle (KI-Übersichten)permitido200 + contenido
CCBotCommon Crawl (Trainingsdaten vieler LLMs)bloqueadobloqueado (403 / WAF)
BytespiderByteDance (Doubao)bloqueadobloqueado (403 / WAF)
AmazonbotAmazon (Alexa/Rufus)permitidobloqueado (403 / WAF)
Applebot-ExtendedApple (Intelligence-Training)bloqueado
Meta-ExternalAgentMeta (Llama/Meta AI)bloqueadobloqueado (403 / WAF)
¿Cómo se calcula la puntuación?
Rastreadores de IA importantes están bloqueados en robots.txt-32
El servidor bloquea bots aunque robots.txt los permite-6
Título de página demasiado corto o largo-6
Sin llms.txt-5
Sin esquema Organization-4
Sin señal de autor o autoría-4
Sin fecha visible ni marcada-3
Sin marcado FAQ o HowTo-2
Resultado38 / 100

Acceso para rastreadores de IA

crítico

Rastreadores de IA importantes están bloqueados en robots.txt

Tu robots.txt prohíbe el acceso a 5 rastreadores de IA centrales: GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Google-Extended. Esos sistemas no pueden entonces cargar tu contenido ni usarlo como fuente.

Esto es lo que deberías hacer: Comprueba por bot si el bloqueo es intencionado. Para la visibilidad en IA deberían estar permitidos al menos GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot y Google-Extended.

User-agent: GPTBot
Allow: /

User-agent: PerplexityBot
Allow: /
crítico

El servidor bloquea bots aunque robots.txt los permite

Para 1 bot(s) de Amazon (Alexa/Rufus), robots.txt dice «permitido», pero el servidor responde con un 403 o una página de protección anti-bots. Suele ser una regla de WAF, cortafuegos o CDN que excluye al rastreador saltándose robots.txt.

Esto es lo que deberías hacer: Añade los agentes de usuario o rangos de IP de los rastreadores de IA deseados a una lista de permitidos en tu WAF / Cloudflare / cortafuegos. Verifícalos por DNS inverso, no solo por la cadena de agente de usuario.

Estructura y comprensión por la máquina

por revisar

Título de página demasiado corto o largo

El <title> tiene 66 caracteres. Unos 30 a 60 caracteres son razonables: lo bastante descriptivo para nombrar el tema, lo bastante corto para no cortarse.

Esto es lo que deberías hacer: Redacta un título conciso que contenga el tema y, si procede, la marca.

aviso

Sin llms.txt

No hay ningún archivo en /llms.txt. llms.txt es un breve resumen en Markdown de tus contenidos clave que algunos sistemas de IA usan para orientarse.

Esto es lo que deberías hacer: Crea un /llms.txt: un H1 con el nombre, un párrafo corto sobre la oferta y una lista de enlaces a las páginas centrales.

# Tu empresa

> Descripción en una frase.

## Páginas clave
- [Producto](https://tu-dominio.es/producto): …
- [Precios](https://tu-dominio.es/precios): …
- [Quiénes somos](https://tu-dominio.es/quienes-somos): …
aviso

Sin esquema Organization

Hay JSON-LD, pero ninguna entrada «Organization». Los sistemas de IA sitúan entonces peor tu marca como entidad distinta y la vinculan peor con fuentes externas.

Esto es lo que deberías hacer: Añade un esquema «Organization» con name, url, logo y sameAs (enlaces a tus perfiles oficiales).

aviso

Sin marcado FAQ o HowTo

El contenido de preguntas y respuestas y de paso a paso es más difícil de reconocer como respuesta directamente citable para los sistemas de IA sin marcado FAQPage o HowTo.

Esto es lo que deberías hacer: Donde la página responda preguntas reales o dé instrucciones, márcala como FAQPage o HowTo (sin marcado sin contenido visiblemente correspondiente).

Señales de confianza y de entidad (E-E-A-T)

aviso

Sin señal de autor o autoría

No hay autor reconocible (ni meta etiqueta, ni rel=author, ni JSON-LD Person). Para la «experiencia» y la «pericia» en el sentido E-E-A-T importa una autoría nombrada y verificable.

Esto es lo que deberías hacer: En contenidos editoriales, nombra a un autor y enlaza una página de autor; márcalo también como JSON-LD «Person».

aviso

Sin fecha visible ni marcada

No hay fecha de publicación ni de modificación reconocible (ni <time>, ni article:published_time, ni datePublished en el JSON-LD). Para muchas preguntas, los sistemas de IA prefieren fuentes actuales.

Esto es lo que deberías hacer: En contenidos con referencia temporal, muestra una fecha visiblemente y marca datePublished / dateModified en el JSON-LD.

Correcto (7)
  • El contenido principal está en el HTML sin JavaScript.
  • Hay datos estructurados (JSON-LD). — WebSite, NewsMediaOrganization
  • Exactamente un encabezado H1.
  • Hay una URL canónica definida.
  • El sitemap es accesible.
  • Tiempo de respuesta del servidor rápido.
  • Sin noindex — la página puede indexarse.

Próximos pasos

  1. Rastreadores de IA importantes están bloqueados en robots.txt. Comprueba por bot si el bloqueo es intencionado. Para la visibilidad en IA deberían estar permitidos al menos GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot y Google-Extended.
  2. El servidor bloquea bots aunque robots.txt los permite. Añade los agentes de usuario o rangos de IP de los rastreadores de IA deseados a una lista de permitidos en tu WAF / Cloudflare / cortafuegos. Verifícalos por DNS inverso, no solo por la cadena de agente de usuario.
  3. Título de página demasiado corto o largo. Redacta un título conciso que contenga el tema y, si procede, la marca.
Supervisar esta página

Reanálisis semanal con aviso por correo ante cada cambio. En preparación — apunta tu dirección.

Método y límites

Comprobado el 4/9/2026. citeglass obtiene nytimes.com y sus archivos asociados (robots.txt, llms.txt, sitemap.xml) por HTTP — una vez como navegador normal, una vez por cada agente de usuario de rastreador de IA. No se ejecuta JavaScript. Tiempo hasta el primer byte: 235 ms.

Lo que esto no es: Ningún seguimiento de posiciones ni de citas, ninguna afirmación sobre si un modelo te nombra realmente, y ninguna comprobación de contenido cargado mediante JavaScript. Una instantánea desde la perspectiva de una IP de servidor.

Comprobar otra web