Español
citeglass · Comprobación de visibilidad en IA

Comprobado el 24/9/2026 · https://www.nytimes.com/

Hay 2 bloqueos críticos para la localización por IA — corrígelos primero.

F
1 / 100
2 críticos · 5 por revisar
Desde el último análisis: Puntuación -37 · 2 corregidos · 8 nuevos

Matriz de rastreadores de IA

Por cada bot: qué permite tu robots.txt — y qué devuelve realmente tu servidor al agente de usuario del bot. Filas resaltadas en rojo: robots lo permite, pero el servidor lo bloquea (normalmente una regla de WAF o de protección anti-bots).

BotOperadorrobots.txtRespuesta del servidor
GPTBotOpenAIbloqueadobloqueado (403 / WAF)
OAI-SearchBotOpenAIbloqueadobloqueado (403 / WAF)
ChatGPT-UserOpenAIbloqueadobloqueado (403 / WAF)
ClaudeBotAnthropicbloqueadobloqueado (403 / WAF)
Claude-SearchBotAnthropicbloqueadobloqueado (403 / WAF)
Claude-UserAnthropicbloqueadobloqueado (403 / WAF)
PerplexityBotPerplexitybloqueadobloqueado (403 / WAF)
Perplexity-UserPerplexitybloqueadobloqueado (403 / WAF)
Google-ExtendedGoogle (Gemini-Training)bloqueado—
GooglebotGoogle (KI-Übersichten)permitidobloqueado (403 / WAF)
CCBotCommon Crawl (Trainingsdaten vieler LLMs)bloqueadobloqueado (403 / WAF)
BytespiderByteDance (Doubao)bloqueadobloqueado (403 / WAF)
AmazonbotAmazon (Alexa/Rufus)permitidobloqueado (403 / WAF)
Applebot-ExtendedApple (Intelligence-Training)bloqueado—
Meta-ExternalAgentMeta (Llama/Meta AI)bloqueadobloqueado (403 / WAF)
¿Cómo se calcula la puntuación?
Hay bots de búsqueda de IA bloqueados en robots.txt-32
El servidor bloquea bots aunque robots.txt los permite-12
Muy poco texto en el HTML-10
Sin datos estructurados (JSON-LD)-8
Título de página demasiado corto o largo-6
No exactamente un encabezado H1-5
Meta descripción ausente o inadecuada-5
Sin llms.txt-5
Sin señal de autor o autoría-4
Sin enlaces sameAs-3
Sin enlace a aviso legal / quiénes somos / contacto-3
Sin fecha visible ni marcada-3
Sin URL canónica-3
Resultado1 / 100

Acceso para rastreadores de IA

crítico

Hay bots de búsqueda de IA bloqueados en robots.txt

Tu robots.txt bloquea 6 bots que obtienen contenido para las respuestas de asistentes de IA y buscadores: OAI-SearchBot, ChatGPT-User, Claude-SearchBot, Claude-User, PerplexityBot, Perplexity-User. Mientras estén bloqueados, tu sitio no puede aparecer allí como fuente.

Esto es lo que deberías hacer: Comprueba para cada bot si el bloqueo es intencionado. Si solo quieres excluir el entrenamiento de IA, bloquea los bots de entrenamiento (GPTBot, ClaudeBot, Google-Extended) y permite los bots de búsqueda.

User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: Claude-User
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Perplexity-User
Allow: /
crítico

El servidor bloquea bots aunque robots.txt los permite

Para 2 bot(s) de Google (KI-Übersichten), Amazon (Alexa/Rufus), robots.txt dice «permitido», pero el servidor responde con un 403 o una página de protección anti-bots. Suele ser una regla de WAF, cortafuegos o CDN que excluye al rastreador saltándose robots.txt.

Esto es lo que deberías hacer: Añade los agentes de usuario o rangos de IP de los rastreadores de IA deseados a una lista de permitidos en tu WAF / Cloudflare / cortafuegos. Verifícalos por DNS inverso, no solo por la cadena de agente de usuario.

aviso

Entrenamiento de IA excluido

Tu robots.txt bloquea rastreadores que recopilan contenido para entrenar modelos de lenguaje: GPTBot, ClaudeBot, Google-Extended, CCBot, Applebot-Extended. Esto no impide las citas: los bots de búsqueda y recuperación como OAI-SearchBot, PerplexityBot y Googlebot para AI Overviews son independientes.

Esto es lo que deberías hacer: Nada que hacer si la exclusión es intencionada. Solo asegúrate de que los bots de búsqueda sigan permitidos.

Contenido sin JavaScript

por revisar

Muy poco texto en el HTML

El HTML inicial solo contiene unos 55 caracteres de texto visible. Es apenas suficiente para que los sistemas de IA capten el tema de la página con seguridad.

Esto es lo que deberías hacer: Asegúrate de que el contenido real esté completo en el HTML y no en imágenes, iframes o bloques cargados mediante JavaScript.

Estructura y comprensión por la máquina

por revisar

Sin datos estructurados (JSON-LD)

La página no contiene JSON-LD. Los datos estructurados ayudan a los sistemas de IA a reconocer sin ambigüedad entidades, autor, organización, fecha y tipo de página — sin ellos, todo debe deducirse del texto.

Esto es lo que deberías hacer: Añade al menos un esquema «Organization» y uno acorde al tipo de página (Article, Product, FAQPage …) como JSON-LD en el <head>.

<script type="application/ld+json">
{"@context":"https://schema.org","@type":"Organization",
 "name":"Tu empresa","url":"https://tu-dominio.es",
 "sameAs":["https://www.linkedin.com/company/…"]}
</script>
por revisar

Título de página demasiado corto o largo

El <title> tiene 11 caracteres. Unos 30 a 60 caracteres son razonables: lo bastante descriptivo para nombrar el tema, lo bastante corto para no cortarse.

Esto es lo que deberías hacer: Redacta un título conciso que contenga el tema y, si procede, la marca.

por revisar

No exactamente un encabezado H1

La página tiene 0 encabezados H1. Un H1 único e inequívoco indica a personas y máquinas el tema principal de la página.

Esto es lo que deberías hacer: Define exactamente un H1 que nombre el tema principal de la página. Todo lo demás empieza en H2.

por revisar

Meta descripción ausente o inadecuada

La meta descripción tiene 0 caracteres. Suele ser lo primero que los sistemas de IA y los buscadores leen como resumen de la página.

Esto es lo que deberías hacer: Redacta un resumen autónomo de la página en una o dos frases (unos 120 a 200 caracteres), no una lista de palabras clave.

aviso

Sin llms.txt

No hay ningún archivo en /llms.txt. llms.txt es un breve resumen en Markdown de tus contenidos clave que algunos sistemas de IA usan para orientarse.

Esto es lo que deberías hacer: Crea un /llms.txt: un H1 con el nombre, un párrafo corto sobre la oferta y una lista de enlaces a las páginas centrales.

# Tu empresa

> Descripción en una frase.

## Páginas clave
- [Producto](https://tu-dominio.es/producto): …
- [Precios](https://tu-dominio.es/precios): …
- [Quiénes somos](https://tu-dominio.es/quienes-somos): …

Señales de confianza y de entidad (E-E-A-T)

aviso

Sin señal de autor o autoría

No hay autor reconocible (ni meta etiqueta, ni rel=author, ni JSON-LD Person). Para la «experiencia» y la «pericia» en el sentido E-E-A-T importa una autoría nombrada y verificable.

Esto es lo que deberías hacer: En contenidos editoriales, nombra a un autor y enlaza una página de autor; márcalo también como JSON-LD «Person».

aviso

Sin enlaces sameAs

En el JSON-LD falta «sameAs». Permite a los sistemas de IA asignar claramente tu marca o persona a entidades conocidas (Wikidata, LinkedIn, directorios sectoriales).

Esto es lo que deberías hacer: Añade un «sameAs» en Organization o Person con las URL de tus perfiles oficiales y fichas de directorio.

aviso

Sin enlace a aviso legal / quiénes somos / contacto

No se reconoce ningún enlace a un aviso legal, una página «Quiénes somos» o un contacto en la página comprobada. Esas páginas son una fuerte señal de confianza y ayudan a la asignación de entidad.

Esto es lo que deberías hacer: Enlaza el aviso legal o «Quiénes somos» y el contacto de forma visible, normalmente en el pie de cada página.

aviso

Sin fecha visible ni marcada

No hay fecha de publicación ni de modificación reconocible (ni <time>, ni article:published_time, ni datePublished en el JSON-LD). Para muchas preguntas, los sistemas de IA prefieren fuentes actuales.

Esto es lo que deberías hacer: En contenidos con referencia temporal, muestra una fecha visiblemente y marca datePublished / dateModified en el JSON-LD.

Base técnica

aviso

Sin URL canónica

La página no define un <link rel="canonical">. Sin canonical puede quedar poco claro qué versión es la de referencia cuando existen varias variantes de URL.

Esto es lo que deberías hacer: Define un <link rel="canonical"> autorreferente con la URL preferida en cada página.

Correcto (3)
  • El sitemap es accesible.
  • Tiempo de respuesta del servidor rápido.
  • Sin noindex — la página puede indexarse.

Próximos pasos

  1. Hay bots de búsqueda de IA bloqueados en robots.txt. Comprueba para cada bot si el bloqueo es intencionado. Si solo quieres excluir el entrenamiento de IA, bloquea los bots de entrenamiento (GPTBot, ClaudeBot, Google-Extended) y permite los bots de búsqueda.
  2. El servidor bloquea bots aunque robots.txt los permite. Añade los agentes de usuario o rangos de IP de los rastreadores de IA deseados a una lista de permitidos en tu WAF / Cloudflare / cortafuegos. Verifícalos por DNS inverso, no solo por la cadena de agente de usuario.
  3. Muy poco texto en el HTML. Asegúrate de que el contenido real esté completo en el HTML y no en imágenes, iframes o bloques cargados mediante JavaScript.
Supervisar esta página

Reanálisis semanal con aviso por correo ante cada cambio. En preparación — apunta tu dirección.

Método y límites

Comprobado el 24/9/2026. citeglass obtiene nytimes.com y sus archivos asociados (robots.txt, llms.txt, sitemap.xml) por HTTP — una vez como navegador normal, una vez por cada agente de usuario de rastreador de IA. No se ejecuta JavaScript. Tiempo hasta el primer byte: 99 ms.

Lo que esto no es: Ningún seguimiento de posiciones ni de citas, ninguna afirmación sobre si un modelo te nombra realmente, y ninguna comprobación de contenido cargado mediante JavaScript. Una instantánea desde la perspectiva de una IP de servidor.

Comprobar otra web