Comprobado el 4/9/2026 · https://example.com/
Sin bloqueos duros, pero 4 puntos debilitan la localización por IA.
Matriz de rastreadores de IA
Por cada bot: qué permite tu robots.txt — y qué devuelve realmente tu servidor al agente de usuario del bot. Filas resaltadas en rojo: robots lo permite, pero el servidor lo bloquea (normalmente una regla de WAF o de protección anti-bots).
| Bot | Operador | robots.txt | Respuesta del servidor |
|---|---|---|---|
| GPTBot | OpenAI | no mencionado | 200 + contenido |
| OAI-SearchBot | OpenAI | no mencionado | 200 + contenido |
| ChatGPT-User | OpenAI | no mencionado | 200 + contenido |
| ClaudeBot | Anthropic | no mencionado | 200 + contenido |
| Claude-SearchBot | Anthropic | no mencionado | 200 + contenido |
| Claude-User | Anthropic | no mencionado | 200 + contenido |
| PerplexityBot | Perplexity | no mencionado | 200 + contenido |
| Perplexity-User | Perplexity | no mencionado | 200 + contenido |
| Google-Extended | Google (Gemini-Training) | no mencionado | — |
| Googlebot | Google (KI-Übersichten) | no mencionado | 200 + contenido |
| CCBot | Common Crawl (Trainingsdaten vieler LLMs) | no mencionado | 200 + contenido |
| Bytespider | ByteDance (Doubao) | no mencionado | 200 + contenido |
| Amazonbot | Amazon (Alexa/Rufus) | no mencionado | 200 + contenido |
| Applebot-Extended | Apple (Intelligence-Training) | no mencionado | — |
| Meta-ExternalAgent | Meta (Llama/Meta AI) | no mencionado | 200 + contenido |
¿Cómo se calcula la puntuación?
| Muy poco texto en el HTML | -10 |
| Sin datos estructurados (JSON-LD) | -8 |
| Título de página demasiado corto o largo | -6 |
| Meta descripción ausente o inadecuada | -5 |
| Sin llms.txt | -5 |
| Sin señal de autor o autoría | -4 |
| No se encontró sitemap.xml | -4 |
| Sin enlaces sameAs | -3 |
| Sin enlace a aviso legal / quiénes somos / contacto | -3 |
| Sin fecha visible ni marcada | -3 |
| Sin URL canónica | -3 |
| No se encontró robots.txt | -2 |
| Resultado | 44 / 100 |
Acceso para rastreadores de IA
No se encontró robots.txt
No había ningún archivo válido accesible en /robots.txt. Los rastreadores asumen entonces «todo permitido» — funciona, pero no tienes control ni señal de sitemap.
Esto es lo que deberías hacer: Crea un robots.txt en la raíz, al menos con una referencia de sitemap y tus reglas allow/disallow deseadas.
User-agent: * Allow: / Sitemap: https://tu-dominio.es/sitemap.xml
Contenido sin JavaScript
Muy poco texto en el HTML
El HTML inicial solo contiene unos 142 caracteres de texto visible. Es apenas suficiente para que los sistemas de IA capten el tema de la página con seguridad.
Esto es lo que deberías hacer: Asegúrate de que el contenido real esté completo en el HTML y no en imágenes, iframes o bloques cargados mediante JavaScript.
Estructura y comprensión por la máquina
Sin datos estructurados (JSON-LD)
La página no contiene JSON-LD. Los datos estructurados ayudan a los sistemas de IA a reconocer sin ambigüedad entidades, autor, organización, fecha y tipo de página — sin ellos, todo debe deducirse del texto.
Esto es lo que deberías hacer: Añade al menos un esquema «Organization» y uno acorde al tipo de página (Article, Product, FAQPage …) como JSON-LD en el <head>.
<script type="application/ld+json">
{"@context":"https://schema.org","@type":"Organization",
"name":"Tu empresa","url":"https://tu-dominio.es",
"sameAs":["https://www.linkedin.com/company/…"]}
</script>Título de página demasiado corto o largo
El <title> tiene 14 caracteres. Unos 30 a 60 caracteres son razonables: lo bastante descriptivo para nombrar el tema, lo bastante corto para no cortarse.
Esto es lo que deberías hacer: Redacta un título conciso que contenga el tema y, si procede, la marca.
Meta descripción ausente o inadecuada
La meta descripción tiene 0 caracteres. Suele ser lo primero que los sistemas de IA y los buscadores leen como resumen de la página.
Esto es lo que deberías hacer: Redacta un resumen autónomo de la página en una o dos frases (unos 120 a 200 caracteres), no una lista de palabras clave.
Sin llms.txt
No hay ningún archivo en /llms.txt. llms.txt es un breve resumen en Markdown de tus contenidos clave que algunos sistemas de IA usan para orientarse.
Esto es lo que deberías hacer: Crea un /llms.txt: un H1 con el nombre, un párrafo corto sobre la oferta y una lista de enlaces a las páginas centrales.
# Tu empresa > Descripción en una frase. ## Páginas clave - [Producto](https://tu-dominio.es/producto): … - [Precios](https://tu-dominio.es/precios): … - [Quiénes somos](https://tu-dominio.es/quienes-somos): …
Señales de confianza y de entidad (E-E-A-T)
Sin señal de autor o autoría
No hay autor reconocible (ni meta etiqueta, ni rel=author, ni JSON-LD Person). Para la «experiencia» y la «pericia» en el sentido E-E-A-T importa una autoría nombrada y verificable.
Esto es lo que deberías hacer: En contenidos editoriales, nombra a un autor y enlaza una página de autor; márcalo también como JSON-LD «Person».
Sin enlaces sameAs
En el JSON-LD falta «sameAs». Permite a los sistemas de IA asignar claramente tu marca o persona a entidades conocidas (Wikidata, LinkedIn, directorios sectoriales).
Esto es lo que deberías hacer: Añade un «sameAs» en Organization o Person con las URL de tus perfiles oficiales y fichas de directorio.
Sin enlace a aviso legal / quiénes somos / contacto
No se reconoce ningún enlace a un aviso legal, una página «Quiénes somos» o un contacto en la página comprobada. Esas páginas son una fuerte señal de confianza y ayudan a la asignación de entidad.
Esto es lo que deberías hacer: Enlaza el aviso legal o «Quiénes somos» y el contacto de forma visible, normalmente en el pie de cada página.
Sin fecha visible ni marcada
No hay fecha de publicación ni de modificación reconocible (ni <time>, ni article:published_time, ni datePublished en el JSON-LD). Para muchas preguntas, los sistemas de IA prefieren fuentes actuales.
Esto es lo que deberías hacer: En contenidos con referencia temporal, muestra una fecha visiblemente y marca datePublished / dateModified en el JSON-LD.
Base técnica
No se encontró sitemap.xml
No había ningún sitemap XML válido accesible en /sitemap.xml y robots.txt no menciona ninguno. Un sitemap ayuda a los rastreadores a encontrar todas las URL relevantes.
Esto es lo que deberías hacer: Genera un sitemap.xml con todas las URL indexables y refiérelo en robots.txt.
Sin URL canónica
La página no define un <link rel="canonical">. Sin canonical puede quedar poco claro qué versión es la de referencia cuando existen varias variantes de URL.
Esto es lo que deberías hacer: Define un <link rel="canonical"> autorreferente con la URL preferida en cada página.
Correcto (2)
- Exactamente un encabezado H1.
- Tiempo de respuesta del servidor rápido.
Próximos pasos
- Muy poco texto en el HTML. Asegúrate de que el contenido real esté completo en el HTML y no en imágenes, iframes o bloques cargados mediante JavaScript.
- Sin datos estructurados (JSON-LD). Añade al menos un esquema «Organization» y uno acorde al tipo de página (Article, Product, FAQPage …) como JSON-LD en el <head>.
- Título de página demasiado corto o largo. Redacta un título conciso que contenga el tema y, si procede, la marca.
Reanálisis semanal con aviso por correo ante cada cambio. En preparación — apunta tu dirección.
Método y límites
Comprobado el 4/9/2026. citeglass obtiene example.com y sus archivos asociados (robots.txt, llms.txt, sitemap.xml) por HTTP — una vez como navegador normal, una vez por cada agente de usuario de rastreador de IA. No se ejecuta JavaScript. Tiempo hasta el primer byte: 12 ms.
Lo que esto no es: Ningún seguimiento de posiciones ni de citas, ninguna afirmación sobre si un modelo te nombra realmente, y ninguna comprobación de contenido cargado mediante JavaScript. Una instantánea desde la perspectiva de una IP de servidor.