Comprobado el 24/9/2026 · https://www.heise.de/
Hay 1 bloqueos críticos para la localización por IA — corrígelos primero.
Matriz de rastreadores de IA
Por cada bot: qué permite tu robots.txt — y qué devuelve realmente tu servidor al agente de usuario del bot. Filas resaltadas en rojo: robots lo permite, pero el servidor lo bloquea (normalmente una regla de WAF o de protección anti-bots).
| Bot | Operador | robots.txt | Respuesta del servidor |
|---|---|---|---|
| GPTBot | OpenAI | permitido | 200 + contenido |
| OAI-SearchBot | OpenAI | permitido | 200 + contenido |
| ChatGPT-User | OpenAI | permitido | 200 + contenido |
| ClaudeBot | Anthropic | permitido | 200 + contenido |
| Claude-SearchBot | Anthropic | permitido | 200 + contenido |
| Claude-User | Anthropic | permitido | 200 + contenido |
| PerplexityBot | Perplexity | permitido | 200 + contenido |
| Perplexity-User | Perplexity | permitido | 200 + contenido |
| Google-Extended | Google (Gemini-Training) | bloqueado | — |
| Googlebot | Google (KI-Übersichten) | permitido (vía User-agent: *) | 200 + contenido |
| CCBot | Common Crawl (Trainingsdaten vieler LLMs) | bloqueado | 200 + contenido |
| Bytespider | ByteDance (Doubao) | bloqueado | 200 + contenido |
| Amazonbot | Amazon (Alexa/Rufus) | bloqueado | 200 + contenido |
| Applebot-Extended | Apple (Intelligence-Training) | bloqueado | — |
| Meta-ExternalAgent | Meta (Llama/Meta AI) | bloqueado | 200 + contenido |
¿Cómo se calcula la puntuación?
| Hay bots de búsqueda de IA bloqueados en robots.txt | -8 |
| Título de página demasiado corto o largo | -6 |
| No exactamente un encabezado H1 | -5 |
| Sin llms.txt | -5 |
| Sin esquema Organization | -4 |
| Sin señal de autor o autoría | -4 |
| Sin enlaces sameAs | -3 |
| Sin marcado FAQ o HowTo | -2 |
| Resultado | 63 / 100 |
Acceso para rastreadores de IA
Hay bots de búsqueda de IA bloqueados en robots.txt
Tu robots.txt bloquea 1 bots que obtienen contenido para las respuestas de asistentes de IA y buscadores: Google-Extended. Mientras estén bloqueados, tu sitio no puede aparecer allí como fuente.
Esto es lo que deberías hacer: Comprueba para cada bot si el bloqueo es intencionado. Si solo quieres excluir el entrenamiento de IA, bloquea los bots de entrenamiento (GPTBot, ClaudeBot, Google-Extended) y permite los bots de búsqueda.
Estructura y comprensión por la máquina
Título de página demasiado corto o largo
El <title> tiene 67 caracteres. Unos 30 a 60 caracteres son razonables: lo bastante descriptivo para nombrar el tema, lo bastante corto para no cortarse.
Esto es lo que deberías hacer: Redacta un título conciso que contenga el tema y, si procede, la marca.
No exactamente un encabezado H1
La página tiene 0 encabezados H1. Un H1 único e inequívoco indica a personas y máquinas el tema principal de la página.
Esto es lo que deberías hacer: Define exactamente un H1 que nombre el tema principal de la página. Todo lo demás empieza en H2.
Sin llms.txt
No hay ningún archivo en /llms.txt. llms.txt es un breve resumen en Markdown de tus contenidos clave que algunos sistemas de IA usan para orientarse.
Esto es lo que deberías hacer: Crea un /llms.txt: un H1 con el nombre, un párrafo corto sobre la oferta y una lista de enlaces a las páginas centrales.
# Tu empresa > Descripción en una frase. ## Páginas clave - [Producto](https://tu-dominio.es/producto): … - [Precios](https://tu-dominio.es/precios): … - [Quiénes somos](https://tu-dominio.es/quienes-somos): …
Sin esquema Organization
Hay JSON-LD, pero ninguna entrada «Organization». Los sistemas de IA sitúan entonces peor tu marca como entidad distinta y la vinculan peor con fuentes externas.
Esto es lo que deberías hacer: Añade un esquema «Organization» con name, url, logo y sameAs (enlaces a tus perfiles oficiales).
Sin marcado FAQ o HowTo
El contenido de preguntas y respuestas y de paso a paso es más difícil de reconocer como respuesta directamente citable para los sistemas de IA sin marcado FAQPage o HowTo.
Esto es lo que deberías hacer: Donde la página responda preguntas reales o dé instrucciones, márcala como FAQPage o HowTo (sin marcado sin contenido visiblemente correspondiente).
Señales de confianza y de entidad (E-E-A-T)
Sin señal de autor o autoría
No hay autor reconocible (ni meta etiqueta, ni rel=author, ni JSON-LD Person). Para la «experiencia» y la «pericia» en el sentido E-E-A-T importa una autoría nombrada y verificable.
Esto es lo que deberías hacer: En contenidos editoriales, nombra a un autor y enlaza una página de autor; márcalo también como JSON-LD «Person».
Sin enlaces sameAs
En el JSON-LD falta «sameAs». Permite a los sistemas de IA asignar claramente tu marca o persona a entidades conocidas (Wikidata, LinkedIn, directorios sectoriales).
Esto es lo que deberías hacer: Añade un «sameAs» en Organization o Person con las URL de tus perfiles oficiales y fichas de directorio.
Correcto (6)
- El contenido principal está en el HTML sin JavaScript.
- Hay datos estructurados (JSON-LD). — ItemList, Thing
- Hay una URL canónica definida.
- El sitemap es accesible.
- Tiempo de respuesta del servidor rápido.
- Sin noindex — la página puede indexarse.
Próximos pasos
- Hay bots de búsqueda de IA bloqueados en robots.txt. Comprueba para cada bot si el bloqueo es intencionado. Si solo quieres excluir el entrenamiento de IA, bloquea los bots de entrenamiento (GPTBot, ClaudeBot, Google-Extended) y permite los bots de búsqueda.
- Título de página demasiado corto o largo. Redacta un título conciso que contenga el tema y, si procede, la marca.
- No exactamente un encabezado H1. Define exactamente un H1 que nombre el tema principal de la página. Todo lo demás empieza en H2.
Reanálisis semanal con aviso por correo ante cada cambio. En preparación — apunta tu dirección.
Método y límites
Comprobado el 24/9/2026. citeglass obtiene heise.de y sus archivos asociados (robots.txt, llms.txt, sitemap.xml) por HTTP — una vez como navegador normal, una vez por cada agente de usuario de rastreador de IA. No se ejecuta JavaScript. Tiempo hasta el primer byte: 65 ms.
Lo que esto no es: Ningún seguimiento de posiciones ni de citas, ninguna afirmación sobre si un modelo te nombra realmente, y ninguna comprobación de contenido cargado mediante JavaScript. Una instantánea desde la perspectiva de una IP de servidor.