Comprobado el 23/9/2026 · https://rehau-termopane.ro/
Hay 1 bloqueos críticos para la localización por IA — corrígelos primero.
Matriz de rastreadores de IA
Por cada bot: qué permite tu robots.txt — y qué devuelve realmente tu servidor al agente de usuario del bot. Filas resaltadas en rojo: robots lo permite, pero el servidor lo bloquea (normalmente una regla de WAF o de protección anti-bots).
| Bot | Operador | robots.txt | Respuesta del servidor |
|---|---|---|---|
| GPTBot | OpenAI | no mencionado | bloqueado (403 / WAF) |
| OAI-SearchBot | OpenAI | no mencionado | 200 + contenido |
| ChatGPT-User | OpenAI | no mencionado | 200 + contenido |
| ClaudeBot | Anthropic | no mencionado | 200 + contenido |
| Claude-SearchBot | Anthropic | no mencionado | error / tiempo agotado |
| Claude-User | Anthropic | no mencionado | 200 + contenido |
| PerplexityBot | Perplexity | no mencionado | error / tiempo agotado |
| Perplexity-User | Perplexity | no mencionado | error / tiempo agotado |
| Google-Extended | Google (Gemini-Training) | no mencionado | — |
| Googlebot | Google (KI-Übersichten) | no mencionado | 200 + contenido |
| CCBot | Common Crawl (Trainingsdaten vieler LLMs) | no mencionado | 200 + contenido |
| Bytespider | ByteDance (Doubao) | no mencionado | 200 + contenido |
| Amazonbot | Amazon (Alexa/Rufus) | no mencionado | 200 + contenido |
| Applebot-Extended | Apple (Intelligence-Training) | no mencionado | — |
| Meta-ExternalAgent | Meta (Llama/Meta AI) | no mencionado | bloqueado (403 / WAF) |
¿Cómo se calcula la puntuación?
| El servidor bloquea bots aunque robots.txt los permite | -12 |
| Sin llms.txt | -5 |
| No se encontró sitemap.xml | -4 |
| Se saltan niveles de encabezado | -3 |
| Sin enlaces sameAs | -3 |
| No se encontró robots.txt | -2 |
| Sin marcado FAQ o HowTo | -2 |
| Resultado | 69 / 100 |
Acceso para rastreadores de IA
El servidor bloquea bots aunque robots.txt los permite
Para 2 bot(s) de OpenAI, Meta (Llama/Meta AI), robots.txt dice «permitido», pero el servidor responde con un 403 o una página de protección anti-bots. Suele ser una regla de WAF, cortafuegos o CDN que excluye al rastreador saltándose robots.txt.
Esto es lo que deberías hacer: Añade los agentes de usuario o rangos de IP de los rastreadores de IA deseados a una lista de permitidos en tu WAF / Cloudflare / cortafuegos. Verifícalos por DNS inverso, no solo por la cadena de agente de usuario.
No se encontró robots.txt
No había ningún archivo válido accesible en /robots.txt. Los rastreadores asumen entonces «todo permitido» — funciona, pero no tienes control ni señal de sitemap.
Esto es lo que deberías hacer: Crea un robots.txt en la raíz, al menos con una referencia de sitemap y tus reglas allow/disallow deseadas.
User-agent: * Allow: / Sitemap: https://tu-dominio.es/sitemap.xml
Estructura y comprensión por la máquina
Sin llms.txt
No hay ningún archivo en /llms.txt. llms.txt es un breve resumen en Markdown de tus contenidos clave que algunos sistemas de IA usan para orientarse.
Esto es lo que deberías hacer: Crea un /llms.txt: un H1 con el nombre, un párrafo corto sobre la oferta y una lista de enlaces a las páginas centrales.
# Tu empresa > Descripción en una frase. ## Páginas clave - [Producto](https://tu-dominio.es/producto): … - [Precios](https://tu-dominio.es/precios): … - [Quiénes somos](https://tu-dominio.es/quienes-somos): …
Se saltan niveles de encabezado
La secuencia de encabezados salta al menos un nivel (p. ej. H2 directamente a H4). Esto dificulta reconstruir automáticamente la estructura del contenido.
Esto es lo que deberías hacer: Usa los niveles de encabezado sin huecos y en orden (H1 → H2 → H3 …).
Sin marcado FAQ o HowTo
El contenido de preguntas y respuestas y de paso a paso es más difícil de reconocer como respuesta directamente citable para los sistemas de IA sin marcado FAQPage o HowTo.
Esto es lo que deberías hacer: Donde la página responda preguntas reales o dé instrucciones, márcala como FAQPage o HowTo (sin marcado sin contenido visiblemente correspondiente).
Señales de confianza y de entidad (E-E-A-T)
Sin enlaces sameAs
En el JSON-LD falta «sameAs». Permite a los sistemas de IA asignar claramente tu marca o persona a entidades conocidas (Wikidata, LinkedIn, directorios sectoriales).
Esto es lo que deberías hacer: Añade un «sameAs» en Organization o Person con las URL de tus perfiles oficiales y fichas de directorio.
Base técnica
No se encontró sitemap.xml
No había ningún sitemap XML válido accesible en /sitemap.xml y robots.txt no menciona ninguno. Un sitemap ayuda a los rastreadores a encontrar todas las URL relevantes.
Esto es lo que deberías hacer: Genera un sitemap.xml con todas las URL indexables y refiérelo en robots.txt.
Correcto (8)
- El contenido principal está en el HTML sin JavaScript.
- Hay datos estructurados (JSON-LD). — HomeAndConstructionBusiness, Organization, WebSite, ImageObject, WebPage, Person, Article, VideoObject
- La organización está marcada como JSON-LD.
- Exactamente un encabezado H1.
- Hay una URL canónica definida.
- El título de la página tiene una longitud razonable.
- Hay una señal de autoría.
- Tiempo de respuesta del servidor rápido.
Próximos pasos
- El servidor bloquea bots aunque robots.txt los permite. Añade los agentes de usuario o rangos de IP de los rastreadores de IA deseados a una lista de permitidos en tu WAF / Cloudflare / cortafuegos. Verifícalos por DNS inverso, no solo por la cadena de agente de usuario.
- Sin llms.txt. Crea un /llms.txt: un H1 con el nombre, un párrafo corto sobre la oferta y una lista de enlaces a las páginas centrales.
- No se encontró sitemap.xml. Genera un sitemap.xml con todas las URL indexables y refiérelo en robots.txt.
Reanálisis semanal con aviso por correo ante cada cambio. En preparación — apunta tu dirección.
Método y límites
Comprobado el 23/9/2026. citeglass obtiene rehau-termopane.ro y sus archivos asociados (robots.txt, llms.txt, sitemap.xml) por HTTP — una vez como navegador normal, una vez por cada agente de usuario de rastreador de IA. No se ejecuta JavaScript. Tiempo hasta el primer byte: 774 ms.
Lo que esto no es: Ningún seguimiento de posiciones ni de citas, ninguna afirmación sobre si un modelo te nombra realmente, y ninguna comprobación de contenido cargado mediante JavaScript. Una instantánea desde la perspectiva de una IP de servidor.