Verificado em 04/09/2026 · https://example.org/
Sem bloqueios rígidos, mas 4 pontos enfraquecem a descoberta por IA.
Matriz de rastreadores de IA
Por cada bot: o que o seu robots.txt permite — e o que o seu servidor devolve realmente ao agente de utilizador do bot. Linhas destacadas a vermelho: o robots permite, mas o servidor bloqueia (normalmente uma regra de WAF ou de proteção anti-bots).
| Bot | Operador | robots.txt | Resposta do servidor |
|---|---|---|---|
| GPTBot | OpenAI | não mencionado | 200 + conteúdo |
| OAI-SearchBot | OpenAI | não mencionado | 200 + conteúdo |
| ChatGPT-User | OpenAI | não mencionado | 200 + conteúdo |
| ClaudeBot | Anthropic | não mencionado | 200 + conteúdo |
| Claude-SearchBot | Anthropic | não mencionado | 200 + conteúdo |
| Claude-User | Anthropic | não mencionado | 200 + conteúdo |
| PerplexityBot | Perplexity | não mencionado | 200 + conteúdo |
| Perplexity-User | Perplexity | não mencionado | 200 + conteúdo |
| Google-Extended | Google (Gemini-Training) | não mencionado | — |
| Googlebot | Google (KI-Übersichten) | não mencionado | 200 + conteúdo |
| CCBot | Common Crawl (Trainingsdaten vieler LLMs) | não mencionado | 200 + conteúdo |
| Bytespider | ByteDance (Doubao) | não mencionado | 200 + conteúdo |
| Amazonbot | Amazon (Alexa/Rufus) | não mencionado | 200 + conteúdo |
| Applebot-Extended | Apple (Intelligence-Training) | não mencionado | — |
| Meta-ExternalAgent | Meta (Llama/Meta AI) | não mencionado | 200 + conteúdo |
Como é calculada a pontuação?
| Muito pouco texto no HTML | -10 |
| Sem dados estruturados (JSON-LD) | -8 |
| Título da página demasiado curto ou demasiado longo | -6 |
| Meta descrição ausente ou inadequada | -5 |
| Sem llms.txt | -5 |
| Sem sinal de autor ou autoria | -4 |
| Nenhum sitemap.xml encontrado | -4 |
| Sem ligações sameAs | -3 |
| Sem ligação a informação legal / sobre / contacto | -3 |
| Sem data visível ou marcada | -3 |
| Sem URL canónica | -3 |
| Nenhum robots.txt encontrado | -2 |
| Resultado | 44 / 100 |
Acesso para rastreadores de IA
Nenhum robots.txt encontrado
Nenhum ficheiro válido estava acessível em /robots.txt. Os rastreadores assumem então «tudo permitido» — funciona, mas não tem controlo nem sinal de sitemap.
Isto é o que deve fazer: Crie um robots.txt na raiz, pelo menos com uma referência de sitemap e as suas regras allow/disallow pretendidas.
User-agent: * Allow: / Sitemap: https://o-seu-dominio.pt/sitemap.xml
Conteúdo sem JavaScript
Muito pouco texto no HTML
O HTML inicial contém apenas cerca de 142 caracteres de texto visível. É pouco para os sistemas de IA compreenderem com segurança o tema da página.
Isto é o que deve fazer: Garanta que o conteúdo real está totalmente no HTML e não em imagens, iframes ou blocos carregados via JavaScript.
Estrutura e compreensão pela máquina
Sem dados estruturados (JSON-LD)
A página não contém JSON-LD. Os dados estruturados ajudam os sistemas de IA a reconhecer sem ambiguidade entidades, autor, organização, data e tipo de página — sem eles, tudo tem de ser deduzido do texto.
Isto é o que deve fazer: Adicione pelo menos um esquema «Organization» e um adequado ao tipo de página (Article, Product, FAQPage …) como JSON-LD no <head>.
<script type="application/ld+json">
{"@context":"https://schema.org","@type":"Organization",
"name":"A sua empresa","url":"https://o-seu-dominio.pt",
"sameAs":["https://www.linkedin.com/company/…"]}
</script>Título da página demasiado curto ou demasiado longo
O <title> tem 14 caracteres. Cerca de 30 a 60 caracteres são razoáveis: descritivo o suficiente para nomear o tema, curto o suficiente para não ser cortado.
Isto é o que deve fazer: Escreva um título conciso que contenha o tema e, se pertinente, a marca.
Meta descrição ausente ou inadequada
A meta descrição tem 0 caracteres. É frequentemente a primeira coisa que os sistemas de IA e os motores de busca leem como resumo da página.
Isto é o que deve fazer: Escreva um resumo autónomo da página em uma ou duas frases (cerca de 120 a 200 caracteres), não uma sequência de palavras-chave.
Sem llms.txt
Não há qualquer ficheiro em /llms.txt. O llms.txt é uma breve visão geral em Markdown dos seus conteúdos-chave que alguns sistemas de IA usam para se orientarem.
Isto é o que deve fazer: Crie um /llms.txt: um H1 com o nome, um parágrafo curto sobre a oferta e uma lista de ligações às páginas centrais.
# A sua empresa > Descrição numa frase. ## Páginas-chave - [Produto](https://o-seu-dominio.pt/produto): … - [Preços](https://o-seu-dominio.pt/precos): … - [Sobre](https://o-seu-dominio.pt/sobre): …
Sinais de confiança e de entidade (E-E-A-T)
Sem sinal de autor ou autoria
Nenhum autor é reconhecível (nem meta tag, nem rel=author, nem JSON-LD Person). Para «experiência» e «perícia» no sentido E-E-A-T importa uma autoria nomeada e verificável.
Isto é o que deve fazer: Em conteúdos editoriais, nomeie um autor e ligue uma página de autor; marque-o também como JSON-LD «Person».
Sem ligações sameAs
No JSON-LD falta «sameAs». Permite aos sistemas de IA associar claramente a sua marca ou pessoa a entidades conhecidas (Wikidata, LinkedIn, diretórios do setor).
Isto é o que deve fazer: Adicione um «sameAs» em Organization ou Person com as URLs dos seus perfis oficiais e registos em diretórios.
Sem ligação a informação legal / sobre / contacto
Na página verificada não é reconhecível qualquer ligação a informação legal, a uma página «Sobre» ou a contacto. Essas páginas são um forte sinal de confiança e ajudam a associação de entidade.
Isto é o que deve fazer: Ligue a informação legal ou «Sobre» e o contacto de forma visível, normalmente no rodapé de cada página.
Sem data visível ou marcada
Nenhuma data de publicação ou modificação é reconhecível (nem <time>, nem article:published_time, nem datePublished no JSON-LD). Para muitas perguntas, os sistemas de IA preferem fontes atuais.
Isto é o que deve fazer: Em conteúdos com referência temporal, mostre uma data de forma visível e marque datePublished / dateModified no JSON-LD.
Base técnica
Nenhum sitemap.xml encontrado
Nenhum sitemap XML válido estava acessível em /sitemap.xml e o robots.txt não nomeia nenhum. Um sitemap ajuda os rastreadores a encontrar todas as URLs relevantes.
Isto é o que deve fazer: Gere um sitemap.xml com todas as URLs indexáveis e refira-o no robots.txt.
Sem URL canónica
A página não define um <link rel="canonical">. Sem canónica, pode ficar pouco claro qual a versão de referência quando existem várias variantes de URL.
Isto é o que deve fazer: Defina um <link rel="canonical"> autorreferente com a URL preferida em cada página.
Conforme (2)
- Exatamente um título H1.
- Tempo de resposta do servidor rápido.
Próximos passos
- Muito pouco texto no HTML. Garanta que o conteúdo real está totalmente no HTML e não em imagens, iframes ou blocos carregados via JavaScript.
- Sem dados estruturados (JSON-LD). Adicione pelo menos um esquema «Organization» e um adequado ao tipo de página (Article, Product, FAQPage …) como JSON-LD no <head>.
- Título da página demasiado curto ou demasiado longo. Escreva um título conciso que contenha o tema e, se pertinente, a marca.
Nova análise semanal com alerta por e-mail a cada alteração. Em preparação — introduza o seu endereço.
Método e limites
Verificado em 04/09/2026. O citeglass obtém example.org e os ficheiros associados (robots.txt, llms.txt, sitemap.xml) via HTTP — uma vez como navegador normal, uma vez por cada agente de utilizador de rastreador de IA. Não é executado JavaScript. Tempo até ao primeiro byte: 21 ms.
O que isto não é: Nenhum acompanhamento de posições ou citações, nenhuma afirmação sobre se um modelo o nomeia realmente, e nenhuma verificação de conteúdo carregado via JavaScript. Um instantâneo do ponto de vista de um IP de servidor.