Português
citeglass · Verificação de visibilidade em IA

Verificado em 04/09/2026 · https://www.nytimes.com/

Há 2 bloqueios críticos para a descoberta por IA — corrija-os primeiro.

F
38 / 100
2 críticos · 1 a verificar

Matriz de rastreadores de IA

Por cada bot: o que o seu robots.txt permite — e o que o seu servidor devolve realmente ao agente de utilizador do bot. Linhas destacadas a vermelho: o robots permite, mas o servidor bloqueia (normalmente uma regra de WAF ou de proteção anti-bots).

BotOperadorrobots.txtResposta do servidor
GPTBotOpenAIbloqueadobloqueado (403 / WAF)
OAI-SearchBotOpenAIbloqueadobloqueado (403 / WAF)
ChatGPT-UserOpenAIbloqueadobloqueado (403 / WAF)
ClaudeBotAnthropicbloqueadobloqueado (403 / WAF)
Claude-SearchBotAnthropicbloqueadobloqueado (403 / WAF)
Claude-UserAnthropicbloqueadobloqueado (403 / WAF)
PerplexityBotPerplexitybloqueadobloqueado (403 / WAF)
Perplexity-UserPerplexitybloqueadobloqueado (403 / WAF)
Google-ExtendedGoogle (Gemini-Training)bloqueado
GooglebotGoogle (KI-Übersichten)permitido200 + conteúdo
CCBotCommon Crawl (Trainingsdaten vieler LLMs)bloqueadobloqueado (403 / WAF)
BytespiderByteDance (Doubao)bloqueadobloqueado (403 / WAF)
AmazonbotAmazon (Alexa/Rufus)permitidobloqueado (403 / WAF)
Applebot-ExtendedApple (Intelligence-Training)bloqueado
Meta-ExternalAgentMeta (Llama/Meta AI)bloqueadobloqueado (403 / WAF)
Como é calculada a pontuação?
Rastreadores de IA importantes estão bloqueados no robots.txt-32
O servidor bloqueia bots que o robots.txt permite-6
Título da página demasiado curto ou demasiado longo-6
Sem llms.txt-5
Sem esquema Organization-4
Sem sinal de autor ou autoria-4
Sem data visível ou marcada-3
Sem marcação FAQ ou HowTo-2
Resultado38 / 100

Acesso para rastreadores de IA

crítico

Rastreadores de IA importantes estão bloqueados no robots.txt

O seu robots.txt proíbe o acesso a 5 rastreadores de IA centrais: GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Google-Extended. Esses sistemas não conseguem então carregar o seu conteúdo nem usá-lo como fonte.

Isto é o que deve fazer: Verifique por bot se o bloqueio é intencional. Para a visibilidade em IA devem estar permitidos pelo menos o GPTBot, o OAI-SearchBot, o ClaudeBot, o PerplexityBot e o Google-Extended.

User-agent: GPTBot
Allow: /

User-agent: PerplexityBot
Allow: /
crítico

O servidor bloqueia bots que o robots.txt permite

Para 1 bot(s) de Amazon (Alexa/Rufus), o robots.txt diz «permitido», mas o servidor responde com um 403 ou uma página de proteção anti-bots. Normalmente uma regra de WAF, firewall ou CDN que exclui o rastreador contornando o robots.txt.

Isto é o que deve fazer: Adicione os agentes de utilizador e/ou intervalos de IP dos rastreadores de IA pretendidos a uma lista de permitidos no seu WAF / Cloudflare / firewall. Verifique-os por DNS inverso, não apenas pela cadeia de agente de utilizador.

Estrutura e compreensão pela máquina

a verificar

Título da página demasiado curto ou demasiado longo

O <title> tem 66 caracteres. Cerca de 30 a 60 caracteres são razoáveis: descritivo o suficiente para nomear o tema, curto o suficiente para não ser cortado.

Isto é o que deve fazer: Escreva um título conciso que contenha o tema e, se pertinente, a marca.

nota

Sem llms.txt

Não há qualquer ficheiro em /llms.txt. O llms.txt é uma breve visão geral em Markdown dos seus conteúdos-chave que alguns sistemas de IA usam para se orientarem.

Isto é o que deve fazer: Crie um /llms.txt: um H1 com o nome, um parágrafo curto sobre a oferta e uma lista de ligações às páginas centrais.

# A sua empresa

> Descrição numa frase.

## Páginas-chave
- [Produto](https://o-seu-dominio.pt/produto): …
- [Preços](https://o-seu-dominio.pt/precos): …
- [Sobre](https://o-seu-dominio.pt/sobre): …
nota

Sem esquema Organization

Há JSON-LD, mas nenhuma entrada «Organization». Os sistemas de IA situam então pior a sua marca como entidade distinta e ligam-na pior a fontes externas.

Isto é o que deve fazer: Adicione um esquema «Organization» com name, url, logo e sameAs (ligações aos seus perfis oficiais).

nota

Sem marcação FAQ ou HowTo

O conteúdo de pergunta-resposta e passo a passo é mais difícil de reconhecer como resposta diretamente citável para os sistemas de IA sem marcação FAQPage ou HowTo.

Isto é o que deve fazer: Onde a página responde a perguntas reais ou dá instruções, marque-a como FAQPage ou HowTo (sem marcação sem conteúdo visivelmente correspondente).

Sinais de confiança e de entidade (E-E-A-T)

nota

Sem sinal de autor ou autoria

Nenhum autor é reconhecível (nem meta tag, nem rel=author, nem JSON-LD Person). Para «experiência» e «perícia» no sentido E-E-A-T importa uma autoria nomeada e verificável.

Isto é o que deve fazer: Em conteúdos editoriais, nomeie um autor e ligue uma página de autor; marque-o também como JSON-LD «Person».

nota

Sem data visível ou marcada

Nenhuma data de publicação ou modificação é reconhecível (nem <time>, nem article:published_time, nem datePublished no JSON-LD). Para muitas perguntas, os sistemas de IA preferem fontes atuais.

Isto é o que deve fazer: Em conteúdos com referência temporal, mostre uma data de forma visível e marque datePublished / dateModified no JSON-LD.

Conforme (7)
  • O conteúdo principal está no HTML sem JavaScript.
  • Existem dados estruturados (JSON-LD). — WebSite, NewsMediaOrganization
  • Exatamente um título H1.
  • Está definida uma URL canónica.
  • O sitemap está acessível.
  • Tempo de resposta do servidor rápido.
  • Sem noindex — a página pode ser indexada.

Próximos passos

  1. Rastreadores de IA importantes estão bloqueados no robots.txt. Verifique por bot se o bloqueio é intencional. Para a visibilidade em IA devem estar permitidos pelo menos o GPTBot, o OAI-SearchBot, o ClaudeBot, o PerplexityBot e o Google-Extended.
  2. O servidor bloqueia bots que o robots.txt permite. Adicione os agentes de utilizador e/ou intervalos de IP dos rastreadores de IA pretendidos a uma lista de permitidos no seu WAF / Cloudflare / firewall. Verifique-os por DNS inverso, não apenas pela cadeia de agente de utilizador.
  3. Título da página demasiado curto ou demasiado longo. Escreva um título conciso que contenha o tema e, se pertinente, a marca.
Monitorizar esta página

Nova análise semanal com alerta por e-mail a cada alteração. Em preparação — introduza o seu endereço.

Método e limites

Verificado em 04/09/2026. O citeglass obtém nytimes.com e os ficheiros associados (robots.txt, llms.txt, sitemap.xml) via HTTP — uma vez como navegador normal, uma vez por cada agente de utilizador de rastreador de IA. Não é executado JavaScript. Tempo até ao primeiro byte: 235 ms.

O que isto não é: Nenhum acompanhamento de posições ou citações, nenhuma afirmação sobre se um modelo o nomeia realmente, e nenhuma verificação de conteúdo carregado via JavaScript. Um instantâneo do ponto de vista de um IP de servidor.

Verificar outro site