MONITORIZAÇÃO ACTIVAChatGPT · Claude · Gemini · Grok · DeepSeek · Mistral · Perplexity · AI Overviews (Google) · AI Mode (Google) · Copilot (Microsoft)12 MOTORESv.2026.04 / build 47GENERATIVE ENGINE OPTIMIZATIONLISBOA · PORTUGAL
← Blog
7 min de leitura

Seis comandos para saber se a IA consegue ler o seu site

Antes de perguntar porque é que a IA não o cita, confirme que ela chega ao site. Seis verificações que corre no terminal em cinco minutos, com o output real de destaque.ai e o que fazer quando cada uma falha.

Por Eduardo Mendonça, fundador da destaque.ai · LinkedIn · ORCID

A pergunta que mais ouvimos é porque é que a IA não recomenda a marca. Antes de responder a isso, vale a pena responder a uma mais simples: a IA consegue sequer ler o site? Em cerca de metade dos casos que auditamos, alguma destas seis coisas está partida, e o trabalho de conteúdo que se fez por cima estava a ser feito às escuras.

Cada comando abaixo foi corrido contra este site antes de este artigo ser publicado, e o que está nas caixas é o resultado verdadeiro, não um exemplo desenhado para o artigo. Verificado a 20 de Agosto de 2026. Substitua o domínio pelo seu e leva cinco minutos.

01 Os robôs de IA têm entrada

O comando

curl -s https://exemplo.pt/robots.txt | grep -iA1 'GPTBot\|ClaudeBot\|PerplexityBot\|Google-Extended\|OAI-SearchBot'

O que devolveu

User-Agent: GPTBot
Allow: /
--
User-Agent: OAI-SearchBot
Allow: /
--
User-Agent: ClaudeBot
Allow: /
--
User-Agent: Google-Extended
Allow: /
--
User-Agent: PerplexityBot
Allow: /

Cinco agentes, cinco autorizações. Se algum aparecer com Disallow, ou não aparecer de todo enquanto existe um Disallow genérico acima, esse motor não lê o site e nada do resto interessa.

Note a diferença entre os dois tipos: GPTBot e ClaudeBot recolhem para treino, OAI-SearchBot e PerplexityBot vão buscar a página no momento em que alguém pergunta. Bloquear os primeiros é uma decisão legítima; bloquear os segundos é desaparecer das respostas com pesquisa ao vivo, que é onde se ganha no curto prazo.

02 O llms.txt existe e diz alguma coisa

O comando

curl -s -o /dev/null -w '%{http_code} %{size_download}\n' https://exemplo.pt/llms.txt

O que devolveu

200  24759

Duzentos e vinte e quatro mil e setecentos e cinquenta e nove bytes de mapa em texto: quem somos, o que vendemos, que estudos publicámos, com uma linha de contexto por ligação. Um 404 aqui não é fatal, mas é uma oportunidade deitada fora.

Um llms.txt de dez linhas com só os títulos das páginas não serve para nada. O que o torna útil é a frase de contexto a seguir a cada ligação, que é o que um motor cita quando não vai abrir a página toda.

03 O texto está no HTML, não só no JavaScript

O comando

curl -s https://exemplo.pt/pagina | sed 's/<script.*<\/script>//g' | sed 's/<[^>]*>/ /g' | wc -w

O que devolveu

h1: 1 · h2: 11 · palavras no HTML servido: 2082

Duas mil e oitenta e duas palavras chegam sem executar uma linha de JavaScript. Este é o teste que mais sites falha, e falha em silêncio: no browser a página parece cheia, e o que sai do servidor é uma casca vazia.

Se o número vier perto de zero, o conteúdo está a ser montado no browser. Alguns motores executam JavaScript, a maioria dos recolectores não. A correcção é renderizar no servidor, não é acrescentar mais schema por cima do vazio.

04 O schema declara o que a página é

O comando

curl -s https://exemplo.pt/pagina | grep -o 'application/ld+json' | wc -l

O que devolveu

14x  ImageObject
 1x  Organization
 1x  Person
 1x  WebSite
 1x  WebPage
 1x  Service
 1x  SoftwareApplication
 1x  FAQPage
 1x  BreadcrumbList

Uma página de produto que se declara SoftwareApplication, com a organização, a pessoa que assina, as perguntas frequentes e as imagens identificadas uma a uma. Nove tipos, todos verdadeiros.

O erro comum não é ter pouco schema, é ter schema que mente: declarar Product numa página que não vende nada, ou FAQPage com perguntas que não estão visíveis na página. Isso apanha-se, e custa mais do que não ter nenhum.

05 As versões em cada língua apontam uma para a outra

O comando

curl -s https://exemplo.pt/pagina | grep -oE '<link rel="(canonical|alternate)"[^>]*>'

O que devolveu

<link rel="canonical" href="https://www.destaque.ai/tracker"/>
<link rel="alternate" hrefLang="pt-PT" href="https://www.destaque.ai/tracker"/>
<link rel="alternate" hrefLang="en" href="https://www.destaque.ai/en/tracker"/>
<link rel="alternate" hrefLang="x-default" href="https://www.destaque.ai/tracker"/>

A versão portuguesa declara a inglesa, e é preciso correr o mesmo comando na inglesa para confirmar que ela declara a portuguesa. Sem reciprocidade o Google descarta o par inteiro e as duas páginas competem uma com a outra.

Este foi um erro real deste site: a homepage não declarava alternativa nenhuma, e a versão inglesa ficava sem sinal na página mais importante. Correr o comando nos dois lados é o que o apanha.

06 A página existe no sitemap

O comando

curl -s https://exemplo.pt/sitemap.xml | grep -c '<loc>'

O que devolveu

URLs no sitemap: 64
  /tracker                 sim
  /en/tracker              sim
  /ai-ads                  sim
  /en/agentic-commerce     sim

Sessenta e quatro endereços, e as quatro páginas que interessam estão lá. Um sitemap que não acompanha as páginas novas é pior do que não existir: dá ao motor uma lista desactualizada e ele confia nela.

Verifique sempre as páginas criadas nas últimas semanas. São essas que ficam de fora quando o sitemap é escrito à mão em vez de gerado a partir das rotas.

O que estes seis comandos não dizem

Dizem que o site é legível. Não dizem que a marca é citada, e a diferença entre as duas coisas é o trabalho todo. Um site com os seis pontos verdes pode continuar a não aparecer em resposta nenhuma, porque ser citado depende de autoridade, de dados próprios e de responder melhor do que os outros à pergunta que o comprador faz.

A legibilidade é a condição de entrada. Sem ela, nada do resto conta; com ela, começa o trabalho. Para saber em que perguntas a sua marca aparece hoje, e quem aparece no seu lugar, peça a auditoria gratuita: corremos centenas de perguntas reais de compradores em doze motores e superfícies de IA e mostramos o resultado, sem compromisso.

Perguntas frequentes

Estas seis verificações garantem que a IA me vai citar?

Não, e é importante perceber a diferença. Estas verificações dizem que o site é legível: que os agentes entram, que o texto sai do servidor, que a página se declara pelo que é. Ser citado depende de outra coisa, que é ter autoridade e conteúdo que responda à pergunta melhor do que o dos outros. A legibilidade é a condição de entrada, não a vitória. Um site perfeito nestes seis pontos pode continuar a não aparecer em resposta nenhuma.

Devo bloquear o GPTBot para a IA não treinar com o meu conteúdo?

É uma decisão legítima e depende do que vende. O que não se deve fazer é bloquear sem distinguir: GPTBot e ClaudeBot recolhem conteúdo para treino, enquanto OAI-SearchBot e PerplexityBot vão buscar a página no momento em que um utilizador pergunta. Bloquear os segundos significa desaparecer das respostas com pesquisa ao vivo, que é onde a visibilidade se ganha em semanas em vez de meses.

Com que frequência se repetem estas verificações?

Uma vez por trimestre chega para um site estável, e sempre que se muda de framework, se migra de servidor ou se lança uma secção nova. As duas que mais partem sozinhas são a terceira, quando alguém converte uma página para renderização no browser, e a sexta, quando se criam páginas que o sitemap não apanha.

A ler a seguir