A pergunta que mais ouvimos é porque é que a IA não recomenda a marca. Antes de responder a isso, vale a pena responder a uma mais simples: a IA consegue sequer ler o site? Em cerca de metade dos casos que auditamos, alguma destas seis coisas está partida, e o trabalho de conteúdo que se fez por cima estava a ser feito às escuras.
Cada comando abaixo foi corrido contra este site antes de este artigo ser publicado, e o que está nas caixas é o resultado verdadeiro, não um exemplo desenhado para o artigo. Verificado a 20 de Agosto de 2026. Substitua o domínio pelo seu e leva cinco minutos.
01 Os robôs de IA têm entrada
O comando
curl -s https://exemplo.pt/robots.txt | grep -iA1 'GPTBot\|ClaudeBot\|PerplexityBot\|Google-Extended\|OAI-SearchBot'O que devolveu
User-Agent: GPTBot
Allow: /
--
User-Agent: OAI-SearchBot
Allow: /
--
User-Agent: ClaudeBot
Allow: /
--
User-Agent: Google-Extended
Allow: /
--
User-Agent: PerplexityBot
Allow: /Cinco agentes, cinco autorizações. Se algum aparecer com Disallow, ou não aparecer de todo enquanto existe um Disallow genérico acima, esse motor não lê o site e nada do resto interessa.
Note a diferença entre os dois tipos: GPTBot e ClaudeBot recolhem para treino, OAI-SearchBot e PerplexityBot vão buscar a página no momento em que alguém pergunta. Bloquear os primeiros é uma decisão legítima; bloquear os segundos é desaparecer das respostas com pesquisa ao vivo, que é onde se ganha no curto prazo.
02 O llms.txt existe e diz alguma coisa
O comando
curl -s -o /dev/null -w '%{http_code} %{size_download}\n' https://exemplo.pt/llms.txtO que devolveu
200 24759Duzentos e vinte e quatro mil e setecentos e cinquenta e nove bytes de mapa em texto: quem somos, o que vendemos, que estudos publicámos, com uma linha de contexto por ligação. Um 404 aqui não é fatal, mas é uma oportunidade deitada fora.
Um llms.txt de dez linhas com só os títulos das páginas não serve para nada. O que o torna útil é a frase de contexto a seguir a cada ligação, que é o que um motor cita quando não vai abrir a página toda.
03 O texto está no HTML, não só no JavaScript
O comando
curl -s https://exemplo.pt/pagina | sed 's/<script.*<\/script>//g' | sed 's/<[^>]*>/ /g' | wc -wO que devolveu
h1: 1 · h2: 11 · palavras no HTML servido: 2082Duas mil e oitenta e duas palavras chegam sem executar uma linha de JavaScript. Este é o teste que mais sites falha, e falha em silêncio: no browser a página parece cheia, e o que sai do servidor é uma casca vazia.
Se o número vier perto de zero, o conteúdo está a ser montado no browser. Alguns motores executam JavaScript, a maioria dos recolectores não. A correcção é renderizar no servidor, não é acrescentar mais schema por cima do vazio.
04 O schema declara o que a página é
O comando
curl -s https://exemplo.pt/pagina | grep -o 'application/ld+json' | wc -lO que devolveu
14x ImageObject
1x Organization
1x Person
1x WebSite
1x WebPage
1x Service
1x SoftwareApplication
1x FAQPage
1x BreadcrumbListUma página de produto que se declara SoftwareApplication, com a organização, a pessoa que assina, as perguntas frequentes e as imagens identificadas uma a uma. Nove tipos, todos verdadeiros.
O erro comum não é ter pouco schema, é ter schema que mente: declarar Product numa página que não vende nada, ou FAQPage com perguntas que não estão visíveis na página. Isso apanha-se, e custa mais do que não ter nenhum.
05 As versões em cada língua apontam uma para a outra
O comando
curl -s https://exemplo.pt/pagina | grep -oE '<link rel="(canonical|alternate)"[^>]*>'O que devolveu
<link rel="canonical" href="https://www.destaque.ai/tracker"/>
<link rel="alternate" hrefLang="pt-PT" href="https://www.destaque.ai/tracker"/>
<link rel="alternate" hrefLang="en" href="https://www.destaque.ai/en/tracker"/>
<link rel="alternate" hrefLang="x-default" href="https://www.destaque.ai/tracker"/>A versão portuguesa declara a inglesa, e é preciso correr o mesmo comando na inglesa para confirmar que ela declara a portuguesa. Sem reciprocidade o Google descarta o par inteiro e as duas páginas competem uma com a outra.
Este foi um erro real deste site: a homepage não declarava alternativa nenhuma, e a versão inglesa ficava sem sinal na página mais importante. Correr o comando nos dois lados é o que o apanha.
06 A página existe no sitemap
O comando
curl -s https://exemplo.pt/sitemap.xml | grep -c '<loc>'O que devolveu
URLs no sitemap: 64
/tracker sim
/en/tracker sim
/ai-ads sim
/en/agentic-commerce simSessenta e quatro endereços, e as quatro páginas que interessam estão lá. Um sitemap que não acompanha as páginas novas é pior do que não existir: dá ao motor uma lista desactualizada e ele confia nela.
Verifique sempre as páginas criadas nas últimas semanas. São essas que ficam de fora quando o sitemap é escrito à mão em vez de gerado a partir das rotas.
O que estes seis comandos não dizem
Dizem que o site é legível. Não dizem que a marca é citada, e a diferença entre as duas coisas é o trabalho todo. Um site com os seis pontos verdes pode continuar a não aparecer em resposta nenhuma, porque ser citado depende de autoridade, de dados próprios e de responder melhor do que os outros à pergunta que o comprador faz.
A legibilidade é a condição de entrada. Sem ela, nada do resto conta; com ela, começa o trabalho. Para saber em que perguntas a sua marca aparece hoje, e quem aparece no seu lugar, peça a auditoria gratuita: corremos centenas de perguntas reais de compradores em doze motores e superfícies de IA e mostramos o resultado, sem compromisso.
Perguntas frequentes
Estas seis verificações garantem que a IA me vai citar?
Não, e é importante perceber a diferença. Estas verificações dizem que o site é legível: que os agentes entram, que o texto sai do servidor, que a página se declara pelo que é. Ser citado depende de outra coisa, que é ter autoridade e conteúdo que responda à pergunta melhor do que o dos outros. A legibilidade é a condição de entrada, não a vitória. Um site perfeito nestes seis pontos pode continuar a não aparecer em resposta nenhuma.
Devo bloquear o GPTBot para a IA não treinar com o meu conteúdo?
É uma decisão legítima e depende do que vende. O que não se deve fazer é bloquear sem distinguir: GPTBot e ClaudeBot recolhem conteúdo para treino, enquanto OAI-SearchBot e PerplexityBot vão buscar a página no momento em que um utilizador pergunta. Bloquear os segundos significa desaparecer das respostas com pesquisa ao vivo, que é onde a visibilidade se ganha em semanas em vez de meses.
Com que frequência se repetem estas verificações?
Uma vez por trimestre chega para um site estável, e sempre que se muda de framework, se migra de servidor ou se lança uma secção nova. As duas que mais partem sozinhas são a terceira, quando alguém converte uma página para renderização no browser, e a sexta, quando se criam páginas que o sitemap não apanha.
A ler a seguir
- llms.txt e robots.txt: qual serve para quê, se a segunda verificação lhe deu 404.
- Schema.org para SaaS B2B: o mínimo viável, se a quarta lhe deu pouca coisa.
- Como auditar a visibilidade da sua marca em IA, o passo seguinte a estes seis.