Blog

/

Guia

/

Seis comandos para saber se a IA consegue ler o seu site

Guia

20 de agosto de 2026

7 min de leitura

# Seis comandos para saber se a IA consegue ler *o seu site*

Antes de perguntar porque é que a IA não o cita, confirme que ela chega ao site. Seis verificações que corre no terminal em cinco minutos, com o output real de destaque.ai e o que fazer quando cada uma falha.

EN

Read in English →

Dados de demonstração

Guia

Por

Eduardo Mendonça

, fundador da destaque.ai ·

LinkedIn

·

ORCID

A pergunta que mais ouvimos é porque é que a IA não recomenda a marca. Antes de responder a isso, vale a pena responder a uma mais simples: a IA consegue sequer ler o site? Em cerca de metade dos casos que auditamos, alguma destas seis coisas está partida, e o trabalho de conteúdo que se fez por cima estava a ser feito às escuras.

Cada comando abaixo foi corrido contra este site antes de este artigo ser publicado, e o que está nas caixas é o resultado verdadeiro, não um exemplo desenhado para o artigo. Verificado a 20 de Agosto de 2026. Substitua o domínio pelo seu e leva cinco minutos.

## 01 Os robôs de IA têm entrada

**O comando**

```
curl -s https://exemplo.pt/robots.txt | grep -iA1 'GPTBot\|ClaudeBot\|PerplexityBot\|Google-Extended\|OAI-SearchBot'
```

**O que devolveu**

```
User-Agent: GPTBot
Allow: /
--
User-Agent: OAI-SearchBot
Allow: /
--
User-Agent: ClaudeBot
Allow: /
--
User-Agent: Google-Extended
Allow: /
--
User-Agent: PerplexityBot
Allow: /
```

Cinco agentes, cinco autorizações. Se algum aparecer com Disallow, ou não aparecer de todo enquanto existe um Disallow genérico acima, esse motor não lê o site e nada do resto interessa.

Note a diferença entre os dois tipos: GPTBot e ClaudeBot recolhem para treino, OAI-SearchBot e PerplexityBot vão buscar a página no momento em que alguém pergunta. Bloquear os primeiros é uma decisão legítima; bloquear os segundos é desaparecer das respostas com pesquisa ao vivo, que é onde se ganha no curto prazo.

## 02 O llms.txt existe e diz alguma coisa

**O comando**

```
curl -s -o /dev/null -w '%{http_code} %{size_download}\n' https://exemplo.pt/llms.txt
```

**O que devolveu**

```
200  24759
```

Duzentos e vinte e quatro mil e setecentos e cinquenta e nove bytes de mapa em texto: quem somos, o que vendemos, que estudos publicámos, com uma linha de contexto por ligação. Um 404 aqui não é fatal, mas é uma oportunidade deitada fora.

Um llms.txt de dez linhas com só os títulos das páginas não serve para nada. O que o torna útil é a frase de contexto a seguir a cada ligação, que é o que um motor cita quando não vai abrir a página toda.

## 03 O texto está no HTML, não só no JavaScript

**O comando**

```
curl -s https://exemplo.pt/pagina | sed 's/<script.*<\/script>//g' | sed 's/<[^>]*>/ /g' | wc -w
```

**O que devolveu**

```
h1: 1 · h2: 11 · palavras no HTML servido: 2082
```

Duas mil e oitenta e duas palavras chegam sem executar uma linha de JavaScript. Este é o teste que mais sites falha, e falha em silêncio: no browser a página parece cheia, e o que sai do servidor é uma casca vazia.

Se o número vier perto de zero, o conteúdo está a ser montado no browser. Alguns motores executam JavaScript, a maioria dos recolectores não. A correção é renderizar no servidor, não é acrescentar mais schema por cima do vazio.

## 04 O schema declara o que a página é

**O comando**

```
curl -s https://exemplo.pt/pagina | grep -o 'application/ld+json' | wc -l
```

**O que devolveu**

```
14x  ImageObject
 1x  Organization
 1x  Person
 1x  WebSite
 1x  WebPage
 1x  Service
 1x  SoftwareApplication
 1x  FAQPage
 1x  BreadcrumbList
```

Uma página de produto que se declara SoftwareApplication, com a organização, a pessoa que assina, as perguntas frequentes e as imagens identificadas uma a uma. Nove tipos, todos verdadeiros.

O erro comum não é ter pouco schema, é ter schema que mente: declarar Product numa página que não vende nada, ou FAQPage com perguntas que não estão visíveis na página. Isso apanha-se, e custa mais do que não ter nenhum.

## 05 As versões em cada língua apontam uma para a outra

**O comando**

```
curl -s https://exemplo.pt/pagina | grep -oE '<link rel="(canonical|alternate)"[^>]*>'
```

**O que devolveu**

```
<link rel="canonical" href="https://www.destaque.ai/tracker"/>
<link rel="alternate" hrefLang="pt-PT" href="https://www.destaque.ai/tracker"/>
<link rel="alternate" hrefLang="en" href="https://www.destaque.ai/en/tracker"/>
<link rel="alternate" hrefLang="x-default" href="https://www.destaque.ai/tracker"/>
```

A versão portuguesa declara a inglesa, e é preciso correr o mesmo comando na inglesa para confirmar que ela declara a portuguesa. Sem reciprocidade o Google descarta o par inteiro e as duas páginas competem uma com a outra.

Este foi um erro real deste site: a homepage não declarava alternativa nenhuma, e a versão inglesa ficava sem sinal na página mais importante. Correr o comando nos dois lados é o que o apanha.

## 06 A página existe no sitemap

**O comando**

```
curl -s https://exemplo.pt/sitemap.xml | grep -c '<loc>'
```

**O que devolveu**

```
URLs no sitemap: 64
  /tracker                 sim
  /en/tracker              sim
  /ai-ads                  sim
  /en/agentic-commerce     sim
```

Sessenta e quatro endereços, e as quatro páginas que interessam estão lá. Um sitemap que não acompanha as páginas novas é pior do que não existir: dá ao motor uma lista desactualizada e ele confia nela.

Verifique sempre as páginas criadas nas últimas semanas. São essas que ficam de fora quando o sitemap é escrito à mão em vez de gerado a partir das rotas.

## O que estes seis comandos não dizem

Dizem que o site é legível. Não dizem que a marca é citada, e a diferença entre as duas coisas é o trabalho todo. Um site com os seis pontos verdes pode continuar a não aparecer em resposta nenhuma, porque ser citado depende de autoridade, de dados próprios e de responder melhor do que os outros à pergunta que o comprador faz.

A legibilidade é a condição de entrada. Sem ela, nada do resto conta; com ela, começa o trabalho. Para saber em que perguntas a sua marca aparece hoje, e quem aparece no seu lugar, [peça a auditoria gratuita](https://www.destaque.ai/auditoria): corremos centenas de perguntas reais de compradores em onze motores e superfícies de IA e mostramos o resultado, sem compromisso.

## Perguntas frequentes

### Estas seis verificações garantem que a IA me vai citar?

Não, e é importante perceber a diferença. Estas verificações dizem que o site é legível: que os agentes entram, que o texto sai do servidor, que a página se declara pelo que é. Ser citado depende de outra coisa, que é ter autoridade e conteúdo que responda à pergunta melhor do que o dos outros. A legibilidade é a condição de entrada, não a vitória. Um site perfeito nestes seis pontos pode continuar a não aparecer em resposta nenhuma.

### Devo bloquear o GPTBot para a IA não treinar com o meu conteúdo?

É uma decisão legítima e depende do que vende. O que não se deve fazer é bloquear sem distinguir: GPTBot e ClaudeBot recolhem conteúdo para treino, enquanto OAI-SearchBot e PerplexityBot vão buscar a página no momento em que um utilizador pergunta. Bloquear os segundos significa desaparecer das respostas com pesquisa ao vivo, que é onde a visibilidade se ganha em semanas em vez de meses.

### Com que frequência se repetem estas verificações?

Uma vez por trimestre chega para um site estável, e sempre que se muda de framework, se migra de servidor ou se lança uma secção nova. As duas que mais partem sozinhas são a terceira, quando alguém converte uma página para renderização no browser, e a sexta, quando se criam páginas que o sitemap não apanha.

## A ler a seguir

- [llms.txt e robots.txt: qual serve para quê](https://www.destaque.ai/blog/llms-txt-vs-robots-txt), se a segunda verificação lhe deu 404.
- [Schema.org para SaaS B2B: o mínimo viável](https://www.destaque.ai/blog/schema-org-saas-b2b-minimo-viavel), se a quarta lhe deu pouca coisa.
- [Como auditar a visibilidade da sua marca em IA](https://www.destaque.ai/blog/como-auditar-visibilidade-marca-ia), o passo seguinte a estes seis.

---

Versão markdown de https://www.destaque.ai/blog/verificar-se-a-ia-le-o-seu-site. Conteúdo idêntico à página HTML.
