WordPress SEO

robots.txt para IA: os bloqueios que você não vê

robots.txt para IA no WordPress: descubra os bloqueios silenciosos que tiram seu site das respostas do ChatGPT e da Perplexity. Audite hoje.
Escrito Por Leandro Vieira em agosto de 2026 /7 min de leitura
Conteúdo escrito por humano
Tela de código exibindo arquivo robots.txt para IA com diretivas de user-agent em um site WordPress

robots.txt para IA é o uso do arquivo robots.txt na raiz do site para dizer aos crawlers de sistemas generativos (GPTBot, ClaudeBot, PerplexityBot, Google-Extended e companhia) o que eles podem ou não acessar. Mesmo arquivo de sempre, novos leitores.

E é aqui que a maioria dos projetos WordPress corporativos perde visibilidade sem perceber.

Não por uma decisão estratégica. Por uma linha herdada de um ambiente de homologação, ou por um checkbox marcado três anos atrás.

O arquivo mais antigo da web virou o mais consultado

robots txt para ia bloqueios wordpress body

O Robots Exclusion Protocol é de 1994. Nasceu para conversar com buscador, e por duas décadas foi exatamente isso.

Agora ele responde a dezenas de agentes diferentes, e o volume mudou de patamar.

Traduzindo para a sua operação: a cada 31 requisições, uma vem de uma máquina decidindo se o seu conteúdo entra ou não em uma resposta gerada.

Um detalhe que muita gente ignora: o robots.txt é um pedido, não uma tranca. Crawler bem-comportado obedece, scraper genérico passa direto. Isso muda onde você resolve cada problema, e volto nisso mais adiante.

Os bloqueios que você nem sabe que tem

Na prática, os erros de robots.txt para IA quase nunca são exóticos. São os mesmos quatro, repetidos:

  • O checkbox da vergonha. Em Configurações, Leitura, a opção “Sugerir aos motores de busca que não indexem este site” faz o WordPress servir um robots.txt virtual com Disallow: / para todo mundo. Marcado no lançamento, esquecido depois do go-live.

  • robots.txt herdado do staging. A migração levou tema, plugins, banco e também o arquivo que bloqueava o ambiente de homologação inteiro. Ninguém abre a raiz do site para conferir.

  • Bloqueio de recursos de renderização. Disallow: /wp-content/ ou Disallow: /wp-includes/ impede o crawler de carregar CSS e JavaScript. Conteúdo que depende de renderização simplesmente não existe para quem lê.

  • Regra genérica que pega a IA no meio. Um Disallow: /blog/*? mal escrito, uma regra de parâmetro, um bloqueio de /wp-json/. Você mirou em outra coisa e acertou o seu próprio conteúdo.

Nenhum desses erros gera alerta. Não cai chamado, não some do Analytics, não aparece no relatório mensal. O site continua no ar, bonito, rápido, e invisível para o modelo.

Isso é o que a gente chama de erro silencioso. O pior tipo, porque não tem sintoma.

Quem é quem entre os user-agents de IA

Antes de escrever qualquer regra, entenda que bloquear treino e bloquear citação são decisões diferentes. Confundir as duas é como cancelar o cartão para não pagar a fatura: resolve o errado.

User-agent

Operador

Função principal

Efeito de bloquear

GPTBot

OpenAI

Coleta conteúdo para treinamento de modelos

Seu conteúdo fica fora do treino, mas o ChatGPT ainda pode citar você via OAI-SearchBot

OAI-SearchBot

OpenAI

Indexa páginas para respostas com link no ChatGPT

Você deixa de aparecer como fonte citada no ChatGPT

ClaudeBot

Anthropic

Coleta para treinamento

Conteúdo fora do treino do Claude

Google-Extended

Google

Controla uso do conteúdo em Gemini e grounding

Não afeta o índice da Busca, afeta o uso generativo

PerplexityBot

Perplexity

Indexa para respostas com fonte

Você some das citações da Perplexity

A documentação de cada operador é pública. Vale conferir a lista de bots da OpenAI e a de crawlers do Google antes de copiar regra de blog gringo.

Se esse recorte entre treino e citação ainda está nebuloso, nosso texto sobre bot de treino vs bot de citação destrincha a diferença.

Como auditar o robots.txt para IA no WordPress

Roteiro curto, dá para rodar em uma tarde.

  1. Abra seudominio.com.br/robots.txt no navegador. Sim, é isso mesmo. A maior parte dos diagnósticos morre aqui, porque a resposta já está errada na primeira linha.

  2. Confira Configurações, Leitura. Se o checkbox de desencorajar indexação estiver marcado, desmarque. Ele sobrescreve o robots.txt virtual gerado pelo WordPress.

  3. Descubra quem gera o arquivo. Pode ser um arquivo físico na raiz, o robots.txt virtual do core ou um plugin de SEO. Dois deles ao mesmo tempo é conflito garantido.

  4. Liste os Disallow e justifique cada um. Se você não consegue explicar por que a regra existe, ela provavelmente é lixo de migração.

  5. Cheque os logs de acesso por user-agent. GPTBot, ClaudeBot e PerplexityBot aparecem nos logs. Se não aparecem há semanas, o bloqueio não está no robots.txt, está na camada de rede.

Esse último ponto é o que mais pega gestor desprevenido.

O robots.txt não é a única porta

Aqui na Apiki, boa parte dos casos de invisibilidade que auditamos não estava no arquivo. Estava no WAF, no CDN ou em uma regra de rate limit que devolvia 403 para user-agent desconhecido.

Faz sentido, inclusive. Muita gente ativou proteção contra bots de IA em 2024 e 2025 sem separar o que era abuso de banda do que era oportunidade de citação.

Ou seja: você pode ter um robots.txt para IA impecável e ainda assim estar fechado. O crawler nem chega a ler o arquivo.

Por isso tratamos acesso como a primeira camada do framework de GEO Técnico. Se a camada 1 está quebrada, as outras cinco não importam.

Considere também o cenário oposto, que é legítimo: liberar bot de citação e barrar bot de treino. Isso se faz no robots.txt para os agentes que respeitam a diretiva, e no WAF para os que não respeitam. Ferramenta certa para cada caso.

Perguntas frequentes sobre robots.txt para IA

Bloquear GPTBot tira meu site do Google?

Não. GPTBot é da OpenAI e não tem relação com o índice da Busca do Google. Quem controla uso generativo no ecossistema Google é o Google-Extended, e mesmo ele não afeta a indexação tradicional.

llms.txt substitui o robots.txt para IA?

Não substitui. O llms.txt é uma proposta de curadoria de conteúdo para modelos, sem mecanismo de aplicação por parte dos crawlers. Ele não bloqueia nada e não reduz consumo de banda. Quem controla acesso continua sendo robots.txt (por cortesia) e a camada de rede (por imposição).

Preciso de plugin para editar o robots.txt no WordPress?

Não necessariamente. O WordPress gera um robots.txt virtual e a maioria dos plugins de SEO permite editá-lo pelo painel. Um arquivo físico na raiz também funciona e tem precedência. O problema é manter os dois: escolha uma fonte de verdade.

Conclusão

robots.txt para IA não é assunto de SEO avançado. É higiene de infraestrutura, e custa uma tarde de auditoria.

Abra a raiz do seu site. Leia as linhas. Justifique cada Disallow. Depois cruze com os logs para ver se o bot chegou a bater na porta.

Se quiser um retrato completo das seis camadas, começando pelo acesso, nosso time roda um Diagnóstico GEO Técnico e devolve o que está bloqueando a leitura do seu conteúdo pelos modelos. Vale conversar com um especialista antes de mexer em produção. E o guia de GEO Técnico segue aberto para consulta.

Me conta: quando foi a última vez que você abriu o robots.txt do seu site?

Leandro Vieira

Uma das grandes referências de WordPress no Brasil, entusiasta e evangelista da plataforma. Fundador e CEO da Apiki, empresa especializada no desenvolvimento web com WordPress.
Qual nota você da para este artigo?
Ruim

O que você achou disso?

Clique nas estrelas

Média da classificação 0 / 5. Número de votos: 0

Nenhum voto até agora! Seja o primeiro a avaliar este post.

Excelente
Artigos Relacionados

Construa seu site WordPress sob medida com os maiores especialistas em WordPress da America Latina
Conheça a Apiki

Faça um comentário
Cadastre-se rápido

Fazer Login