Bot de treino é o rastreador que provedores de inteligência artificial usam para coletar conteúdo dos sites e alimentar o aprendizado dos seus modelos de linguagem. Ele não te dá nada em troca: pega seu texto, leva para o treino e some.
Se você está tentando aparecer nas respostas do ChatGPT, do Claude ou do Perplexity, precisa saber que existe um segundo tipo de bot circulando pelo seu site. E confundir os dois pode custar caro.
Vou explicar a diferença. É mais sutil do que parece.
Os dois bots que batem na porta do seu site

Os provedores de IA normalmente usam dois robôs distintos para acessar o seu conteúdo. Cada um com um propósito diferente.
O primeiro é o bot de treino. Ele varre páginas em massa para engordar a base de conhecimento do modelo.
O segundo é o bot de citação, também chamado de agente de recuperação ao vivo. Ele entra no seu site na hora em que um usuário faz uma pergunta e a IA precisa buscar uma resposta atualizada.
A diferença prática é enorme.
O bot de treino consome seu conteúdo hoje para gerar respostas que talvez nunca citem você. O bot de citação busca sua página agora e pode mostrar seu nome, seu link, sua marca dentro da resposta.
Ou seja: um subsidia o modelo, o outro te devolve tráfego.
O caso da Anthropic deixou isso explícito
A Anthropic, criadora do Claude, separou formalmente esses dois papéis na sua documentação de rastreadores.
De um lado, o ClaudeBot, que é o scraper de treino. Ele coleta dados para o aprendizado do modelo.
Do outro, o agente que recupera informação ao vivo quando alguém faz uma pergunta no Claude.ai. Esse é o que pode gerar citação e, com ela, visitas ao seu site.
Repare no detalhe: são user-agents diferentes. Isso muda tudo na hora de configurar quem entra e quem fica de fora.
Segundo a documentação técnica sobre gestão de rastreadores de IA publicada pela Cubitrek, tratar todos os bots de IA como um bloco único é justamente o erro que faz sites perderem visibilidade sem querer.
Por que bloquear tudo é um tiro no pé
Aqui mora a decisão difícil.
Se você bloqueia os dois bots no seu robots.txt, você protege seu conteúdo do treino. Parabéns.
Mas também apaga qualquer chance de aparecer nas respostas geradas quando um cliente em potencial pergunta algo relacionado ao seu negócio.
Ou seja, você fica invisível na camada que mais cresce hoje.
Agora o outro extremo: se você não bloqueia nada, o bot de treino leva seu conteúdo de graça para alimentar o modelo. Você está, na prática, subsidiando o aprendizado da IA.
Convenhamos que nenhum dos dois extremos é confortável.
Na minha visão, a resposta quase nunca é tudo ou nada. É configuração fina.
A tese das duas audiências
Eu costumo dizer que hoje o seu site atende duas audiências ao mesmo tempo.
A primeira é o humano que chega pelo Google, lê, decide, compra.
A segunda é a máquina que lê seu conteúdo para responder outras pessoas. E essa máquina se divide justamente nos dois bots que estamos discutindo.
Pensar em GEO Técnico (a otimização do seu site para ser encontrado e citado por mecanismos de IA) é aceitar que o robots.txt virou uma ferramenta estratégica, não um arquivo esquecido na raiz do domínio.
Você decide quem entra. E, mais importante, com qual finalidade.
O orçamento de crawl entra na conta
Tem um fator que muita gente ignora: cada bot que passa pelo seu site consome recurso.
Imagine sua casa recebendo visitas o dia inteiro. Umas trazem presente, outras só abrem a geladeira e vão embora.
Com bots de IA é parecido. O bot de citação pode trazer tráfego qualificado. O bot de treino, na maioria dos casos, só consome banda e processamento do seu servidor.
Se o seu site já sofre com performance, liberar rastreamento indiscriminado de dezenas de crawlers de IA piora a situação.
Por isso o conceito de orçamento de crawl (o volume de rastreamento que faz sentido permitir) precisa entrar na sua estratégia. Não é só sobre bloquear ou liberar, é sobre priorizar quem realmente traz retorno.
Como decidir o que fazer com cada bot
Não existe configuração universal. Mas existe um raciocínio que costuma funcionar.
Identifique os user-agents: liste quais bots de IA acessam seu site e separe os de treino dos de citação. A documentação de cada provedor traz os nomes exatos.
Priorize os bots de citação: libere o acesso dos agentes que recuperam conteúdo ao vivo, porque são eles que podem gerar tráfego e menções à sua marca nas respostas.
Avalie caso a caso os bots de treino: decida se o valor de aparecer em modelos futuros compensa ceder seu conteúdo agora, sem retorno imediato garantido.
Monitore o consumo de recursos: acompanhe quanto cada crawler pesa no seu servidor e ajuste o orçamento de crawl para não sacrificar a performance do site.
Revise periodicamente: provedores lançam novos bots e mudam nomes de user-agents com frequência, então trate o robots.txt como um documento vivo.
Uma comparação rápida entre os dois bots
Aspecto | Bot de treino | Bot de citação |
|---|---|---|
Objetivo | Coletar conteúdo para treinar o modelo | Buscar resposta ao vivo para uma pergunta do usuário |
Retorno para você | Nenhum tráfego direto | Possível citação e visitas ao site |
Exemplo (Anthropic) | ClaudeBot | Agente de recuperação do Claude.ai |
Essa tabela resume o miolo da decisão. Os nomes mudam entre provedores, mas a lógica se repete.
Perguntas frequentes sobre bot de treino
Qual a diferença entre bot de treino e bot de citação?
O bot de treino coleta conteúdo do seu site para alimentar o aprendizado de um modelo de IA, sem devolver tráfego. O bot de citação acessa seu site no momento em que um usuário faz uma pergunta e pode incluir seu link e sua marca na resposta gerada, gerando visitas.
Bloquear o bot de treino faz perder citações na IA?
Depende de como você bloqueia. Se usar um robots.txt genérico que barra todos os bots de IA de uma vez, você perde também os bots de citação e some das respostas. O ideal é separar os user-agents e liberar seletivamente quem gera tráfego.
O que é orçamento de crawl no contexto de bots de IA?
É a quantidade de rastreamento que faz sentido permitir no seu site sem comprometer performance e recursos do servidor. Como cada bot consome banda e processamento, priorizar quem traz retorno (bots de citação) ajuda a manter o site rápido.
Onde encontro os nomes dos user-agents de cada provedor?
Na documentação oficial de rastreadores de cada empresa de IA. A Anthropic, por exemplo, publica os nomes do ClaudeBot e do agente de recuperação ao vivo, o que permite configurar o robots.txt com precisão.
Conclusão
A distinção entre bot de treino e bot de citação parece um detalhe técnico, mas é uma decisão de negócio.
Bloquear tudo te protege do treino e te apaga das respostas. Liberar tudo subsidia o modelo sem garantia de retorno.
O caminho, quase sempre, é a configuração fina: separar os user-agents, priorizar quem traz tráfego e tratar o robots.txt como parte da sua estratégia de GEO Técnico.
Aqui na Apiki, a gente trabalha exatamente essa camada com nossos clientes: preparar o site em WordPress para ser lido pela IA sem abrir mão de performance e controle.
WordPress que aparece na IA? Fale conosco.
E você, já olhou quem anda rastreando o seu site? Me conta como está o seu robots.txt hoje.