Pular para o conteúdo
conquisto
← Ferramentas

Verificador de Robôs de IA

Muita empresa bloqueia o ChatGPT sem saber — às vezes por uma linha no robots.txt, às vezes por uma regra de firewall que ninguém lembra de ter ligado. Informe seu domínio e veja bot a bot o que está acontecendo.

Treino e busca não são a mesma coisa

Esta é a distinção que decide o resultado, e quase todo tutorial em português erra. Cada empresa de IA opera dois tipos de robô, com nomes diferentes e regras independentes no robots.txt.

Os de treino (GPTBot, ClaudeBot, CCBot) coletam conteúdo para incorporar ao modelo. Os de busca (OAI-SearchBot, PerplexityBot, Google-Extended) leem sua página na hora em que alguém faz uma pergunta — e citam a fonte, com link.

A consequência prática: bloquear o GPTBot não tira você do ChatGPT. Bloquear o OAI-SearchBot, sim. Muita gente copiou de algum post um bloco que bloqueia tudo achando que estava protegendo o conteúdo, e o efeito colateral foi sumir das respostas — que é justamente onde estaria o tráfego.

Perguntas frequentes

Bloquear o GPTBot tira minha empresa do ChatGPT?
Não, e essa é a confusão mais cara do assunto. O GPTBot coleta conteúdo para treinar modelos. Quem decide se você aparece nas respostas com busca ativada é o OAI-SearchBot — outro robô, com outra regra no robots.txt. Dá para bloquear o treino e continuar sendo citado, que é o que muitos veículos de imprensa fazem.
Qual a diferença entre robô de treino e robô de busca?
Robô de treino (GPTBot, ClaudeBot, CCBot, Applebot-Extended) lê seu conteúdo para incorporá-lo ao modelo. Robô de busca (OAI-SearchBot, PerplexityBot, Claude-SearchBot, Google-Extended) lê para responder perguntas agora, citando a fonte. Se o objetivo é aparecer e receber cliques, os de busca são o que importa.
O que é o Google-Extended? Bloquear atrapalha meu SEO?
O Google-Extended controla apenas o uso do seu conteúdo no Gemini e nas respostas de IA do Google. Bloqueá-lo não afeta o ranking na busca tradicional — o Googlebot continua rastreando normalmente. Mas você sai das AI Overviews, que hoje aparecem em boa parte das buscas.
Meu robots.txt está liberado, mas o teste real falhou. O que houve?
Quase sempre é firewall, WAF ou proteção anti-bot da hospedagem devolvendo 403 antes que o robô chegue ao seu site. Cloudflare, Sucuri, Wordfence e regras de "bloquear bots suspeitos" fazem isso por padrão. É o pior cenário, porque o robots.txt sugere que está tudo certo. A correção é na hospedagem ou no painel do CDN, não no arquivo.
Como o teste de acesso real funciona?
Faço uma requisição de verdade ao seu site usando o User-Agent do GPTBot e o do PerplexityBot, e registro a resposta. A limitação honesta: falsifico o User-Agent, mas não o IP de origem. Firewalls que validam a faixa de IP oficial do robô podem tratar o robô verdadeiro de outro jeito. Um bloqueio aqui é sinal forte de problema; um "ok" é bom indício, não garantia.
Devo liberar todos os robôs?
Depende do seu modelo de negócio, e não existe resposta única. Se você vive de ser encontrado — serviço, software, consultoria —, liberar os de busca é quase sempre certo. Se o seu produto é o conteúdo (jornalismo, cursos, banco de imagens), faz sentido liberar busca e bloquear treino: você continua sendo citado sem alimentar modelos de graça.
Esta ferramenta guarda os dados do meu site?
Não. A verificação lê só o que já é público (robots.txt, llms.txt e a resposta HTTP da home) e devolve o resultado direto ao seu navegador. O resultado fica em cache por 30 minutos na borda para não bater no seu servidor à toa.

Depois de liberar os robôs

Acesso liberado é o mínimo, não o objetivo. O passo seguinte é entregar um índice do seu site com o gerador de llms.txt e entender o que está por trás de tudo isso no guia dos robôs de IA.

Receba os experimentos

Um e-mail quando sai ferramenta nova ou experimento com dados. Sem spam, sem "newsletter semanal" só para ocupar caixa de entrada.

Me manda um e-mail que eu te incluo na lista.