Robots.txt é um arquivo de texto simples na raiz do seu site que dá instruções aos robôs de mecanismos de busca sobre quais partes do site podem ou não ser rastreadas. É a primeira coisa que crawlers verificam antes de acessar qualquer página.
O arquivo vive em seusite.com.br/robots.txt e usa sintaxe simples para permitir ou bloquear acesso a URLs específicas, diretórios inteiros ou tipos de arquivo.
Sintaxe Básica do Robots.txt
# Exemplo de robots.txt
User-agent: *
Disallow: /admin/
Disallow: /carrinho/
Disallow: /busca?
Allow: /
Sitemap: https://seusite.com.br/sitemap.xml
User-agent: Qual robô a regra se aplica. * significa todos. Pode especificar: Googlebot, Bingbot, etc.
Disallow: Bloqueia acesso ao caminho especificado.
Allow: Permite acesso (útil para exceções dentro de diretórios bloqueados).
Sitemap: Indica localização do sitemap XML.
O Que Bloquear no Robots.txt
Áreas administrativas: /admin/, /wp-admin/, /painel/ - não têm valor para busca.
Páginas de busca interna: /busca?, /search? - geram infinitas URLs de baixo valor.
Páginas de carrinho/checkout: Não devem ser indexadas, são pessoais por sessão.
Arquivos de sistema: /cgi-bin/, /includes/, templates internos.
Páginas com parâmetros de sessão: ?sessionid=, ?ref= - evita duplicação.
Staging/desenvolvimento: Se acessível publicamente, bloqueie para não competir com produção.
O Que NÃO Bloquear
CSS e JavaScript: Google precisa renderizar páginas. Bloquear CSS/JS prejudica entendimento do layout.
Imagens importantes: Se quer aparecer no Google Images, não bloqueie imagens.
Páginas que quer indexar: Parece óbvio, mas erros acontecem. Verifique duas vezes.
Robots.txt vs Noindex: Qual Usar?
Robots.txt bloqueia rastreamento. Noindex bloqueia indexação. São diferentes:
Robots.txt: Impede o robô de acessar a página. Se a página tem backlinks externos, Google pode indexar a URL (sem conteúdo) mesmo sem rastrear.
Meta noindex: Permite rastreamento mas instrui a não indexar. Mais efetivo para remover páginas do índice.
Para páginas que não quer indexadas, use noindex, não robots.txt. Robots.txt é para economizar crawl budget, não para controlar indexação.
Crawl Budget e Robots.txt
Sites grandes têm "orçamento de rastreamento" - quantas páginas Google rastreia por dia. Bloquear áreas inúteis via robots.txt faz Google gastar esse orçamento em páginas importantes.
Para sites pequenos (menos de 10.000 páginas), crawl budget raramente é problema. Para e-commerces com milhões de produtos, otimizar robots.txt é crítico.
Erros Comuns com Robots.txt
Bloquear o site inteiro por acidente: Disallow: / bloqueia tudo. Desastre se não intencional.
Esquecer a barra: Disallow: admin bloqueia qualquer URL contendo "admin". Disallow: /admin/ bloqueia só o diretório.
Conflito Allow/Disallow: Se tem regras conflitantes, a mais específica vence. Teste sempre.
Achar que robots.txt esconde conteúdo: É sugestão, não segurança. Humanos e robôs mal-intencionados podem ignorar. Não use para proteger dados sensíveis.
Testando Robots.txt
Google Search Console tem ferramenta de teste de robots.txt. Cole seu arquivo, teste URLs específicas e veja se estão bloqueadas ou permitidas. Use antes de publicar mudanças.
Aprofunde seu Conhecimento
Explore conceitos relacionados e descubra como aplicar na pratica:
- Sitemap XML -- complemento essencial referenciado no robots.txt
- SEO Tecnico -- contexto tecnico de crawling e indexacao
- Hospedagem Web -- onde o arquivo robots.txt fica armazenado
- SEO na Integrare
Fontes e Referencias Externas
- Google -- Robots.txt Specifications -- especificacao oficial do Google
- Robotstxt.org -- referencia historica e padrao do protocolo