Como escrever um arquivo robots.txt (com exemplos)
O arquivo robots.txt é um pequeno arquivo de texto com um poder descomunal: ele informa aos rastreadores dos mecanismos de pesquisa quais partes do seu site eles podem ou não acessar. Bem usado, mantém os rastreadores focados no que é importante. Usada sem cuidado, uma única linha pode ocultar acidentalmente todo o seu site do Google. Veja como fazer isso direito.
O que o robots.txt faz (e não faz)
Ele fica na raiz do seu domínio (seusite.com/robots.txt) e fornece instruções de rastreamento. Fundamentalmente, ele controla o rastreamento, não a indexação — uma página bloqueada no robots.txt ainda pode aparecer nos resultados se outros sites tiverem links para ela. Para realmente manter uma página fora da pesquisa, use uma meta tag noindex. A documentação robots.txt do Google explica isso claramente.
A sintaxe básica
Duas diretivas principais: User-agent (a qual rastreador a regra se aplica) e Disallow (o que não rastrear). Um arquivo simples que permite tudo:
User-agent: *
Não permitir:
E um que bloqueia uma pasta privada para todos os rastreadores:
User-agent: *
Não permitir: /private/
O erro perigoso
Essa única linha bloqueia todo o seu site de todos os rastreadores:
User-agent: *
Não permitir: /
É um acidente comum em sites movidos de um ambiente de teste, onde o bloqueio de tudo foi intencional. Sempre verifique esta linha antes e depois do lançamento. É o principal motivo pelo qual um novo site nunca aparece no Google.
Adicione seu mapa do site
A prática recomendada é apontar os rastreadores para o mapa do seu site a partir do robots.txt:
Mapa do site: https://yoursite.com/sitemap.xml
Gere-o sem risco
Em vez de editar e esperar manualmente, nosso gerador robots.txt gratuito cria um arquivo correto a partir de opções simples, para que você não bloqueie acidentalmente a coisa errada. Combine-o com um sitemap XML para controle completo de rastreamento.
Permitir regras e bloqueios específicos do rastreador
Além de Disallow, você pode usar Allow para criar exceções — por exemplo, bloquear uma pasta inteira, mas permitir um arquivo dentro dela. Você também pode segmentar rastreadores específicos por nome: um bloco User-agent: Googlebot aplica-se apenas ao Google, enquanto User-agent: * abrange todos os outros. Isso permite, digamos, permitir acesso total ao Google e, ao mesmo tempo, restringir um bot mais agressivo. As regras são correspondidas da forma mais específica primeiro, portanto, um rastreador nomeado segue seu próprio bloco e ignora o curinga.
Gerenciamento do orçamento de rastreamento em sites grandes
Em sites grandes, o robots.txt tem uma função de desempenho: evita que os rastreadores percam tempo com URLs de baixo valor (parâmetros de pesquisa facetada, resultados de pesquisa internos, infinitas combinações de filtros), para que eles gastem seu "orçamento de rastreamento" limitado em páginas importantes. Para sites pequenos, isso raramente é uma preocupação, mas à medida que você cresce, o bloqueio de armadilhas de rastreamento mantém o Google focado no seu conteúdo importante, em vez de em milhões de URLs de parâmetros quase idênticos.
Teste antes de confiar
Como uma linha errada pode ocultar todo o seu site, nunca edite o robots.txt às cegas. O Google Search Console inclui um relatório robots.txt que mostra como o Google lê seu arquivo e sinaliza erros. Após qualquer alteração, verifique se as páginas que você deseja indexar não foram bloqueadas acidentalmente - e confirme se a linha do mapa do site aponta para o URL ativo do mapa do site. Um teste de dois minutos evita o erro de SEO mais prejudicial que existe.
Resultado
robots.txt orienta os rastreadores para as partes corretas do seu site — mas lembre-se de que ele rege o rastreamento, não a indexação, e que Disallow: / oculta tudo. Gere-o com cuidado, vincule o mapa do seu site e verifique-o após cada lançamento. É uma linha de texto que pode aumentar ou diminuir sua visibilidade.