Gerador de robots.txt
Escreva regras de rastreio que os motores de busca cumprem mesmo, já com o seu sitemap ligado.
O robots.txt controla o rastreio, não a indexação. Uma página bloqueada ainda pode aparecer nos resultados se outros sites lhe apontarem: use uma meta tag noindex para a manter de fora.
O que verifica
- Escreve um grupo User-agent: * a partir de uma de três predefinições: permitir tudo, bloquear os caminhos habituais de uma aplicação ou bloquear o site inteiro para um ambiente de testes.
- A predefinição de aplicação bloqueia /admin/, /cart/, /checkout/, /account/, /search e os URL ordenados que correspondem a /*?*sort=.
- Acrescenta uma linha Disallow por cada caminho adicional que indicar, e coloca a barra inicial se a tiver omitido.
- Se quiser, acrescenta grupos que bloqueiam GPTBot, CCBot, ClaudeBot, Google-Extended, anthropic-ai e PerplexityBot em todo o site.
- Acrescenta uma linha Sitemap que aponta para /sitemap.xml no site que introduzir.
- Cria o ficheiro no seu navegador, pronto a copiar ou a transferir como robots.txt.
Como ler o resultado
Cada valor Disallow aplica-se a partir do início do caminho. /search bloqueia /search?q=shoes, mas também /search-tips e /searchable-products. Compare a lista com os seus próprios URL e confirme que nenhuma página que quer que seja encontrada começa por um caminho bloqueado.
A linha Sitemap pressupõe que o seu sitemap está em /sitemap.xml. Se estiver noutro sítio, como /sitemap_index.xml, altere essa linha antes de carregar o ficheiro. O ficheiro só funciona na raiz do host, por exemplo https://example.com/robots.txt, e cada subdomínio precisa do seu.
A opção de rastreadores de IA bloqueia os seis bots indicados no ficheiro e nenhum outro. Alguns recolhem dados de treino e outros obtêm páginas para assistentes que citam as fontes, por isso bloquear os seis pode reduzir as vezes em que é citado. Deixe-os permitidos se ser citado nas respostas de IA for importante para si.
Perguntas
Verifica o meu robots.txt atual?
Não. Escreve um ficheiro novo a partir das opções que escolher e não consulta o seu site. Compare o resultado com o ficheiro publicado antes de o substituir, para manter as regras que foram acrescentadas de propósito.
Como mantenho um site de testes fora dos resultados de pesquisa?
Proteja-o com palavra-passe. A predefinição de testes pede aos rastreadores que não entrem, mas o robots.txt é um pedido, e um URL bloqueado pode aparecer na mesma se alguma coisa apontar para ele.
Os bots de IA também seguem as regras de User-agent: *?
Não. Um rastreador segue o grupo mais específico que o nomeia e ignora os restantes, por isso cada grupo de bot de IA funciona por si. Se acrescentar à mão um grupo para outro bot, repita as linhas Disallow que quer que ele respeite.
Preciso mesmo de um robots.txt?
Não. Sem ele, os rastreadores assumem que podem aceder a tudo. Mesmo assim, é útil para indicar aos rastreadores onde está o seu sitemap e para os manter fora de carrinhos, contas e resultados de pesquisa internos.
Isto verifica uma página, uma vez. A sua equipa verifica todas as páginas, todas as semanas, e corrige o que encontra.
Mais ferramentas grátis
Gerador de Etiquetas hreflang
Crie tags hreflang recíprocas para cada versão de idioma de uma página e detete os erros de código que as estragam sem aviso.
Limpador de Texto de IA
Encontre os caracteres de largura zero e as marcas de água escondidas no texto colado e elimine-os.
Verificador de sitemap.xml
Analise um sitemap em direto à procura dos erros que mantêm páginas fora do índice.
Verificador de meta tags
Veja exatamente o que os motores de busca e as redes sociais leem de uma página.
Pré-visualização de Excerto SERP
Veja onde um título e uma descrição vão ser cortados antes de os publicar.
Gerador de marcação schema
Gere JSON-LD válido para os tipos que os motores de busca usam de facto.