Saltar para o conteúdo
Blume
Português
Esc
navegarabrir⌘Jpré-visualizar
Nesta página

Sitemap e robots

O sitemap.xml e o robots.txt que o Blume escreve para os crawlers, e a linha Content-Signal que diz aos crawlers de IA como eles podem usar sua documentação.

Crawlers de busca e crawlers de IA começam pelos mesmos dois arquivos na raiz do seu site. O Blume escreve os dois a cada build, e o robots.txt carrega os sinais de uso de conteúdo que os crawlers de IA procuram, então é aqui que o lado da busca e o lado dos agentes da descobribilidade se encontram.

Sitemap

O Blume escreve um sitemap.xml com todas as páginas indexáveis no momento do build. Ele precisa de um deployment.site absoluto e lista todas as páginas exceto rascunhos, ocultas e páginas com noindex. Em um site versionado, páginas arquivadas cuja canonical aponta para o equivalente ativo também ficam de fora — a página ativa é a que deve ser indexada. Ativado por padrão:

seo: {
  sitemap: true,
}

Envie seu próprio public/sitemap.xml para assumir o controle — o Blume nunca sobrescreve um arquivo que você coloca em public/.

Robots

O Blume escreve um robots.txt que permite todos os crawlers, declara seus content signals e adiciona uma linha Sitemap: apontando para o sitemap quando houver um disponível. Ativado por padrão:

seo: {
  robots: true,
}
User-agent: *
Content-Signal: search=yes, ai-input=yes, ai-train=yes
Allow: /

Sitemap: https://docs.example.com/sitemap.xml

Content signals

A linha Content-Signal — a convenção emergente de uso de conteúdo — declara como os crawlers de IA podem reutilizar sua documentação. O Blume a emite ativada por padrão, com todos os sinais definidos como yes, refletindo sua postura de que a documentação está aberta tanto para humanos quanto para agentes:

  • search — indexação de busca tradicional e por IA
  • aiInput — grounding / RAG no momento da resposta
  • aiTrain — treinamento de modelos

Restrinja qualquer sinal definindo-o como false; os que você deixar de fora continuam como yes:

seo: {
  contentSignals: {
    aiTrain: false, // opt out of training, keep search + grounding
  },
}
User-agent: *
Content-Signal: search=yes, ai-input=yes, ai-train=no
Allow: /

Defina contentSignals: false para remover a declaração por completo:

seo: {
  contentSignals: false,
}
PropType
seo.contentSignals?boolean | object

Declaração Content-Signal. true ou omitido emite todos os sinais como yes; false remove a linha; um objeto define os sinais individualmente.

Typeboolean | object
contentSignals.search?boolean

Permite o uso para indexação de busca (search). Padrão true.

Typeboolean
contentSignals.aiInput?boolean

Permite o uso para grounding / RAG de IA no momento da resposta (ai-input). Padrão true.

Typeboolean
contentSignals.aiTrain?boolean

Permite o uso para treinamento de modelos de IA (ai-train). Padrão true.

Typeboolean

Content signals expressam uma preferência, não controle de acesso: eles dizem aos crawlers bem-comportados como você gostaria que seu conteúdo fosse usado, e cabe ao crawler respeitá-los. A mesma política é espelhada como contentUsage no manifesto de legibilidade para agentes, então um agente que nunca lê o robots.txt mesmo assim a enxerga.

Envie seu próprio public/robots.txt para assumir o controle.

Esta página foi útil?