Escritório escuro com monitor exibindo painéis de dados estruturados em verde — conteúdo organizado no formato que as máquinas leem é a tese por trás dos Content Signals e do markdown para agentes
Cada vez mais, quem lê o seu site não é uma pessoa — é um agente. Dois padrões novos tratam disso.

Resposta direta: Content-Signal é uma diretiva no robots.txt, lançada pela Cloudflare em setembro de 2025, em que você declara o que os robôs podem fazer com o seu conteúdo — usar em busca (search), usar como insumo de respostas de IA (ai-input) e treinar modelos (ai-train), cada um com yes ou no. Markdown para agentes é a capacidade de servir suas páginas em markdown puro quando um agente de IA pede via header Accept: text/markdown — a mesma página gastando até 80% menos tokens. Nenhum dos dois é padrão consolidado, e o Google diz que ignora o primeiro. Mas os dois custam quase nada, sinalizam pro ecossistema que seu site trata agentes como visitantes de verdade — e este artigo ensina a configurar ambos.

Este artigo é a continuação natural do nosso guia sobre llms.txt: lá mostramos como resumir o site pras IAs; aqui, como declarar regras pro que elas fazem com o conteúdo e como entregar esse conteúdo no formato mais barato que existe pra elas. Se você caiu aqui direto, vale também o panorama de como fazer sua empresa aparecer no ChatGPT — os dois padrões deste artigo são camadas em cima daquela base.

O que são Content Signals?

Em 24 de setembro de 2025, a Cloudflare anunciou a Content Signals Policy: uma extensão do robots.txt pra resolver uma limitação antiga dele. O robots.txt clássico só sabe dizer quem pode acessar o quê — ele nasceu em 1994, quando "acessar" era a única coisa que um robô fazia. Em 2025, o mesmo acesso pode virar link numa busca, resposta gerada por IA ou material de treinamento de modelo — usos muito diferentes, sobre os quais o dono do site nunca teve como se pronunciar. O Content-Signal dá a sintaxe pra isso:

robots.txt — a sintaxe oficial
User-Agent: *
Content-Signal: search=yes, ai-train=no
Allow: /

São três sinais, com definições oficiais publicadas em contentsignals.org:

Sinal O que cobre (definição oficial) Tradução prática
search Construir índice de busca e exibir resultados: links e trechos curtos do seu site. Não inclui resumos de busca gerados por IA. "Pode me listar no Google/Bing clássico?"
ai-input Usar o conteúdo como insumo de modelos de IA: RAG, grounding e coleta em tempo real pra respostas generativas. "Pode me usar pra responder no ChatGPT/Perplexity?"
ai-train Treinar ou fazer fine-tuning de modelos de IA. "Pode aprender com meu conteúdo pra sempre?"

Detalhe importante da especificação: sinal omitido é neutralidade — você nem concede nem restringe aquele uso. Só se posiciona sobre o que declarar. A adoção começou grande: segundo a Cloudflare, mais de 3,8 milhões de domínios que usam o robots.txt gerenciado dela receberam a nova linguagem automaticamente.

Content Signals funcionam? A resposta honesta

Aqui a gente não vende fumaça — e a resposta tem duas metades.

Metade um: não é cadeado. A própria Cloudflare é explícita no anúncio: content signals expressam preferências, "não são contramedida técnica contra scraping". Um robô que quiser ignorar a linha, ignora — como sempre pôde ignorar o robots.txt inteiro. E o Google já se pronunciou da forma mais seca possível: John Mueller, da equipe de busca, afirmou que a diretiva "não tem efeito nenhum para qualquer crawler ou LLM" e que, por ora, "só adiciona peso e manutenção futura ao seu robots.txt". É o mesmo padrão de ceticismo que ele aplica ao llms.txt — e é informação que você merece ter antes de decidir.

Metade dois: sinalização tem valor próprio. Três motivos pra levar a sério mesmo assim:

  • É uma declaração legível por máquina da sua vontade — e a Cloudflare aponta que ela pode constituir reserva expressa de direitos sob o Artigo 4 da Diretiva 2019/790 da União Europeia (a diretiva de direito autoral que rege mineração de texto e dados). Não é garantia jurídica no Brasil, mas é registro público da sua posição, datado e versionável.
  • O assunto está em processo de padronização de verdade: existe um grupo de trabalho na IETF (o aipref) discutindo exatamente vocabulários de preferência de uso de conteúdo por IA. Quem já declara hoje entra no padrão amanhã sem retrabalho.
  • Custo zero. É uma linha num arquivo de texto que você já tem. A conta assimétrica do llms.txt vale idêntica aqui.

Como escolher os seus sinais?

Essa é a parte que os artigos gringos não respondem — porque a resposta depende do seu negócio. Pra um negócio local ou de serviços que QUER ser encontrado e citado (a maioria dos nossos leitores), dois sinais são óbvios:

  • search=yes — você quer estar no índice. Sempre.
  • ai-input=yesé assim que você aparece nas respostas do ChatGPT, do Gemini e do Perplexity. Bloquear ai-input sendo um negócio que vive de ser encontrado é atirar no próprio pé: quando alguém pergunta "melhor clínica perto de mim", você quer que a IA possa ler e citar o seu site.

O ai-train é o único trade-off real. no protege seu conteúdo de virar material de treinamento permanente sem crédito nem tráfego — posição legítima, e a mais comum entre editores. yes aposta no oposto: modelo que "conhece" sua marca de dentro pode citá-la mesmo sem buscar. Pra negócio local pequeno, nossa leitura na Rhodium: o efeito prático do ai-train é marginal nos dois sentidos — decida pelo princípio, não pela tática. Quem produz conteúdo autoral em volume (blog forte, pesquisa própria) tende a preferir no; quem só tem páginas institucionais perde pouco com qualquer escolha.

O robots.txt completo pra esse perfil, pronto pra copiar:

robots.txt — negócio que quer ser citado pelas IAs
# Preferências de uso de conteúdo (Content Signals Policy)
# search: pode indexar e listar em buscas
# ai-input: pode usar em respostas de IA (RAG/grounding)
# ai-train: NAO treinar modelos com este conteudo
User-Agent: *
Content-Signal: search=yes, ai-input=yes, ai-train=no
Allow: /

Sitemap: https://seusite.com.br/sitemap.xml

Publicou? Teste abrindo seusite.com.br/robots.txt numa aba anônima. Se o seu site está atrás da Cloudflare com robots.txt gerenciado, a linha pode já estar lá sem você saber — vale conferir se os valores refletem a sua decisão, não o default de quem gerencia.

O que é Markdown para agentes?

O segundo padrão ataca outro problema: desperdício. Uma página HTML carrega menu, script, CSS, tracking — ruído que um agente de IA paga em tokens pra depois descartar. Em fevereiro de 2026, a Cloudflare lançou o "Markdown for Agents": com o recurso ativo, qualquer cliente que enviar o header HTTP Accept: text/markdown recebe a mesma página convertida pra markdown puro, na hora, na borda da rede.

O número que importa, do exemplo oficial: um artigo que custa 16.180 tokens em HTML cai pra 3.150 tokens em markdown — 80% de redução. Um ## Sobre nós gasta ~3 tokens; o <h2 class="section-title" id="about"> equivalente, 12 a 15. A resposta convertida ainda vem com um header x-markdown-tokens informando o tamanho estimado — o agente sabe de antemão quanto contexto aquilo vai custar. É o mesmo raciocínio do llms.txt (markdown é a língua franca dos modelos), só que aplicado a todas as páginas, sob demanda.

Como testar se um site já responde markdown

terminal — teste de content negotiation
curl -s -H "Accept: text/markdown" https://seusite.com.br/ -o /dev/null \
  -w "content-type: %{content_type}\n"

# Se voltar "text/markdown": o site negocia conteudo pra agentes.
# Se voltar "text/html": nao negocia (comportamento padrao da web hoje).
# Bonus: com -i voce ve o header x-markdown-tokens quando existir.

Como implementar

  • Na Cloudflare: o recurso está em beta, sem custo adicional, pros planos Pro, Business, Enterprise e SSL for SaaS — liga e pronto, a conversão é automática. A Cloudflare também expõe AI.toMarkdown() no Workers AI e um endpoint /markdown na Browser Rendering API pra casos programáticos.
  • Fora da Cloudflare: não existe mágica equivalente — mas dá pra servir versões .md das páginas-chave geradas no build (a especificação do llms.txt já sugeria exatamente isso). Mais trabalho manual, mesmo espírito: o conteúdo importante disponível limpo.
  • Detalhe que conecta os dois padrões: as respostas markdown da Cloudflare saem com o header Content-Signal embutido — os dois padrões foram desenhados pra andar juntos.

E os Link headers (RFC 8288)?

Pra fechar o inventário de "sinais pra agentes", existe um terceiro mecanismo circulando nas discussões: usar o header HTTP Link — padronizado pela RFC 8288 (Web Linking, 2017) — pra anunciar recursos como catálogo de API ou a ficha de um servidor MCP. Honestidade direta: isso só interessa a quem vende produto técnico com API pública. Se o seu negócio é uma clínica, um restaurante ou uma consultoria, pode ignorar esta seção sem culpa — os dois padrões anteriores, mais schema e llms.txt, são o seu jogo completo.

Onde isso entra na sua pirâmide de presença digital

Juntando a série toda, a ordem de prioridade que aplicamos nos nossos próprios ativos e nos clientes da Presença Blindada:

  1. Base: site indexável, rápido, com conteúdo que responde perguntas — sem isso, nada abaixo importa (o guia completo está aqui).
  2. robots.txt + sitemap.xml: permissão e inventário — o básico de 30 anos de web.
  3. schema.org: os fatos do negócio estruturados nas páginas — comprovadamente usado por buscadores e IAs.
  4. llms.txt: o resumo canônico pra modelos de IA.
  5. Content-Signal + markdown para agentes: a camada nova — suas regras declaradas e seu conteúdo no formato nativo dos agentes. É onde a web está indo; custa uma linha e um toggle chegar antes.

O plano de 15 minutos (faça hoje)

  1. Abra o seu robots.txt (seusite.com.br/robots.txt). Não existe? Esse é o passo zero — crie um, nem que seja só com User-Agent: * e Allow: /. Existe? Confira se algum gestor (Cloudflare, agência, plugin) já inseriu um Content-Signal sem você decidir os valores.
  2. Decida os três sinais em voz alta. "Quero aparecer em busca?" (quase sempre sim). "Quero que IAs usem meu conteúdo pra me citar em respostas?" (se você vive de ser encontrado: sim). "Aceito treinar modelos?" (sua escolha de princípio). Adicione a linha com a sua decisão — o bloco pronto está acima.
  3. Rode o curl do teste de markdown no seu site e nos 2 principais concorrentes. Saber quem já trata agente como cidadão de primeira classe no seu mercado é inteligência competitiva de graça.
  4. Se estiver na Cloudflare em plano pago, ative o Markdown for Agents (é um toggle, está em beta sem custo). Se não estiver, anote pra próxima conversa com quem cuida do seu site.
  5. Confira as outras camadas da pirâmide: schema nas páginas e llms.txt na raiz. Content-Signal declarando ai-input=yes num site que não dá às IAs nada citável é convite sem endereço.

Quinze minutos, custo zero, e o seu site passa a fazer parte da minoria que se posicionou — enquanto a maioria dos concorrentes nem sabe que essa camada existe. É exatamente o tipo de vantagem que janelas novas dão pra quem chega cedo, como argumentamos no guia de como aparecer no ChatGPT.

Quer saber como as IAs enxergam o seu negócio hoje?

Antes de otimizar qualquer camada, vale ver o retrato: o Raio-X da Invisibilidade entrega o diagnóstico completo — o que o ChatGPT, o Gemini e o Perplexity respondem sobre o seu segmento na sua região, quais concorrentes já são citados no seu lugar e como está sua presença no Google, no Maps, nas avaliações e no Instagram. O relatório é seu, siga com a gente ou não.

Perguntas frequentes

Content-Signal bloqueia as IAs de usarem meu conteúdo?

Não. A própria Cloudflare é explícita: content signals expressam preferências, não são contramedida técnica contra scraping. Um robô mal-intencionado ignora a diretiva. O valor está em outra camada: é uma declaração pública e legível por máquina da sua vontade — que, segundo a Cloudflare, pode constituir reserva expressa de direitos sob o Artigo 4 da Diretiva 2019/790 da União Europeia — e robôs de empresas sérias tendem a respeitar sinais assim com o tempo.

Devo colocar ai-train=no no meu site?

Depende do seu negócio. Para um negócio local que quer ser citado pelas IAs, search=yes e ai-input=yes são claros — é assim que você entra nas respostas. O ai-train é um trade-off: "no" protege seu conteúdo de virar material de treinamento sem crédito; "yes" aumenta a chance de o modelo conhecer sua marca de forma nativa. Não existe resposta única — existe decisão consciente, que é exatamente o que a diretiva permite expressar.

Preciso estar na Cloudflare para usar Content Signals ou Markdown para agentes?

Para o Content-Signal, não: o robots.txt é seu, é um arquivo de texto na raiz do site — basta adicionar a linha, em qualquer hospedagem. Já a conversão automática de HTML para markdown via header Accept: text/markdown é um recurso da rede da Cloudflare (em beta para planos pagos); fora dela, dá para servir versões .md das páginas manualmente ou por build — mais trabalho, mesmo efeito.

Isso substitui o llms.txt ou o schema.org?

Não — são camadas complementares. O schema.org estrutura os fatos nas páginas (e é comprovadamente usado por buscadores). O llms.txt resume o site para modelos de IA. O Content-Signal declara o que os robôs podem fazer com o conteúdo, e o markdown para agentes entrega esse conteúdo no formato mais barato para eles lerem. A base continua sendo site indexável com conteúdo citável — sem ela, nenhuma dessas camadas produz efeito.

Pra seguir na série: o que é llms.txt e como escrever o seu · como fazer sua empresa aparecer no ChatGPT · GEO, AEO e SEO: o que são e qual a diferença.

Referências

  1. Cloudflare. Giving users choice with Cloudflare's new Content Signals Policy. Blog oficial, 24 set. 2025 (sintaxe, definições dos três sinais, comportamento de sinal omitido, Artigo 4 da Diretiva UE 2019/790, adoção de 3,8 milhões de domínios).
  2. Cloudflare. Content Signals Policy — site canônico da política. contentsignals.org.
  3. Search Engine Roundtable. Google Says Cloudflare Content Signals Robots.txt Directive Has No Effects Whatsoever — declaração de John Mueller (Google) de que a diretiva não tem efeito para os crawlers do Google. (Acesso direto ao portal bloqueia robôs; conteúdo verificado em múltiplas reproduções da declaração.)
  4. Cloudflare. Introducing Markdown for Agents. Blog oficial, 12 fev. 2026 (header Accept: text/markdown, exemplo de 16.180 → 3.150 tokens, header x-markdown-tokens, disponibilidade em beta).
  5. Cloudflare Docs. Markdown for Agents — referência técnica. developers.cloudflare.com.
  6. Nottingham, M. RFC 8288 — Web Linking. IETF, out. 2017.
  7. Howard, J. The /llms.txt file — especificação. llmstxt.org, set. 2024.
  8. Google Search Central. Google's Guide to Optimizing for Generative AI Features on Google Search. Documentação oficial, Google for Developers.
R

Sobre o autor

Rhodion Souza Araújo é fundador e CEO da Rhodium Tecnologia, em breve completando 30 anos de trajetória em tecnologia e mais de 100 automações entregues em produção desde 2016 — de apps e agentes de IA a hardware de venda autônoma com mais de 800 unidades em campo. A Rhodium aplica Content Signals e conteúdo legível por agentes nos próprios ativos e nos clientes que atende. LinkedIn