Menu fechado

Como impedir que o Gemini acesse o conteúdo do seu blog

Se você possui um blog e produz seus próprios artigos, provavelmente já percebeu uma mudança importante na internet: as pessoas não estão mais procurando informações apenas no Google tradicional.

Hoje, uma pergunta pode ser feita diretamente para uma inteligência artificial como o Gemini, e a resposta pode ser construída a partir de informações encontradas na internet.

Isso cria uma preocupação para muitos blogueiros:

Como impedir que o Gemini acesse o conteúdo do meu blog?

A boa notícia é que o Google oferece atualmente um mecanismo específico para que proprietários de sites controlem determinados usos do conteúdo rastreado pelo Google em relação ao Gemini.

Esse mecanismo se chama Google-Extended.

E existe uma característica especialmente interessante: bloquear o Google-Extended não significa bloquear o Google Search.

Ou seja, é possível criar uma política em que o seu site continue sendo rastreado pelo Google para aparecer nos resultados de pesquisa, enquanto você restringe determinados usos do conteúdo relacionados ao Gemini.

O que é o Google-Extended?

O Google-Extended é um token específico utilizado no arquivo robots.txt.

Ele permite que os proprietários de sites expressem uma preferência sobre determinados usos do conteúdo que o Google rastreia.

Segundo a documentação atual do Google, o Google-Extended pode ser utilizado para controlar se o conteúdo rastreado do site poderá ser usado para treinar futuras gerações de modelos Gemini que alimentam os aplicativos Gemini e a API Vertex AI para Gemini.

Ele também está relacionado ao uso do conteúdo para grounding, ou seja, quando informações do índice da Pesquisa Google são fornecidas ao modelo para melhorar a factualidade e a relevância das respostas.

Isso torna o Google-Extended particularmente interessante para quem possui um blog.

O Google-Extended é o mesmo que Googlebot?

Não.

Essa é uma das informações mais importantes para configurar corretamente a proteção.

O Google possui diferentes mecanismos de rastreamento.

O Googlebot é utilizado pela Pesquisa Google para rastrear páginas e encontrar conteúdo que possa aparecer nos resultados de pesquisa.

Já o Google-Extended é um token utilizado no robots.txt para controlar determinados usos relacionados ao Gemini e a outros produtos de IA do Google.

Portanto, não devemos simplesmente bloquear:

User-agent: Googlebot
Disallow: /

se a intenção for apenas impedir o uso do conteúdo pelo Gemini.

Fazer isso pode afetar diretamente a capacidade do Google de rastrear seu site para a Pesquisa.

O próprio Google informa que o Google-Extended não afeta a inclusão do site na Pesquisa Google nem é utilizado como sinal de classificação.

Essa diferença permite uma estratégia muito mais interessante:

Google Search → PERMITIDO

Gemini / usos controlados pelo Google-Extended → RESTRINGIDOS

Como bloquear o Google-Extended

A configuração básica é feita no arquivo:

robots.txt

Esse arquivo normalmente fica na raiz do domínio.

Por exemplo:

https://seusite.com/robots.txt

Para impedir que o Google-Extended rastreie o site, a regra pode ser:

User-agent: Google-Extended
Disallow: /

Isso significa:

Para o token Google-Extended, não permita o rastreamento de nenhuma área do site.

É uma configuração extremamente simples.

O código completo

Se o objetivo for manter o Google Search funcionando normalmente e restringir o Google-Extended, você pode utilizar uma estrutura como:

User-agent: Googlebot
Allow: /

User-agent: Google-Extended
Disallow: /

A primeira parte permite o rastreamento pelo Googlebot.

A segunda estabelece a restrição para o Google-Extended.

O ponto fundamental é não confundir os dois.

Posso bloquear o Gemini sem bloquear o Google?

Sim, essa é justamente uma das utilidades mais interessantes do Google-Extended.

Imagine que você tenha um blog com milhares de artigos.

Você quer continuar aparecendo no Google.

Portanto:

Googlebot
Allow: /

continua funcionando.

Mas você não quer que o conteúdo rastreado seja utilizado para determinadas finalidades relacionadas ao Gemini.

Então:

Google-Extended
Disallow: /

pode ser utilizado.

O Google afirma explicitamente que as preferências direcionadas ao Google-Extended não afetam a inclusão do site na Pesquisa Google nem são usadas como sinal de ranking.

Atenção: Google-Extended não é um User-Agent normal

Existe outra particularidade bastante importante.

Você pode procurar nos logs do servidor por algo como:

Google-Extended

e não necessariamente encontrar exatamente essa string como User-Agent.

Isso acontece porque o Google-Extended não possui uma string de User-Agent HTTP separada.

O Google explica que o rastreamento pode ocorrer utilizando os User-Agents existentes do Google, enquanto Google-Extended funciona como um token de controle dentro do robots.txt.

Portanto, não é correto pensar:

“Vou bloquear o IP ou User-Agent Google-Extended no meu servidor.”

A configuração foi criada para ser feita através do mecanismo de robots.txt.

Onde colocar o robots.txt?

O arquivo precisa estar na raiz do domínio.

Por exemplo:

https://exemplo.com/robots.txt

e não:

https://exemplo.com/blog/robots.txt

O Google informa que o robots.txt é válido para o host, protocolo e porta correspondentes à localização em que ele está hospedado.

Em um WordPress tradicional, a estrutura costuma ser:

public_html/
    wp-admin/
    wp-content/
    wp-includes/
    index.php
    robots.txt

Se o servidor já possui um robots.txt, você deve editar o arquivo existente em vez de simplesmente criar outro.

E se eu já tenho regras no robots.txt?

Nesse caso, não substitua tudo automaticamente.

Seu arquivo pode já possuir regras como:

User-agent: *
Disallow: /wp-admin/

ou:

Sitemap: https://exemplo.com/sitemap.xml

Você pode acrescentar a regra específica do Google-Extended:

User-agent: Google-Extended
Disallow: /

Mas é importante compreender como os grupos de robots.txt funcionam.

O Google seleciona o grupo mais específico que corresponde ao crawler. As regras não devem ser misturadas de maneira aleatória.

Por isso, um robots.txt deve ser revisado como um todo depois da alteração.

Exemplo de robots.txt para um blog

Uma configuração simples poderia ser:

User-agent: Googlebot
Allow: /

User-agent: Google-Extended
Disallow: /

User-agent: *
Allow: /

Sitemap: https://exemplo.com/sitemap.xml

A ideia seria:

Googlebot: pode rastrear.

Google-Extended: não deve rastrear.

Outros crawlers: seguem a regra geral.

Sitemap: continua declarado.

Mas existe uma observação importante: o comportamento de cada crawler depende de como ele interpreta e respeita o protocolo. O robots.txt não é um mecanismo de autenticação.

O robots.txt não é um bloqueio de segurança

Essa é uma diferença que precisa ficar muito clara.

Quando você coloca:

User-agent: Google-Extended
Disallow: /

você está dizendo:

“Google, não utilize o Google-Extended para rastrear estas áreas conforme essa preferência.”

Você não está criando uma parede de segurança impossível de atravessar.

O robots.txt funciona como um protocolo de instruções para crawlers.

O próprio Google explica que essas instruções não conseguem impor o comportamento de um crawler que simplesmente decida não obedecê-las.

Por isso, existem dois conceitos diferentes:

Controle de crawler

robots.txt

Segurança real

WAF
autenticação
CAPTCHA
sessão
controle de acesso

Se o objetivo for realmente impedir que qualquer programa consiga receber determinado conteúdo, será necessário proteger o conteúdo no nível do servidor.

Então o Gemini nunca mais poderá conhecer meu conteúdo?

Essa conclusão seria exagerada.

O Google-Extended permite controlar determinados usos do conteúdo rastreado pelo Google, mas isso não significa que seja possível apagar da internet todo conhecimento relacionado ao seu site.

Imagine que você publicou um artigo sobre determinado assunto.

Esse mesmo assunto pode existir:

  • em outros blogs;
  • em jornais;
  • em livros;
  • em redes sociais;
  • em documentos;
  • em páginas arquivadas;
  • em bancos de dados;
  • em outros sites que copiaram o seu conteúdo.

Mesmo que você impeça determinado uso do seu conteúdo pelo Google, a informação pode existir em outras fontes.

Portanto, é mais correto dizer:

Você pode controlar determinados caminhos pelos quais o Google utiliza o conteúdo do seu site, mas não pode controlar todo o conhecimento existente na internet.

E se o objetivo for impedir o Gemini de usar meu conteúdo?

Nesse caso, o Google-Extended é justamente o mecanismo que merece ser analisado primeiro.

Uma configuração típica seria:

User-agent: Google-Extended
Disallow: /

O Google documenta que esse token permite aos publishers controlar se o conteúdo rastreado pode ser utilizado para treinar futuras gerações de modelos Gemini e para determinados usos de grounding relacionados aos produtos Gemini.

Isso afeta meu posicionamento no Google?

De acordo com a documentação atual do Google, não.

O Google-Extended não afeta a inclusão do site na Pesquisa Google e não é utilizado como sinal de classificação.

Isso é uma diferença enorme em relação a simplesmente colocar:

User-agent: Googlebot
Disallow: /

Se você bloquear o Googlebot, estará interferindo diretamente no rastreamento utilizado pela Pesquisa.

Se você usar especificamente o Google-Extended, a finalidade é diferente.

Não confunda Google-Extended com noindex

Outro erro comum é utilizar:

<meta name="robots" content="noindex">

achando que isso é uma forma de dizer:

“Gemini, não use meu conteúdo.”

Não é a mesma coisa.

noindex é uma diretiva relacionada à indexação.

Se você colocar noindex em seus artigos, poderá impedir que eles apareçam nos resultados de pesquisa.

Isso é completamente diferente do objetivo de restringir usos específicos relacionados à IA.

O Google recomenda mecanismos diferentes para objetivos diferentes. Para controlar a exibição de conteúdo nos recursos de IA da própria Pesquisa, existem controles como nosnippet, data-nosnippet, max-snippet e noindex; para determinados usos em outros sistemas do Google, a documentação aponta para o Google-Extended.

E o AI Overview do Google?

Aqui existe uma diferença ainda mais interessante.

O Gemini não é exatamente a mesma coisa que os recursos de IA integrados à Pesquisa Google.

O Google possui recursos como:

  • AI Overviews;
  • AI Mode;
  • Gemini Apps;
  • Vertex AI;
  • outros sistemas que utilizam modelos generativos.

Por isso, bloquear o Google-Extended não deve ser interpretado como:

“Meu site nunca mais poderá aparecer em nenhuma resposta gerada por IA do Google.”

Os controles são diferentes dependendo do produto e da finalidade.

A própria documentação do Google explica que os recursos de IA da Pesquisa fazem parte da própria Pesquisa e possuem controles específicos, como nosnippet, data-nosnippet, max-snippet e noindex.

Como impedir que o conteúdo apareça nos resumos de IA da Pesquisa?

Se o objetivo for outro — por exemplo, reduzir a quantidade de conteúdo que o Google pode mostrar como prévia nos resultados de pesquisa e recursos de IA da Pesquisa — existem outras ferramentas.

Uma delas é:

<meta name="robots" content="nosnippet">

Outra possibilidade é limitar o tamanho do snippet:

<meta name="robots" content="max-snippet:0">

Também é possível utilizar:

data-nosnippet

para impedir que determinada parte do conteúdo seja utilizada como snippet.

Mas existe uma consequência importante:

essas configurações podem reduzir a forma como seu conteúdo aparece na Pesquisa Google.

Portanto, não devem ser utilizadas indiscriminadamente em um blog que depende de SEO.

Google-Extended e Google Search podem coexistir

Para um blog que depende de tráfego orgânico, uma das estratégias mais interessantes é justamente separar as duas coisas.

Por exemplo:

Google Search
        ↓
      SIM

Google-Extended
        ↓
      NÃO

O objetivo é continuar permitindo que o Google encontre e indexe seus artigos, sem conceder a mesma autorização para determinados usos relacionados ao Gemini.

Essa é uma estratégia muito mais inteligente do que simplesmente bloquear o Google inteiro.

E se eu quiser impedir qualquer inteligência artificial?

Aí entramos em outro nível.

Google-Extended é específico para o ecossistema do Google.

Ele não bloqueia:

  • ChatGPT;
  • Claude;
  • Perplexity;
  • crawlers independentes;
  • scrapers;
  • agentes de navegador;
  • bots criados por terceiros;
  • programas que ignoram robots.txt.

Para esses casos, é necessário utilizar outras camadas.

Uma arquitetura mais completa seria:

                    VISITANTE
                        ↓
                     CLOUDFLARE
                        ↓
                       WAF
                        ↓
                  BOT PROTECTION
                        ↓
                  RATE LIMITING
                        ↓
                   WORDPRESS
                        ↓
                 CONTEÚDO

E, para áreas realmente privadas:

CAPTCHA
   ↓
LOGIN
   ↓
SESSÃO
   ↓
AUTORIZAÇÃO
   ↓
CONTEÚDO

Esse tipo de proteção é muito mais forte porque não depende apenas da identidade declarada pelo robô.

Como impedir scraping do conteúdo

Se o seu verdadeiro problema não é apenas o Gemini, mas qualquer programa que tente copiar os seus artigos, então o problema passa a ser chamado de scraping.

Um scraper pode simplesmente fazer:

GET /artigo-1
GET /artigo-2
GET /artigo-3
GET /artigo-4
GET /artigo-5

até copiar milhares de páginas.

Nesse cenário, o robots.txt é apenas uma camada.

Uma proteção mais eficiente utiliza:

WAF + rate limiting + bot detection + bloqueio de IPs suspeitos + CAPTCHA + sessões + monitoramento de comportamento.

Assim, você pode detectar padrões como:

500 páginas em 2 minutos

e tratar esse comportamento de maneira diferente de um visitante humano.

Como proteger um blog WordPress

No WordPress, existe uma vantagem importante: você pode colocar o servidor atrás de uma camada externa de proteção.

Por exemplo:

Internet
   ↓
Cloudflare
   ↓
WAF
   ↓
Proteção contra bots
   ↓
WordPress

Isso significa que uma requisição suspeita pode ser bloqueada antes de chegar ao PHP.

É melhor do que deixar:

Bot
↓
WordPress
↓
PHP
↓
Banco de dados
↓
Página gerada
↓
bloqueio

Quanto mais cedo uma requisição maliciosa for interrompida, menor tende a ser o custo para o servidor.

O que fazer no Flogão ou em qualquer blog?

Para um site público que depende de Google, eu não começaria bloqueando o Googlebot.

Uma estratégia mais equilibrada seria:

Googlebot
→ PERMITIR

Google-Extended
→ RESTRINGIR

Visitantes humanos
→ PERMITIR

Scrapers
→ BLOQUEAR

Bots suspeitos
→ VERIFICAR

Coleta excessiva
→ RATE LIMIT

Áreas privadas
→ LOGIN + CAPTCHA

Dessa maneira, você não precisa escolher entre:

“Ter tráfego no Google”

ou:

“Proteger o conteúdo”.

É possível trabalhar com níveis diferentes de acesso.

Como verificar se a configuração está correta?

Depois de alterar o robots.txt, não basta simplesmente salvar o arquivo e esquecer.

Primeiro, confirme que ele está disponível em:

/robots.txt

Depois confira se a regra está exatamente como pretendida.

Por exemplo:

User-agent: Google-Extended
Disallow: /

Também é importante lembrar que o Google pode armazenar em cache o robots.txt; a documentação informa que normalmente ele é armazenado por até 24 horas, embora esse período possa variar em determinadas situações.

Portanto, uma alteração pode não produzir efeitos instantaneamente.

Um erro que você deve evitar

Não faça isto:

User-agent: *
Disallow: /

sem entender as consequências.

Essa regra pode bloquear praticamente todos os crawlers que obedecem ao robots.txt.

Se o seu blog depende de tráfego orgânico, isso pode ser uma péssima ideia.

O Google recomenda utilizar o robots.txt para controlar rastreamento, mas também alerta que ele não é um mecanismo para proteger uma página contra acesso público.

A configuração mais interessante para quem quer continuar no Google

Se a sua intenção for especificamente:

“Quero continuar aparecendo no Google, mas quero impedir os usos controlados pelo Google-Extended.”

Então a ideia central é:

User-agent: Googlebot
Allow: /

User-agent: Google-Extended
Disallow: /

Essa é provavelmente a configuração mais importante para compreender neste artigo.

Ela não transforma o conteúdo em privado.

Ela não impede todas as IAs.

Ela não impede pessoas de copiarem os textos.

Mas cria uma preferência explícita para o Google-Extended sem bloquear o Google Search.

A diferença entre impedir o Gemini e esconder seu conteúdo da internet

São duas coisas completamente diferentes.

Impedir determinado uso pelo Gemini

Você pode utilizar:

Google-Extended

Impedir o Google de rastrear seu conteúdo

Você pode utilizar regras para:

Googlebot

Impedir que uma página seja indexada

Você pode utilizar:

noindex

Impedir que determinado conteúdo seja utilizado como snippet

Você pode utilizar:

nosnippet
data-nosnippet
max-snippet

Impedir que qualquer pessoa tenha acesso

Você precisa de:

autenticação
senha
sessão
controle de acesso

Impedir automação

Você pode utilizar:

WAF
CAPTCHA
rate limiting
bot detection

Cada ferramenta resolve um problema diferente.

Conclusão

Se você possui um blog e está preocupado com o Gemini utilizando seus artigos, a primeira coisa que precisa saber é que não é necessário bloquear o Google inteiro para controlar determinados usos relacionados ao Gemini.

O Google oferece o Google-Extended, um token específico do robots.txt que permite aos publishers controlar determinados usos do conteúdo rastreado para treinamento de futuras gerações dos modelos Gemini e para determinados mecanismos de grounding.

A configuração básica é:

User-agent: Google-Extended
Disallow: /

E, se você quiser continuar permitindo o rastreamento normal do Google Search, pode manter:

User-agent: Googlebot
Allow: /

O ponto mais importante é que Google-Extended não é Googlebot. O próprio Google informa que o Google-Extended não possui um User-Agent HTTP separado e funciona como um token de controle no robots.txt.

Também é importante não acreditar que isso seja uma proteção absoluta contra toda inteligência artificial existente.

Se você quer realmente dificultar a cópia automatizada do conteúdo, a proteção deve ser ampliada:

Google-Extended
+
robots.txt
+
WAF
+
bot detection
+
rate limiting
+
CAPTCHA
+
controle de sessão
+
autenticação para conteúdo privado

A grande mudança de mentalidade é entender que SEO e proteção contra IA não precisam necessariamente ser inimigos.

Você pode permitir que o Google Search encontre seus artigos, continue recebendo visitantes e, ao mesmo tempo, declarar que não deseja determinados usos do conteúdo pelo ecossistema Gemini.

Essa é uma estratégia muito mais precisa do que simplesmente fechar o site para todos os robôs.

Por: Alexandre lavrador. Opinião do Blogueiro.

Por favor, não esqueça de colocar este link como Referência Bibliográfica em sua Publicação:

Please complete the required fields.




🙏 POR FAVOR COMPARTILHE ISSO 👇

Assistir Online Grátis Como impedir que o Gemini acesse o conteúdo do seu blog, Ver Online de Graça Como impedir que o Gemini acesse o conteúdo do seu blog, Filme Online Grátis Como impedir que o Gemini acesse o conteúdo do seu blog, Assistir Online de Graça Como impedir que o Gemini acesse o conteúdo do seu blog, Filme Completo de Graça Como impedir que o Gemini acesse o conteúdo do seu blog, Assista o que é Como impedir que o Gemini acesse o conteúdo do seu blog? Entenda a notícia sobre o que aconteceu sobre Como impedir que o Gemini acesse o conteúdo do seu blog.

Caso o título Como impedir que o Gemini acesse o conteúdo do seu blog esteja protegido por direitos autorais, você assistirá, neste artigo, a um filme gratuito disponível no YouTube que seja o mais parecido, sem ferir os direitos autorais de Como impedir que o Gemini acesse o conteúdo do seu blog. Aqui no Flogão, funciona de forma semelhante à banca de sucos do Chaves: “-O que parece de limão é de groselha e tem gosto de tamarindo. -Isso isso isso isso...”

Deixe um comentário

Nova denúncia

Fechar