A inteligência artificial mudou completamente a maneira como as pessoas encontram informações na internet. Em vez de acessar vários sites, cada vez mais usuários fazem uma pergunta diretamente para uma IA e recebem uma resposta pronta.
Para quem mantém um blog, isso criou um problema importante: o usuário pode obter a informação produzida pelo site sem necessariamente visitar o site.
Isso é especialmente preocupante para blogs que investem tempo na produção de artigos originais, notícias, tutoriais, análises, críticas, listas e outros conteúdos que dependem de tráfego orgânico.
Uma das perguntas que passou a aparecer com frequência entre os proprietários de sites é:
Como impedir que o Gemini utilize o conteúdo do meu blog?
A boa notícia é que o Google oferece um mecanismo específico para publishers controlarem o uso de seu conteúdo pelo ecossistema Gemini: o Google-Extended.
E existe uma diferença muito importante entre impedir que o Gemini utilize seu conteúdo e impedir que o Google encontre seu site.
O Google-Extended é a principal ferramenta
O Google criou o token Google-Extended para que proprietários de sites possam informar ao Google se desejam permitir que o conteúdo rastreado seja utilizado para determinados usos relacionados aos modelos Gemini.
O controle pode ser feito pelo arquivo robots.txt.
A própria documentação do Google explica que o Google-Extended pode controlar se o conteúdo rastreado de um site pode ser utilizado para treinamento de futuras gerações dos modelos Gemini e também para determinados usos de grounding, ou seja, utilização de conteúdo da web para ajudar o modelo a produzir respostas mais relevantes.
A configuração básica para bloquear o Google-Extended é:
User-agent: Google-Extended
Disallow: /
Isso significa, na prática, que você está dizendo:
Google-Extended, não utilize o conteúdo deste site para as finalidades controladas por esse token.
E o mais interessante: isso não precisa bloquear o Google da Pesquisa
Essa é uma das informações mais importantes para quem possui um blog.
Bloquear o Google-Extended não é a mesma coisa que bloquear o Googlebot.
O próprio Google informa que o Google-Extended não interfere na inclusão do site na Pesquisa Google e também não é utilizado como sinal de classificação.
Portanto, você pode ter uma configuração como:
User-agent: Googlebot
Allow: /
User-agent: Google-Extended
Disallow: /
A ideia é simples:
Googlebot: pode continuar rastreando o site para a Pesquisa Google.
Google-Extended: não pode utilizar o conteúdo nas finalidades controladas pelo Google-Extended.
Essa é provavelmente a configuração mais interessante para um blog que quer continuar recebendo visitantes do Google, mas não quer contribuir para determinadas utilizações do conteúdo pelo Gemini.
O que exatamente essa configuração bloqueia?
É importante não interpretar o Google-Extended como um botão mágico chamado “bloquear toda e qualquer inteligência artificial”.
Ele é um controle específico do Google.
O Google explica que o Google-Extended é um token de produto utilizado para controlar se conteúdos rastreados podem ser usados para treinamento futuro dos modelos Gemini e para determinados usos de fundamentação (grounding) nos produtos Gemini.
Portanto, o código:
User-agent: Google-Extended
Disallow: /
é muito importante, mas não significa que absolutamente nenhuma IA existente no mundo poderá conhecer qualquer informação publicada no seu site.
Existem várias outras formas de uma informação chegar a um sistema de inteligência artificial.
O Gemini já pode conhecer informações que estavam disponíveis anteriormente
Imagine que seu artigo esteja publicado há cinco anos.
Durante esse período, ele pode ter sido:
- indexado por mecanismos de busca;
- citado por outros sites;
- reproduzido em redes sociais;
- arquivado;
- mencionado em fóruns;
- copiado por terceiros;
- incluído em bancos de dados;
- acessado por usuários;
- utilizado em páginas que você não controla.
Bloquear o Google-Extended hoje não apaga automaticamente todas as informações que eventualmente já tenham chegado a sistemas externos.
Por isso, existe uma diferença entre:
impedir novos usos controlados pelo Google
e
apagar tudo o que uma IA já possa saber sobre seu site.
A segunda possibilidade não é algo que um simples robots.txt consiga garantir.
E se eu quiser impedir também que o Google use meus textos nas respostas da Pesquisa com IA?
Aqui a situação muda.
O Google possui controles específicos para limitar a forma como o conteúdo aparece na Pesquisa e nos recursos de inteligência artificial incorporados à Pesquisa.
Entre esses controles estão:
nosnippet;max-snippet;data-nosnippet;noindex.
A documentação oficial do Google informa que nosnippet impede a utilização do conteúdo como entrada direta para as Visões gerais criadas por IA e para o Modo IA.
Isso é diferente do Google-Extended.
O Google-Extended é voltado para determinados usos do conteúdo nos sistemas Gemini.
Já nosnippet e max-snippet controlam a quantidade de conteúdo que o Google pode utilizar ou mostrar em determinados recursos de pesquisa.
O problema do nosnippet
Existe, porém, uma consequência muito importante.
Se você colocar:
<meta name="robots" content="nosnippet">
você não está dizendo apenas:
“Gemini, não use meu artigo.”
Você também está restringindo o snippet que o Google pode mostrar nos resultados de pesquisa.
A documentação do Google deixa claro que nosnippet impede a exibição de um snippet de texto e também impede que o conteúdo seja usado como entrada direta para as Visões gerais criadas por IA e o Modo IA.
Ou seja, existe uma troca.
Você ganha mais controle sobre a utilização do conteúdo, mas pode perder parte da capacidade de o Google apresentar trechos do seu artigo nos resultados.
E existe o max-snippet
Outra alternativa é:
<meta name="robots" content="max-snippet:0">
Segundo a documentação do Google, max-snippet:0 equivale a nosnippet.
Você também pode utilizar um número positivo.
Por exemplo:
<meta name="robots" content="max-snippet:100">
Nesse caso, você estabelece um limite de caracteres para o snippet textual.
Isso pode ser interessante para quem não quer eliminar completamente a possibilidade de aparecer em resultados tradicionais, mas deseja reduzir a quantidade de texto disponibilizada para determinados recursos de IA.
E o data-nosnippet?
Existe ainda uma alternativa muito interessante para quem não quer bloquear o snippet da página inteira.
Você pode marcar somente determinadas partes do conteúdo com:
<div data-nosnippet>
Conteúdo que você não quer disponibilizar para snippets.
</div>
O Google reconhece data-nosnippet em elementos como span, div e section.
Isso permite uma estratégia mais seletiva.
Por exemplo, imagine que seu artigo tenha:
- título;
- introdução;
- resumo;
- conteúdo principal;
- conclusão.
Você poderia deixar algumas informações disponíveis para a Pesquisa e marcar partes específicas como não disponíveis para snippets.
Essa abordagem é mais sofisticada do que simplesmente colocar nosnippet na página inteira.
Mas eu quero que o Gemini não pegue meu blog inteiro
Se esse é o objetivo, a primeira configuração que eu analisaria é:
User-agent: Google-Extended
Disallow: /
Essa configuração deve ficar no robots.txt do seu domínio.
Ela é especialmente interessante porque permite separar duas coisas:
Pesquisa Google
e
uso controlado pelo Google-Extended relacionado ao Gemini.
O próprio Google afirma que bloquear o Google-Extended não impede a inclusão do site na Pesquisa Google.
Como ficaria um robots.txt completo?
Um exemplo simples seria:
User-agent: Googlebot
Allow: /
User-agent: Google-Extended
Disallow: /
Sitemap: https://www.seusite.com/sitemap_index.xml
Naturalmente, você deve substituir o endereço do sitemap pelo sitemap real do seu site.
A parte mais importante para o objetivo deste artigo é:
User-agent: Google-Extended
Disallow: /
Não confunda Google-Extended com Googlebot
Essa confusão é bastante comum.
Veja a diferença:
Googlebot
É o rastreador utilizado pelo Google para diversas funções relacionadas à Pesquisa.
Se você bloquear:
User-agent: Googlebot
Disallow: /
estará impedindo o Googlebot de rastrear o conteúdo.
Isso pode afetar diretamente a presença do seu site na Pesquisa Google.
Google-Extended
É um token específico de controle.
Você pode bloqueá-lo:
User-agent: Google-Extended
Disallow: /
sem necessariamente bloquear o Googlebot da Pesquisa. O Google afirma expressamente que o Google-Extended não afeta a inclusão do site na Pesquisa nem funciona como fator de classificação.
Essa diferença é fundamental.
E se eu bloquear o Googlebot também?
Aí a estratégia muda completamente.
Você poderia fazer:
User-agent: Googlebot
Disallow: /
Mas isso significa que você está essencialmente dizendo ao Google:
não rastreie meu site.
Se o objetivo do blog é receber tráfego através da Pesquisa Google, isso provavelmente é uma péssima escolha.
Você estaria sacrificando uma das maiores fontes potenciais de visitantes simplesmente para impedir o acesso do Google ao conteúdo.
Por isso, se sua intenção é continuar aparecendo no Google, mas restringir o uso relacionado ao Gemini, o Google-Extended é muito mais interessante.
Existe uma maneira de impedir qualquer inteligência artificial?
Não existe uma regra universal capaz de bloquear toda inteligência artificial existente.
Imagine que você publique:
“A cidade de São Paulo possui determinada característica…”
Uma pessoa pode ler esse artigo e escrever a informação em outro lugar.
Outro site pode copiar a informação.
Um usuário pode perguntar ao ChatGPT sobre aquilo.
Outro mecanismo pode indexar a página.
Uma ferramenta pode acessar o conteúdo diretamente.
Uma IA pode receber a informação através de uma fonte diferente.
Por isso, não existe uma configuração que consiga garantir:
“nenhuma inteligência artificial jamais poderá saber qualquer informação publicada neste site.”
O que você consegue fazer é controlar os principais caminhos que estão sob seu controle.
O robots.txt não é uma parede de concreto
Também é importante entender a natureza do robots.txt.
Ele funciona como uma instrução para rastreadores que respeitam as regras.
Não é um sistema de autenticação.
Não é um firewall.
Não criptografa o conteúdo.
Não impede tecnicamente qualquer pessoa de acessar a página.
Não substitui uma proteção de servidor.
Portanto, um robots.txt bem configurado é uma ferramenta de controle de rastreamento, não uma barreira absoluta contra cópia.
Se o conteúdo é realmente privado, não o publique abertamente
Essa é talvez a regra mais importante.
Se determinado conteúdo precisa ser realmente inacessível para terceiros, não basta colocá-lo em uma página pública e tentar esconder o texto dos robôs.
O ideal é utilizar:
- login;
- autenticação;
- controle de acesso;
- páginas privadas;
- conteúdo protegido;
- permissões no servidor;
- sistemas de membros.
Se o conteúdo está publicamente acessível na internet, você deve considerar que ele pode ser acessado por pessoas e sistemas automatizados.
Bloquear o Gemini prejudica o SEO?
O Google-Extended, por si só, não é apresentado pelo Google como um fator de classificação da Pesquisa.
O Google afirma que ele não afeta a inclusão de um site na Pesquisa Google e não é usado como sinal de ranking.
Portanto, uma estratégia baseada exclusivamente em:
User-agent: Google-Extended
Disallow: /
é muito diferente de colocar:
User-agent: Googlebot
Disallow: /
ou utilizar noindex.
O primeiro procura controlar determinados usos relacionados ao Gemini.
O segundo interfere no rastreamento da Pesquisa.
O terceiro pode remover páginas dos resultados.
São coisas completamente diferentes.
O problema de usar noindex
Se você utilizar:
<meta name="robots" content="noindex">
estará pedindo aos mecanismos de pesquisa para não indexarem aquela página.
Isso pode ser útil em determinadas situações, mas é completamente diferente do objetivo de impedir apenas a utilização do conteúdo pelo Gemini.
Se você quer que seu artigo continue aparecendo no Google, não use noindex simplesmente como forma de tentar bloquear a IA.
Uma estratégia mais inteligente para um blog
Para um blog que depende de tráfego orgânico, eu separaria a estratégia em camadas.
Primeira camada: manter o Google Search
Continue permitindo o Googlebot:
User-agent: Googlebot
Allow: /
Segunda camada: bloquear o Google-Extended
Adicione:
User-agent: Google-Extended
Disallow: /
Terceira camada: decidir sobre snippets
Só utilize:
<meta name="robots" content="nosnippet">
se você realmente aceitar abrir mão dos snippets de texto.
Essa decisão deve ser tomada com cuidado porque ela também afeta a forma como o Google apresenta seu conteúdo.
Quarta camada: proteger conteúdos específicos
Se existem trechos especialmente valiosos, você pode avaliar o uso de:
data-nosnippet
em partes específicas.
Quinta camada: proteger conteúdos realmente privados
Se algo não pode ser acessado por terceiros, coloque atrás de autenticação.
E o Bing?
Bloquear o Google-Extended não bloqueia outros sistemas de inteligência artificial.
O Google-Extended é um mecanismo específico do Google.
Portanto, se o seu objetivo for uma política muito mais ampla, você terá que analisar separadamente os mecanismos de rastreamento e as políticas de cada provedor de IA.
Não existe um comando universal como:
User-agent: ALL-AI
Disallow: /
que magicamente bloqueie todas as inteligências artificiais.
E se uma IA encontrar meu artigo através do Google?
Esse é um ponto particularmente importante.
O Google explica que o Google-Extended também está relacionado ao uso de conteúdo do índice da Pesquisa para grounding em determinados produtos Gemini.
Portanto, bloquear o Google-Extended é justamente uma das medidas que o Google disponibiliza para publishers que não querem que seu conteúdo seja utilizado dessa maneira nas experiências abrangidas pelo controle.
Mas isso não significa que seu conteúdo será apagado da Pesquisa.
Seu site pode continuar indexado.
Essa é a grande diferença.
Então qual configuração eu usaria?
Se a intenção for:
“Quero continuar aparecendo no Google, mas não quero permitir o uso do meu conteúdo pelo Gemini nas finalidades controladas pelo Google-Extended.”
Eu começaria com:
User-agent: Googlebot
Allow: /
User-agent: Google-Extended
Disallow: /
E manteria as configurações normais de SEO.
Não colocaria noindex.
Não bloquearia o Googlebot.
Não removeria o sitemap.
E não utilizaria nosnippet sem antes decidir conscientemente se quero abrir mão dos snippets da Pesquisa.
E se eu quiser ser ainda mais radical?
Se o objetivo for:
“Não quero que o Google tenha acesso ao conteúdo do meu blog.”
então a situação é completamente diferente.
Nesse caso, você poderia bloquear o Googlebot:
User-agent: Googlebot
Disallow: /
Mas isso também significa abrir mão da capacidade normal de o Google rastrear suas páginas para a Pesquisa.
Para um blog que depende de SEO, geralmente não é uma boa troca.
A melhor solução para quem vive de conteúdo
Para quem produz artigos originais, existe um dilema inevitável.
De um lado, queremos que mecanismos de busca encontrem nossos artigos.
Do outro, não queremos que uma IA simplesmente responda à pergunta do usuário usando o trabalho que produzimos e faça com que o usuário não visite o site.
Por isso, a estratégia mais equilibrada é separar:
indexação
de
uso do conteúdo por inteligência artificial.
O Google-Extended é importante justamente porque permite esse tipo de separação dentro do ecossistema Google.
Como verificar se a configuração está funcionando?
Depois de alterar o robots.txt, não espere que tudo mude instantaneamente.
Os rastreadores precisam voltar ao site e processar a alteração.
Além disso, o Google informa que mudanças nas regras e controles podem levar algum tempo para serem processadas após um novo rastreamento.
Também é importante verificar se o robots.txt está realmente disponível no endereço correto do domínio.
Um arquivo mal configurado não produz o resultado esperado.
Uma configuração recomendada
Para quem possui um blog público e quer continuar recebendo tráfego do Google, uma configuração inicial bastante interessante é:
User-agent: Googlebot
Allow: /
User-agent: Google-Extended
Disallow: /
Essa configuração transmite duas mensagens diferentes:
Googlebot: você pode continuar encontrando minhas páginas.
Google-Extended: não quero que meu conteúdo seja utilizado nas finalidades controladas por este token.
Essa é uma solução muito mais inteligente do que simplesmente bloquear o Google inteiro.
Mas isso não impede cópia por terceiros
Mesmo depois de configurar o Google-Extended, seu conteúdo continuará público.
Isso significa que alguém pode copiar um artigo.
Um site pode reproduzi-lo.
Uma pessoa pode fazer uma captura de tela.
Um usuário pode fornecer seu artigo diretamente a uma inteligência artificial.
Outro sistema pode obter a informação por uma fonte diferente.
Por isso, nenhuma configuração de robots deve ser interpretada como proteção absoluta contra cópia.
A conclusão mais importante
Se você possui um blog e está preocupado especificamente com o Gemini, existe uma ferramenta oficial do próprio Google para isso.
O caminho principal é o Google-Extended.
A configuração:
User-agent: Google-Extended
Disallow: /
permite que você peça ao Google para não utilizar o conteúdo rastreado do seu site nas finalidades controladas por esse token, relacionadas ao treinamento futuro de modelos Gemini e a determinados usos de grounding.
E o ponto mais interessante é que bloquear o Google-Extended não significa bloquear automaticamente o Google da Pesquisa.
Portanto, para um site que depende de SEO, a estratégia mais lógica é permitir:
Googlebot
e bloquear:
Google-Extended
ficando assim:
User-agent: Googlebot
Allow: /
User-agent: Google-Extended
Disallow: /
Se você também quiser impedir que o conteúdo apareça como entrada direta nas Visões gerais de IA e no Modo IA da Pesquisa Google, existem controles adicionais como nosnippet, max-snippet e data-nosnippet, mas eles têm consequências diferentes para a apresentação do conteúdo nos resultados.
Em outras palavras: você não precisa necessariamente escolher entre aparecer no Google e tentar controlar o uso do seu conteúdo pelo Gemini. O Google oferece mecanismos separados para essas duas situações — e entender essa diferença é o segredo para configurar o blog sem destruir o próprio SEO.
Por: Alexandre lavrador. Opinião do Blogueiro.
Por favor, não esqueça de colocar este link como Referência Bibliográfica em sua Publicação:
Assistir Online Grátis Como fazer para que a inteligência artificial Gemini não consiga pegar nenhuma informação do meu blog, Ver Online de Graça Como fazer para que a inteligência artificial Gemini não consiga pegar nenhuma informação do meu blog, Filme Online Grátis Como fazer para que a inteligência artificial Gemini não consiga pegar nenhuma informação do meu blog, Assistir Online de Graça Como fazer para que a inteligência artificial Gemini não consiga pegar nenhuma informação do meu blog, Filme Completo de Graça Como fazer para que a inteligência artificial Gemini não consiga pegar nenhuma informação do meu blog, Assista o que é Como fazer para que a inteligência artificial Gemini não consiga pegar nenhuma informação do meu blog? Entenda a notícia sobre o que aconteceu sobre Como fazer para que a inteligência artificial Gemini não consiga pegar nenhuma informação do meu blog.
Caso o título Como fazer para que a inteligência artificial Gemini não consiga pegar nenhuma informação do meu blog esteja protegido por direitos autorais, você assistirá, neste artigo, a um filme gratuito disponível no YouTube que seja o mais parecido, sem ferir os direitos autorais de Como fazer para que a inteligência artificial Gemini não consiga pegar nenhuma informação do meu blog. Aqui no Flogão, funciona de forma semelhante à banca de sucos do Chaves: “-O que parece de limão é de groselha e tem gosto de tamarindo. -Isso isso isso isso...”