Os 15 principais websites concentram cerca de 68% de todas as citações de IAs como ChatGPT, Gemini, Perplexity e AI Overviews — uma concentração ainda maior que a do Google PageRank em seu auge [11][35][36]. O Reddit é o site mais citado por praticamente todos os principais mecanismos de IA, com cerca de 40% das cit...
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: Searching with cited sources for Which websites and domains are most commonly cited by large language models?. Article summary: Here's a clear picture of which websites and domains are most commonly cited by large language models, based on multiple large-scale 2025–2026 studies.. Topic tags: general, academic, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make i
Se você já se perguntou de onde vêm as respostas do ChatGPT, Gemini, Perplexity ou Google AI Overviews, os dados agora são claros — e a resposta pode surpreendê-lo. Um grupo concentrado de apenas 15 sites é responsável por mais de dois terços de todas as citações feitas pelas principais inteligências artificiais.
Múltiplos estudos de larga escala realizados entre 2025 e 2026 — cobrindo de 30 milhões a 680 milhões de eventos de citação — convergem para a mesma conclusão: a citação por IA é um jogo onde poucos levam tudo, e é mais extremo do que o Google PageRank jamais foi .
O Índice de Fontes de Citação para Plataformas de IA de 2026 da 5W Communications, que sintetizou mais de 680 milhões de citações de seis grandes estudos, descobriu que os 15 principais domínios absorvem 68% de toda a participação de citações de IA . Os 50 principais domínios respondem por mais de 80%
.
Para colocar isso em perspectiva: 15 sites, de aproximadamente 1,1 bilhão na internet, controlam mais de dois terços do que os mecanismos de IA recomendam para bilhões de usuários todos os dias . Essa concentração é muito mais extrema do que qualquer coisa que o algoritmo PageRank do Google produziu durante seus 25 anos de reinado sobre a descoberta na web
.
Estes domínios aparecem consistentemente no topo dos rankings de citação em ChatGPT, Google AI Mode, Gemini, Perplexity e AI Overviews:
A análise da Peec AI com 30 milhões de fontes identificou os 10 domínios mais citados em todas as plataformas como: Reddit, YouTube, LinkedIn, Wikipedia, Forbes, Facebook, Yelp, Amazon, TechRadar e Healthline .
As discussões e fóruns gerados por usuários no Reddit fornecem um conjunto de dados vasto e diversificado de conteúdo conversacional e de resolução de problemas. Em um estudo da Statista de junho de 2025, o Reddit capturou 40,1% de todas as referências citadas, muito à frente da Wikipedia em segundo lugar, com 26,3% . No Perplexity, o Reddit pode representar cerca de 1 em cada 5 citações
.
Analistas apontam para a capacidade do Reddit de responder a perguntas de cauda longa, baseadas em opinião e tutoriais, algo com que fontes enciclopédicas tradicionais têm dificuldade — tornando-o especialmente valioso para IAs conversacionais .
Embora o Reddit lidere no geral, os rankings individuais dos mecanismos revelam diferenças importantes:
Apenas 7 sites aparecem entre os 50 domínios mais citados em todos os três principais mecanismos (ChatGPT, Perplexity, Google AI Overviews), e apenas 11% dos domínios são citados tanto pelo ChatGPT quanto pelo Perplexity .
É importante separar o que os LLMs citam em suas respostas daquilo em que são treinados. Para dados de treinamento, a fonte dominante em volume é o Common Crawl — um repositório aberto de petabytes de dados brutos da web que alimenta modelos como GPT-3, LLaMA e T5 . O GPT-3 da OpenAI, por exemplo, extraiu 60% de seus tokens de treinamento de uma versão filtrada do Common Crawl
.
As listas de citações acima refletem o que os LLMs referenciam ao gerar respostas — um conjunto de fontes muito menor e mais curado que o modelo aprendeu a tratar como autoritativo.
Se o seu objetivo é ser citado por mecanismos de IA, os dados são claros: você precisa ganhar um lugar na curta lista de domínios de confiança. A cauda longa da web é funcionalmente invisível para a maioria das respostas de IA, exceto em consultas de nicho.
Estratégias que funcionam incluem contribuir para a Wikipedia, obter cobertura no Forbes ou Healthline, construir uma forte presença no YouTube e LinkedIn, e ganhar citações no Reddit. Formatos que impulsionam o sucesso de citação incluem listas (que representam aproximadamente 50% das principais citações de IA) e páginas com listas ordenadas ou não ordenadas (presentes em 80% das páginas citadas por IA) .
Em resumo: Reddit, Wikipedia e YouTube são os três domínios mais citados nos principais mecanismos de LLM atualmente, com um pequeno grupo de sites autoritativos de mídia, saúde e referência completando o topo da lista. Ser citado por IA significa ser citado por estes domínios primeiro.
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
Os 15 principais websites concentram cerca de 68% de todas as citações de IAs como ChatGPT, Gemini, Perplexity e AI Overviews — uma concentração ainda maior que a do Google PageRank em seu auge [11][35][36].
Os 15 principais websites concentram cerca de 68% de todas as citações de IAs como ChatGPT, Gemini, Perplexity e AI Overviews — uma concentração ainda maior que a do Google PageRank em seu auge [11][35][36]. O Reddit é o site mais citado por praticamente todos os principais mecanismos de IA, com cerca de 40% das citações em alguns estudos, seguido pela Wikipedia e YouTube [4][11][16].
Os rankings variam bastante entre as IAs: o Fandom lidera no Google AI Mode, enquanto a Wikipedia aparece em primeiro no ChatGPT em alguns conjuntos de dados [14].