A DeepSeek afirma que o V4.1 Flash precisa de um quarto da HBM e de um oitavo do armazenamento SSD no cache KV em comparação com a geração anterior. A notícia levou investidores a reavaliar empresas expostas à demanda por memória para IA; Samsung Electronics e SK Hynix caíram mais de 3% intradiário em Seul após o an...
Publicado porEditado com GPT-5.6 TerraImagens geradas com GPT Image 2
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: How did DeepSeek’s September 10 V4.1 Flash release, which reduced key-value cache consumption to about one-quarter of its predecessor’s high. Article summary: The selloff reflected a rapid reassessment of the “AI equals ever-more memory” trade. DeepSeek’s V4.1-Flash showed that serving long-context models can be made far less memory-intensive, while Amodei’s proposed slowing o. Topic tags: general, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
O anúncio do DeepSeek V4.1-Flash, em 10 de setembro, mexeu com uma narrativa que vinha sustentando o setor de memória: modelos maiores, contextos mais longos e agentes de IA exigiriam volumes continuamente crescentes de memória de alta largura de banda (HBM), NAND e armazenamento.
O novo modelo não torna memória desnecessária. Mas mostrou que a quantidade de memória necessária para atender uma determinada carga de trabalho de IA pode cair bastante com mudanças na arquitetura do modelo e na gestão de cache. 61
25
O cache de chave-valor, ou cache KV, guarda informações do estado de atenção enquanto o modelo responde a uma solicitação. Ele é especialmente relevante em conversas de contexto longo e em tarefas com agentes de IA, porque evita que o sistema tenha de reprocessar todo o histórico a cada nova interação.
Segundo a DeepSeek, o V4.1-Flash reduz a necessidade de seu cache KV para um quarto da HBM e um oitavo do armazenamento SSD da geração anterior. 61 A documentação do modelo atribui o ganho a uma arquitetura causal encoder-decoder (CED), na qual o cache KV global do decodificador é projetado a partir dos estados finais do codificador, e à técnica chamada SWA Bounded Replay, que evita gravar determinados estados de cache de janela deslizante no SSD.
52
A cobertura técnica independente estimou uma ocupação global de cache KV de cerca de 890 bytes por token, aproximadamente um quarto da do V4-Flash. Na prática, o desenho poderia acomodar cerca de quatro a oito vezes mais usuários dentro da mesma capacidade de cache KV. 53 A DeepSeek também afirma que o modelo ativa 8 bilhões de parâmetros por token na etapa de processamento de entrada e 16 bilhões na geração da resposta, uma escolha voltada a melhorar a eficiência em tarefas que recebem muito conteúdo de entrada.
52
A questão para o mercado não foi se sistemas de IA ainda precisam de memória — eles precisam. O problema foi outro: a memória necessária por unidade de resultado na inferência pode cair mais rápido do que as projeções de receita e demanda vinham supondo.
Se um modelo comparável consegue atender mais solicitações simultâneas e de contexto longo usando a mesma quantidade de HBM ou armazenamento, provedores de nuvem podem extrair mais capacidade da infraestrutura já instalada. Isso coloca pressão sobre hipóteses de volumes futuros, escassez de oferta e poder de precificação em HBM, DRAM, SSDs corporativos e equipamentos relacionados a armazenamento.
Após o lançamento, as ações de Samsung Electronics e SK Hynix caíram mais de 3% intradiário na Coreia do Sul, segundo reportagens. 17 A preocupação se espalhou pela cadeia de infraestrutura de IA porque menor consumo de memória pode alterar a economia de implantação dos modelos — ainda que o efeito não seja igual para todas as categorias de hardware.
No caso da SanDisk, o episódio expôs o quanto a tese de investimento havia se tornado sensível às expectativas de demanda da IA. Dados de mercado do período apontavam uma faixa de 52 semanas de aproximadamente US$ 85 a US$ 2.354, enquanto o consenso de analistas permanecia em compra ou compra moderada. 35
37 Esse consenso positivo, porém, não elimina a incerteza central: quanto da demanda futura por armazenamento depende de arquiteturas de inferência cada vez mais intensivas em memória permanecerem inalteradas.
A notícia da DeepSeek foi um choque de eficiência. A proposta de Dario Amodei de “dosar o ritmo da fronteira” trouxe uma dúvida diferente: a respeito da velocidade de avanço das capacidades da IA e, por consequência, dos investimentos em infraestrutura.
Em ensaio publicado em setembro, o CEO da Anthropic defendeu que empresas diminuam deliberadamente o ritmo de aprimoramento das capacidades dos modelos de fronteira, usando o tempo adicional para trabalho de alinhamento e segurança. Ele propôs avaliadores externos incorporados às empresas, coordenação entre companhias de países democráticos e, no futuro, acordos entre governos. 4
5
A proposta não pedia a interrupção de todo o desenvolvimento de IA. Mas o apoio público de outros líderes relevantes do setor levou o mercado a considerar se coordenação voluntária ou regras futuras poderiam moderar os gastos com aceleradores, data centers e memória que sustentam a chamada trade de IA. Os futuros do Nasdaq 100 chegaram a ser reportados em queda de 1% naquele fim de semana. 8
Juntos, os dois eventos formaram uma combinação desconfortável para investidores: a DeepSeek sugeriu menos memória por carga de trabalho, enquanto o debate sobre desacelerar os modelos levantou a possibilidade de crescimento mais lento no volume dessas cargas.
O investidor Michael Burry classificou os apelos por desenvolvimento mais lento da IA como “interesse próprio”. Seu argumento foi que uma desaceleração poderia favorecer laboratórios já estabelecidos na fronteira tecnológica e dificultar que concorrentes menores os alcancem. Ele também questionou se os chatbots atuais de IA estão de fato em um caminho para a inteligência artificial geral. 15
As declarações de Burry são uma crítica aos incentivos envolvidos, não uma prova das motivações das empresas. Da mesma forma, alegações de que discursos de segurança serviriam para apoiar planos de abertura de capital devem ser tratadas como opinião de Burry, e não como fato comprovado. 11
15
A conclusão mais sólida é específica, mas importante: a DeepSeek contestou uma versão simplista da tese de memória para IA. O lançamento mostrou que software, arquitetura de modelos, quantização e técnicas de gerenciamento de cache podem reduzir materialmente a intensidade de memória da inferência. 52
55
Isso não prova que a demanda total por memória cairá. As reduções anunciadas se referem ao cache KV durante a inferência e à comparação com a arquitetura anterior da própria DeepSeek. Não significam que o modelo inteiro ou o data center usem 75% menos HBM e 87,5% menos SSD; tampouco eliminam a memória usada pelos pesos do modelo ou no treinamento. 25
Custos menores de atendimento também podem ampliar o uso. Uma inferência mais barata pode permitir mais usuários, contextos mais longos e mais ciclos de agentes. O resultado final dependerá de qual força prevalecerá: eficiência por solicitação ou crescimento no número e na complexidade das solicitações.
O DeepSeek V4.1-Flash não invalidou a visão de longo prazo para HBM, NAND ou infraestrutura de IA. Mas tornou essa visão mais condicional. Já não é seguro presumir que o aumento do uso de IA se converterá, numa relação direta de um para um, em maior consumo de memória por carga de trabalho.
A pergunta mais útil agora é se os ganhos de eficiência superarão a expansão da implantação de IA. A DeepSeek apresentou evidências de que a inferência pode ficar dramaticamente mais enxuta; não resolveu, porém, a questão de quão rápido crescerão o uso global de IA, a escala de treinamento e a demanda por hardware depois disso.
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
A DeepSeek afirma que o V4.1 Flash precisa de um quarto da HBM e de um oitavo do armazenamento SSD no cache KV em comparação com a geração anterior.
A DeepSeek afirma que o V4.1 Flash precisa de um quarto da HBM e de um oitavo do armazenamento SSD no cache KV em comparação com a geração anterior. A notícia levou investidores a reavaliar empresas expostas à demanda por memória para IA; Samsung Electronics e SK Hynix caíram mais de 3% intradiário em Seul após o anúncio.
O pedido de Dario Amodei, CEO da Anthropic, para desacelerar a evolução de modelos de fronteira acrescentou o temor de um ritmo menor de gastos com infraestrutura de IA.