O custo da inferência caiu cerca de 95% para capacidades comparáveis, enquanto semicondutores e financiamento ficaram mais caros. A receita da Nvidia no segundo trimestre fiscal de 2027 chegou a US$ 96,2 bilhões, alta de 106%, mas os custos maiores de memória já pressionam as margens futuras.
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: How is the AI market being squeezed as token prices fall roughly 95% since early 2024—illustrated by the free near-frontier Ox Alpha model a. Article summary: The AI economy is experiencing a margin-and-financing squeeze: model capability is becoming commoditized faster than the physical infrastructure needed to produce it. That favors scarce-hardware suppliers in the near ter. Topic tags: general, news, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
O mercado de inteligência artificial está sendo puxado em duas direções. O preço para usar modelos avançados está despencando: um modelo gratuito chamado Ox Alpha teria surgido próximo da fronteira de desempenho, enquanto a OpenAI reduziu em julho os preços de duas categorias do GPT-5.6 em 80% e 20%. 1716 Estimativas mais amplas indicam queda de aproximadamente 95% no custo de inferência para capacidades comparáveis nos últimos dois anos. 22
Ao mesmo tempo, os sistemas físicos necessários para entregar esses tokens estão ficando mais caros. A Samsung elevou em até 15% os preços de alguns pedidos avançados de fabricação de chips e espera que a escassez global de memória se intensifique e se estenda até 2028. 3233 O resultado é uma combinação incomum: o preço do produto cai, enquanto os custos de insumos essenciais continuam subindo.
A distinção mais importante está entre a camada de inteligência, que se torna uma commodity, e a camada de infraestrutura, limitada pela oferta.
O acesso a modelos de uso geral está ficando mais fácil de substituir. Se um fornecedor reduz os preços de sua API, lança um modelo menor ou oferece gratuitamente um sistema capaz, os concorrentes sofrem pressão para reagir. As mudanças de preços da OpenAI em julho reduziram o custo de entrada do GPT-5.6 Luna de US$ 1 para US$ 0,20 por milhão de tokens e o do Terra de US$ 2,50 para US$ 2. 16
A infraestrutura funciona de outra maneira. Capacidade de fabricação avançada, memória de alta largura de banda, redes, energia e sistemas completos de servidores para IA não podem ser ampliados na mesma velocidade em que os preços de software podem ser reduzidos. A Samsung afirmou que os clientes estão buscando contratos de fornecimento plurianuais e que a escassez pode se tornar mais aguda até 2028. 33 Relatos sobre planos de aumentar em mais de 15% os preços de servidores baseados em chips da Nvidia mostram como os fornecedores podem tentar repassar esses custos, embora isso não seja um anúncio oficial de preços da Nvidia. 36
Para empresas que oferecem serviços de IA, o desafio comercial é direto: a receita por token pode cair mesmo com o aumento do uso, enquanto capacidade, energia, hardware e financiamento talvez não acompanhem essa queda.
Os resultados do segundo trimestre fiscal de 2027 da Nvidia mostram que o boom da infraestrutura continua excepcionalmente forte. A companhia registrou receita trimestral de US$ 96,2 bilhões, alta de 106% em relação ao mesmo período do ano anterior, e lucro ajustado de US$ 2,22 por ação diluída. 60 A administração também indicou que a receita do ano fiscal de 2028 pode crescer cerca de 70%. 51
Esses números não significam que toda a economia da IA tenha resolvido seu problema de rentabilidade. Eles mostram que a demanda por sistemas aceleradores escassos continua poderosa. A Nvidia está posicionada em um gargalo no qual os clientes ainda disputam capacidade.
Mas o aumento dos custos de memória começa a afetar a qualidade desse crescimento. A Nvidia projetou margem bruta de aproximadamente 74% para o trimestre seguinte, abaixo dos 75% registrados no período divulgado, e reportagens sobre a perspectiva relacionaram parte da pressão aos preços da memória. 51 Isso não aponta necessariamente para um colapso na economia da Nvidia. A implicação é que o desempenho futuro pode depender mais de aumentos de preços, integração de sistemas, redes, software e execução da cadeia de suprimentos — e não apenas da venda de chips escassos com margens elevadas.
A Broadcom ilustra outra dimensão desse aperto. Reuters e Bloomberg informaram que a empresa negociava levantar mais de US$ 60 bilhões em dívida para uma estrutura de financiamento de chips de IA que beneficiaria a Anthropic e outros clientes. O desenho poderia incluir cerca de US$ 30 bilhões em dívida subordinada, além de uma parcela com garantia sênior, mas os termos ainda estavam sendo negociados. 12
Essa distinção é importante: tratava-se de um financiamento proposto, não de uma captação concluída. Portanto, os valores divulgados devem ser vistos como uma faixa em discussão, e não como uma operação finalizada.
A questão econômica é saber se a receita gerada por esses chips será duradoura o suficiente para sustentar o serviço da dívida. Um chip pode ter alto valor técnico e, ainda assim, resultar em um investimento alavancado ruim se os preços dos modelos caírem, a concentração de clientes for elevada, o valor dos equipamentos recuar ou o refinanciamento ficar mais caro.
É por isso que os mercados de crédito importam. Quando a infraestrutura é financiada com volumes relevantes de dívida, a queda dos preços dos tokens deixa de ser apenas um problema de precificação para empresas de software. Ela pode afetar os fluxos de caixa esperados que sustentam contratos de leasing, veículos de propósito específico, fornecedores e credores.
As grandes empresas de computação em nuvem estão em posição melhor do que as fornecedoras independentes de modelos porque podem combinar IA com serviços de nuvem, software corporativo, publicidade, dados e distribuição já existentes. Também conseguem subsidiar recursos de IA enquanto monetizam os clientes em outras áreas.
Isso não prova automaticamente que todo investimento em IA terá retorno atraente. Modelos baratos podem aumentar o uso, mas reduzir a receita por unidade. O excesso de capacidade pode transformar a IA em um recurso de menor margem dentro da computação em nuvem, em vez de criar uma nova fonte independente de lucro. A métrica decisiva não é quantos tokens são processados, mas se os clientes pagam o suficiente pelos ganhos de produtividade, pela receita adicional ou pelas economias geradas.
Para as empresas, a queda dos preços de inferência é genuinamente positiva. Custos menores facilitam testar aplicações de IA, automatizar fluxos de trabalho específicos e usar modelos mais fortes em tarefas que antes não passavam pelo teste econômico.
A ressalva é que o preço dos tokens representa apenas uma parte do custo de implementação. As empresas ainda precisam lidar com integração, preparação de dados, controles de segurança, governança, avaliação e gestão da mudança. Uma conta menor de API não garante retorno positivo sobre o investimento.
O mercado, portanto, caminha para uma pergunta mais exigente: qual resultado empresarial mensurável cada unidade de computação de IA produz? Empresas capazes de ligar o uso dos modelos a receitas ou economias verificáveis tendem a se beneficiar mais do que aquelas que acumulam capacidade sem um caso de uso claro.
Os investidores devem separar a exposição a insumos escassos da exposição ao acesso a modelos, que está se tornando uma commodity.
No lado limitado pela oferta estão memória, fabricação avançada, redes, energia e sistemas integrados de aceleradores. Essas empresas podem preservar poder de negociação enquanto os clientes disputam capacidade. As medidas de preço da Samsung e sua previsão de escassez são evidências dessa vantagem atual. 3233
O lado do acesso aos modelos enfrenta um teste mais difícil. Modelos gratuitos ou fortemente descontados podem ampliar o mercado, mas também dificultam a manutenção de preços altos para serviços de inferência sem diferenciação. A sustentabilidade pode depender de distribuição própria, dados exclusivos, fluxos de trabalho especializados, demanda contratada ou software capaz de capturar valor além do token.
Investidores de crédito devem observar fluxos de caixa contratados, concentração de clientes, valor residual dos equipamentos, estrutura da dívida e datas de refinanciamento. A operação proposta pela Broadcom é um alerta útil porque mostra como a infraestrutura de IA pode rapidamente se tornar uma questão de financiamento, além de uma questão tecnológica. 12
O boom da IA não segue uma única curva de custos. A inteligência está ficando mais barata e abundante, enquanto a capacidade física necessária para produzi-la continua escassa e cara.
Esse descompasso ajuda a explicar como a Nvidia pode apresentar crescimento extraordinário e, ao mesmo tempo, alertar para a pressão sobre as margens. Também explica por que uma estrutura proposta de financiamento de chips, na casa das dezenas de bilhões de dólares, pode chamar a atenção dos mercados de crédito mesmo com a demanda por IA ainda forte.
A próxima fase do mercado será definida menos pela capacidade dos modelos isoladamente e mais pela habilidade dos clientes de transformar inteligência barata em fluxo de caixa duradouro antes que a capacidade computacional cara — e financiada por dívida — precise ser refinanciada.
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
O custo da inferência caiu cerca de 95% para capacidades comparáveis, enquanto semicondutores e financiamento ficaram mais caros.
O custo da inferência caiu cerca de 95% para capacidades comparáveis, enquanto semicondutores e financiamento ficaram mais caros. A receita da Nvidia no segundo trimestre fiscal de 2027 chegou a US$ 96,2 bilhões, alta de 106%, mas os custos maiores de memória já pressionam as margens futuras.
A proposta de financiamento de chips da Broadcom ainda está em negociação, não é uma transação concluída; sua possível estrutura de mais de US$ 60 bilhões mostra como a queda dos preços dos tokens pode se transformar...