La decisión de Microsoft no es una medida aislada de reducción de costes. Es una señal de alto impacto de que la era del 'tokenmaxxing' —tratar el consumo máximo de tokens de IA como un indicador de productividad e innovación— ha terminado en toda la industria tecnológica .
Tres presiones específicas obligaron a Microsoft a imponer disciplina interna en IA:
Costes internos descontrolados. Los propios equipos de ingeniería de Microsoft estaban usando libremente modelos de IA de frontera a través de GitHub Copilot, lo que disparó el consumo de tokens y los costes de inferencia muy por encima de lo que la empresa consideraba sostenible. Las directrices internas de Copilot reconocían que muchos ingenieros gastaban "entre cientos de dólares al mes y unos pocos miles de dólares en tokens" . El correo de Parikh dejó claro que, a partir de julio de 2026, cada división operaría con un objetivo de presupuesto de tokens de IA, y que los empleados podrían consultar su propio consumo en un panel interno .
Incentivos desalineados. Los ingenieros habían empezado a tratar el alto consumo de tokens como una insignia de productividad, una práctica conocida en toda la industria como 'tokenmaxxing'. Pero Microsoft descubrió que más tokens no equivalían a más valor empresarial. Parikh reformuló explícitamente el objetivo de la empresa: "No estamos optimizando para tener menos tokens. Estamos optimizando para tener un mayor impacto por token" .
El problema de credibilidad. Como empresa que vende suscripciones de IA —Azure OpenAI Service, GitHub Copilot, Microsoft 365 Copilot— Microsoft no podía decirle creíblemente a sus clientes que controlaran los costes de la IA mientras sus propios equipos consumían tokens sin restricción . El correo de Parikh señalaba que la empresa gestionaría "el gasto en tokens con la misma disciplina que aplicamos a cualquier otro recurso crítico" .
Los cambios de política entraron en vigor de inmediato en julio de 2026 :
La medida de Microsoft es un punto de datos en una corrección mucho más amplia que se está produciendo en toda la industria tecnológica. El 'tokenmaxxing' —la práctica de impulsar agresivamente el consumo de tokens de IA como indicador de innovación— se generalizó entre las empresas tecnológicas desde finales de 2025 hasta mediados de 2026, pero ahora se está derrumbando rápidamente porque la economía no funcionaba .
El presupuesto disparado de Uber. Uber Technologies agotó todo su presupuesto de IA para 2026 en apenas unos meses. Su CTO declaró públicamente: "Estamos llegando al final de la llamada era del 'tokenmaxxing'", añadiendo que el consumo bruto de tokens no se traducía en retornos medibles . La empresa se está moviendo ahora hacia la optimización del coste por interacción mediante el almacenamiento en caché de indicaciones, modelos predeterminados más eficientes y una mejor visibilidad del consumo .
La advertencia de Gartner. Gartner ha predicho que los costes de codificación con IA pronto superarán el salario medio de los desarrolladores bajo modelos de precios basados en consumo, lo que obligará a los directores financieros de todos los sectores a exigir disciplina de costes .
Las matemáticas de las startups. Las startups han demostrado que cambiar de modelo puede reducir los costes de inferencia aproximadamente un 90%. Lindy.ai, por ejemplo, trasladó el 100% de su tráfico API de Claude a DeepSeek de la noche a la mañana, citando costes de inferencia aproximadamente un 90% más bajos para una calidad de salida comparable en su conjunto de tareas principales . Unos ahorros tan drásticos hacen que la antigua mentalidad de "más tokens = mejor" sea financieramente insostenible .
El veredicto de Forbes y Fortune. Múltiples medios de negocios han declarado que la era del 'tokenmaxxing' ha terminado estructuralmente. Las empresas están abandonando el uso bruto como métrica en favor de despliegues centrados en la eficiencia, el enrutamiento de modelos (usar modelos más baratos para tareas más simples) y la facturación basada en resultados, que elimina el incentivo de maximizar tokens . Forbes caracterizó el 'tokenmaxxing' como "una fase transitoria en la adopción de IA" que ayudó a normalizar el uso, pero que "no es un modelo operativo sostenible" .
El patrón de la industria es ahora claro: las empresas que inicialmente fomentaron el uso sin restricciones de la IA están imponiendo presupuestos, cambiando a modelos más baratos y exigiendo que cada token gastado esté vinculado a un resultado empresarial medible. El director de atención al cliente de ServiceNow ha advertido de que el 'tokenmaxxing' es un ciclo de hype de la IA . El veredicto de Fortune fue tajante: "El 'tokenmaxxing' ha muerto. No produjo el retorno de la inversión en IA que las empresas querían" .
Los presupuestos internos de tokens de Microsoft y el cambio al GPT-5.6 como modelo por defecto son un ejemplo de libro de texto de este ajuste de cuentas en toda la industria, que no proviene de un rezagado en IA, sino de uno de los mayores inversores del sector. Si la empresa que vende suscripciones de IA necesita un presupuesto, el mensaje para todas las demás empresas es claro.