Pero la cifra necesita contexto: el proyecto todavía está en una fase inicial, su tamaño definitivo no está decidido y el número total de parámetros no permite predecir por sí solo el rendimiento del modelo.
Según un informe de Financial Times publicado el 7 de agosto de 2026, ByteDance comenzó a entrenar un modelo de lenguaje con hasta 10 billones de parámetros . El trabajo se encuentra en las primeras etapas del preentrenamiento, una fase que suele durar entre tres y seis meses antes del ajuste fino y de una eventual presentación pública .
La compañía todavía evalúa si llevará el entrenamiento hasta el límite de 10 billones, por lo que el tamaño final podría ser menor . Además, un informe anterior de LatePost señalaba que ByteDance estudiaba un modelo de más de 5 billones de parámetros, lo que apunta a que el alcance del proyecto pudo haberse ampliado .
Reuters no pudo confirmar de forma independiente la información publicada por Financial Times . ByteDance tampoco había hecho públicos todos los detalles del proyecto.
Si la cifra máxima se mantiene, el modelo de ByteDance quedaría cerca o ligeramente por encima de Anthropic Mythos 5, cuya escala se estima en unos 8 billones de parámetros . La comparación disponible es la siguiente:
| Modelo | Parámetros estimados | Situación |
|---|---|---|
| Nuevo modelo de ByteDance | Hasta 10 billones | En preentrenamiento; sería el modelo chino de mayor escala conocido |
| Anthropic Claude Mythos 5 | Cerca de 8 billones | Lanzado, aunque sus capacidades completas están restringidas a organizaciones verificadas; la versión pública Claude Fable 5 incluye salvaguardas |
| Moonshot AI Kimi K3 | 2,8 billones | El modelo de ByteDance sería más de tres veces mayor en parámetros totales |
| Modelo insignia de OpenAI | No divulgado; estimado en varios billones | OpenAI, Anthropic y ByteDance son las compañías identificadas públicamente en este rango de escala |
La magnitud sería llamativa, pero más parámetros no significa automáticamente un modelo más capaz. El diseño de la arquitectura, los datos, el entrenamiento, la eficiencia y el porcentaje de parámetros utilizado en cada consulta también son determinantes.
Los 10 billones mencionados se refieren, según los reportes disponibles, a los parámetros totales de la arquitectura. Muchos modelos punteros utilizan una arquitectura de tipo Mixture-of-Experts (MoE), en la que solo una parte de los parámetros se activa para responder a cada solicitud.
En la práctica, un modelo con 10 billones de parámetros totales podría activar únicamente entre 1 y 2 billones en una inferencia concreta. La cobertura basada en el informe de Financial Times no ha aclarado si la cifra de 10 billones corresponde exclusivamente al total, a los parámetros activos o a una combinación de métricas. Esa diferencia es esencial para comparar de forma justa el modelo con Mythos 5, Kimi K3 u otros sistemas .
El fundador de ByteDance, Zhang Yiming, habría indicado al equipo Seed que no utilice la destilación de modelos rivales para desarrollar este sistema, incluso si la decisión provoca un retraso temporal frente a otros laboratorios chinos . Según los reportes, reiteró esa postura en una reunión interna celebrada alrededor del 6 de agosto de 2026 y la presentó como una estrategia de largo plazo basada en la paciencia y la construcción de capacidades propias .
La destilación consiste, en términos generales, en entrenar o mejorar un modelo utilizando las respuestas generadas por otro sistema más potente. La técnica puede acelerar el desarrollo, pero también se ha convertido en un punto de fricción por las dudas sobre propiedad intelectual, prácticas de entrenamiento y dependencia tecnológica.
En el caso de ByteDance, la decisión también estaría relacionada con su compleja relación regulatoria con el Gobierno estadounidense por TikTok y con el interés de reducir posibles riesgos legales y de controles de exportación .
ByteDance creó la división Seed a comienzos de 2023, después de la irrupción de ChatGPT, para concentrar su investigación en modelos fundacionales y otras áreas avanzadas de IA . Los datos conocidos sobre el equipo son:
El modelo de 10 billones de parámetros se interpreta como un intento de ByteDance de reducir la distancia con los laboratorios estadounidenses de vanguardia, especialmente Anthropic y OpenAI . La iniciativa llega en un momento marcado por varios obstáculos y señales estratégicas:
El resultado es una carrera en la que los modelos más avanzados ya no se consideran únicamente productos comerciales: también se tratan como activos estratégicos con implicaciones económicas, regulatorias y de seguridad.
ByteDance no ha confirmado si el nuevo modelo se ofrecerá al público ni si se publicará con una licencia abierta. Hasta ahora, su estrategia general ha sido mantener cerrados sus modelos insignia e integrarlos en productos propios, a diferencia de Meta con Llama o de algunos competidores chinos como DeepSeek.
La principal marca de IA para consumidores de ByteDance es Doubao (豆包), que incorpora modelos de la serie Seed en herramientas de conversación, asistencia y generación de contenidos . Entre las prioridades de la compañía para 2026 figuran también los modelos del mundo, con el objetivo de acercarse al rendimiento de Genie 3 de Google antes de que termine el año, un agente de programación llamado Seedance y la expansión comercial de Doubao .
Si el modelo de 10 billones llega a completarse, lo más probable —aunque ByteDance no lo ha confirmado— es que sirva como base para Doubao y otros productos internos, en lugar de convertirse en un modelo abierto independiente.
La iniciativa representa una apuesta de enorme escala por desarrollar IA de frontera sin depender de la destilación de sistemas rivales. Sin embargo, todavía quedan preguntas fundamentales: cuál será el número final de parámetros, cuánto durará el entrenamiento, qué proporción estará activa en cada consulta, qué hardware podrá utilizar ByteDance y si el sistema llegará a publicarse.
Por ahora, los 10 billones describen sobre todo la ambición del proyecto, no una capacidad ya demostrada. ByteDance está intentando entrar en la liga de los modelos más grandes del mundo, pero el verdadero resultado dependerá de lo que ocurra después del anuncio: el entrenamiento, la eficiencia y el rendimiento que consiga demostrar.