El equipo Seed de ByteDance comenzó a restringir el uso de respuestas de modelos rivales en 2023 y habría reafirmado la prohibición en 2026, aun a costa de perder posiciones temporalmente en las pruebas de rendimiento. La norma reportada abarcaría tanto sistemas cerrados, como GPT y Claude, como modelos con pesos ab...
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: Why did ByteDance founder Zhang Yiming reaffirm Seed’s 2023 prohibition against training its language models on outputs from other companies. Article summary: Zhang reaffirmed the prohibition because he views competitor-output distillation as a short-term benchmark shortcut that would undermine Seed’s ability to discover its own training methods, research directions, and model. Topic tags: general, news, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
El fundador de ByteDance, Zhang Yiming, habría reafirmado una regla estricta para el equipo de inteligencia artificial Seed: no mejorar sus modelos mediante la destilación de las respuestas de sistemas rivales, incluso si eso implica perder terreno en los rankings a corto plazo. Reuters describió la directriz como una decisión de asumir costes inmediatos para priorizar el desarrollo de IA a largo plazo. 1
La lógica es estratégica. La destilación permite que un modelo menos potente aprenda de las respuestas de otro más avanzado, reduciendo el tiempo y los recursos necesarios para reproducir algunas de sus capacidades. Pero la preocupación de Seed, según los reportes, es que copiar las respuestas de un competidor convierta a ByteDance en un seguidor muy capaz, aunque dependiente de los métodos, las evaluaciones y la propia definición de inteligencia de otro laboratorio. 4
9
Según informaciones resumidas por Pekingnology y Pandaily, los primeros equipos de Seed experimentaron con material generado mediante la API de GPT. Después de que ByteDance introdujera auditorías de las llamadas a la API en abril de 2023, el equipo habría adoptado una regla que excluía los datos generados por GPT de los conjuntos de entrenamiento de la empresa. Con el tiempo, el principio se amplió a los modelos rivales en general. 9
14
La diferencia es importante. La política reportada no consistía simplemente en prohibir el uso de una API propietaria concreta. Se convirtió en una decisión más amplia: ningún modelo de otra empresa —fuera de código cerrado o publicado con pesos abiertos— debía actuar como profesor de Seed. 9
10
La discusión habría resurgido después de que DeepSeek-R1 demostrara un sólido rendimiento en razonamiento y eficiencia en enero de 2025. Algunos investigadores de Seed defendían que las respuestas de sistemas estadounidenses más avanzados podían complementar el trabajo de entrenamiento propio de ByteDance y acelerar la mejora de sus capacidades de razonamiento. Según los reportes, Zhang consideró que eso seguiría siendo una forma de depender de capacidades prestadas. 9
Los informes que apuntan a que DeepSeek utilizó datos sintéticos procedentes de modelos estadounidenses de vanguardia siguen siendo especulaciones del sector en la evidencia disponible aquí, no un hecho establecido de forma independiente. Esa incertidumbre no debe confundirse con el reporte separado y mejor respaldado sobre la norma interna de Seed.
La destilación resultaba cada vez más tentadora mientras los desarrolladores chinos de IA afrontaban una competencia intensa por el hardware, las capacidades de los modelos y las posiciones en las pruebas de referencia. Los reportes describen a investigadores de Seed siguiendo la rápida evolución de los sistemas de vanguardia y la aparición de Kimi K3, de Moonshot, como un potente modelo con pesos abiertos que los competidores podían inspeccionar y, potencialmente, utilizar como fuente de datos de entrenamiento. 9
14
En ese punto, la política dejó de ser una preferencia de investigación abstracta y se convirtió en un dilema estratégico real. Destilar un modelo más potente podría cerrar rápidamente una brecha medida en los benchmarks. Negarse a hacerlo podía dejar atrás a Seed mientras sus competidores avanzaban más deprisa. Sin embargo, en una reunión general de Seed celebrada, según los reportes, en 2026, Zhang habría hecho explícita su elección: era preferible un peor rendimiento temporal que destilar sistemas rivales. 1
10
La prohibición reportada es inusualmente amplia porque se centra en la dependencia, no solo en los derechos de acceso. Un modelo cerrado consultado mediante una API y un modelo con pesos abiertos plantean cuestiones técnicas y de licencia diferentes, pero ambos pueden exponer al desarrollador al mismo riesgo estratégico: entrenar a partir de las soluciones de otro laboratorio en lugar de descubrir las propias. 9
14
Eso no significa que todas las formas de transferencia de conocimiento sean idénticas ni que todo uso de pesos abiertos sea indebido. Significa que el estándar interno atribuido a Seed era más estricto que una regla convencional contra la extracción no autorizada de datos de una API. La información disponible sostiene que el equipo recibió instrucciones de no utilizar modelos de vanguardia de otras empresas como profesores, incluidos los publicados con pesos abiertos. 10
14
La política también cobró relevancia en medio de acusaciones contra otras empresas chinas de IA. Anthropic acusó a Alibaba, DeepSeek, Moonshot, MiniMax y Z.ai de utilizar cuentas o intermediarios para extraer respuestas de Claude con fines de entrenamiento; ByteDance no fue incluida en esa acusación. Por separado, un funcionario estadounidense acusó a Moonshot de utilizar indebidamente el modelo de Anthropic para entrenar Kimi K3. Se trata de acusaciones, no de conclusiones demostradas por la evidencia proporcionada aquí. 6
9
Lo esencial es que la restricción atribuida a Seed se remonta a 2023, antes de la posterior controversia política. Por tanto, las acusaciones parecen haber reforzado la importancia de la postura de Zhang, no haberla originado. 9
El argumento atribuido a Zhang se entiende mejor como una apuesta sobre cómo se construye la IA de vanguardia. La destilación puede mejorar rápidamente las respuestas de un modelo, sus patrones de razonamiento o su rendimiento en determinados benchmarks. Pero si un equipo entrena de forma reiterada con las respuestas de un competidor, puede terminar optimizando su modelo según la “arquitectura de inteligencia” de ese rival: sus descomposiciones de problemas, señales de recompensa, respuestas y objetivos de evaluación. 9
10
Según los reportes, Seed estaría eligiendo el camino más lento: invertir en sus propios datos, métodos de entrenamiento, arquitectura y prioridades de investigación. El coste es evidente: el equipo puede quedarse atrás en las tablas de clasificación mientras sus rivales aprovechan todos los atajos disponibles. La posible recompensa sería una mayor independencia y la oportunidad de lograr avances que no estén limitados por las decisiones de diseño del líder actual.
La decisión, por tanto, no afirma que la destilación sea técnicamente inútil. Afirma que las ganancias inmediatas de capacidad quizá no compensen la dependencia a largo plazo. Para ByteDance, la instrucción atribuida a Zhang deja el dilema especialmente claro: Seed preferiría perder la carrera de hoy antes que construir su futuro copiando las respuestas de otro. 1
9
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
El equipo Seed de ByteDance comenzó a restringir el uso de respuestas de modelos rivales en 2023 y habría reafirmado la prohibición en 2026, aun a costa de perder posiciones temporalmente en las pruebas de rendimiento.
El equipo Seed de ByteDance comenzó a restringir el uso de respuestas de modelos rivales en 2023 y habría reafirmado la prohibición en 2026, aun a costa de perder posiciones temporalmente en las pruebas de rendimiento. La norma reportada abarcaría tanto sistemas cerrados, como GPT y Claude, como modelos con pesos abiertos, aunque los detalles proceden de informaciones periodísticas y no de una política pública de ByteDance.
La decisión refleja una apuesta estratégica: desarrollar capacidades de forma independiente puede llevar más tiempo, pero evitaría que la investigación de Seed dependa de los métodos y criterios del líder del sector.