바이트댄스의 AI 연구 조직 Seed는 2023년부터 경쟁 모델의 출력을 학습 데이터에 활용하는 방식을 제한했으며, 2026년에도 단기 벤치마크 손실을 감수하겠다는 방침을 재확인한 것으로 전해졌습니다. 보도된 규정은 GPT 같은 폐쇄형 모델뿐 아니라 오픈 웨이트 모델까지 포함하지만, 바이트댄스가 공개적으로 발표한 공식 정책은 아닙니다.
연구 답변

Create a landscape editorial hero image for this Studio Global article: Why did ByteDance founder Zhang Yiming reaffirm Seed’s 2023 prohibition against training its language models on outputs from other companies. Article summary: Zhang reaffirmed the prohibition because he views competitor-output distillation as a short-term benchmark shortcut that would undermine Seed’s ability to discover its own training methods, research directions, and model. Topic tags: general, news, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
바이트댄스 창업자 장이밍이 경쟁 AI 모델의 출력을 활용한 ‘모델 증류’를 다시 금지한 이유는 단순히 법적 위험이나 미국과 중국 사이의 정치적 긴장 때문만은 아닌 것으로 보입니다. 보도에 따르면 그는 바이트댄스의 AI 연구 조직 Seed가 단기 벤치마크 순위를 위해 경쟁사의 능력을 빌리는 대신, 자체적인 학습 방식과 연구 방향을 구축해야 한다고 판단했습니다. 1
모델 증류는 강력한 AI 모델의 답변을 이용해 더 작거나 약한 모델을 학습시키는 방식입니다. 적은 시간과 자원으로 일정 수준의 능력을 재현할 수 있다는 장점이 있지만, 학습 대상이 된 모델의 답변 방식과 문제 풀이 전략까지 따라가게 될 수 있습니다. Seed가 우려한 지점은 바로 여기에 있습니다. 빠르게 성능을 끌어올리더라도 경쟁사를 능숙하게 모방하는 ‘추종자’에 머물 수 있다는 것입니다. 4
9
보도 내용을 종합하면 Seed의 방침은 2023년 GPT API에서 생성된 자료를 활용하던 초기 실험에서 출발했습니다. 바이트댄스가 2023년 4월 API 호출 감사를 도입한 뒤, Seed 내부 팀은 GPT가 생성한 데이터를 바이트댄스의 학습 데이터에 넣지 않는다는 규정을 마련한 것으로 전해졌습니다. 이후 이 원칙은 GPT 한 가지를 넘어 경쟁 AI 모델 전반으로 확대됐습니다. 9
14
따라서 이번 방침은 특정 기업의 유료 API를 무단으로 대량 이용하지 말라는 수준의 규정과는 다릅니다. 보도된 내용대로라면 폐쇄형 모델이든 오픈 웨이트 모델이든, 다른 회사의 AI를 Seed의 ‘교사’로 삼지 않는다는 보다 포괄적인 연구 원칙에 가깝습니다. 9
10
내부 논쟁은 2025년 1월 DeepSeek-R1이 강력한 추론 성능과 효율성을 보여준 뒤 다시 커진 것으로 알려졌습니다. 일부 Seed 연구자들은 더 뛰어난 미국 AI 시스템의 출력을 보조 학습 자료로 사용하면 바이트댄스가 자체 학습 체계를 유지하면서도 추론 능력을 더 빠르게 개선할 수 있다고 주장한 것으로 전해졌습니다. 9
하지만 장이밍의 판단은 달랐습니다. 경쟁 모델의 답변을 활용하는 순간, 그 성능 향상은 결국 ‘빌린 능력’에 의존하게 된다는 것입니다. 다만 DeepSeek가 실제로 미국 최첨단 모델의 합성 데이터를 사용했다는 주장은 현재 제공된 근거만으로는 독립적으로 확인된 사실이 아니라 업계 추측에 해당합니다. 이 사안은 Seed의 내부 규정에 관한 별도의 보도와 구분해야 합니다.
중국 AI 개발사들은 하드웨어와 모델 성능, 벤치마크 순위를 둘러싸고 치열한 경쟁을 벌이고 있습니다. 이러한 환경에서는 더 강력한 모델의 출력을 증류해 성능 격차를 빠르게 줄이는 방법이 매력적으로 보일 수밖에 없습니다. 보도는 Seed 연구자들이 빠르게 발전하는 최첨단 모델들과 함께, 경쟁사들이 살펴보거나 학습 자료로 활용할 가능성이 있는 오픈 웨이트 모델인 문샷의 Kimi K3를 주시했다고 전합니다. 9
14
이때 증류 금지는 단순한 연구 철학이 아니라 뚜렷한 전략적 선택이 됩니다. 강한 모델의 출력을 활용하면 측정 가능한 격차를 단기간에 줄일 수 있지만, 이를 거부하면 경쟁사보다 뒤처진 상태가 더 오래 이어질 수 있습니다. 그럼에도 2026년 Seed 전체 회의에서 장이밍은 일시적인 성능 하락을 감수하더라도 경쟁 모델을 증류해서는 안 된다는 입장을 분명히 한 것으로 전해졌습니다. 1
10
폐쇄형 모델과 오픈 웨이트 모델은 기술적 접근 방식과 라이선스 조건이 서로 다릅니다. 그러나 Seed가 문제 삼은 것은 접근 권한보다 ‘의존’ 자체였던 것으로 보입니다. 다른 연구소의 모델을 API로 사용하든, 공개된 가중치를 바탕으로 분석하든, 경쟁사가 이미 찾아낸 해법을 학습하는 구조가 될 수 있다는 점은 같다는 논리입니다. 9
14
이는 오픈 웨이트 모델을 사용하는 모든 행위가 부적절하다는 뜻은 아닙니다. 라이선스가 허용하는 활용과 연구 목적의 전이 학습은 각각 별도로 판단해야 합니다. 다만 보도된 Seed의 내부 기준은 무단 API 수집을 막는 일반적인 컴플라이언스 규정보다 엄격했습니다. 다른 회사의 최첨단 모델을 교사로 사용하지 말라는 지침에 오픈 웨이트 모델도 포함됐다는 것입니다. 10
14
이 방침의 의미는 다른 중국 AI 기업들을 둘러싼 의혹이 제기되면서 더욱 커졌습니다. 앤스로픽은 알리바바, 딥시크, 문샷, 미니맥스, Z.ai가 계정이나 프록시를 이용해 클로드의 출력을 확보한 뒤 학습에 사용했다고 주장했습니다. 해당 주장에 바이트댄스가 포함된 것은 아닙니다. 미국 당국자 역시 문샷이 앤스로픽의 모델을 부적절하게 사용해 Kimi K3를 학습시켰다고 비난한 바 있습니다. 다만 이는 제공된 자료에서 확정된 사실이 아니라 당사자들의 주장과 의혹입니다. 6
9
중요한 점은 Seed의 증류 제한이 이런 정치적 논란보다 앞선 2023년부터 시작됐다는 사실입니다. 따라서 후발 의혹이 이 정책을 만든 원인이라기보다는, 장이밍이 강조해온 연구 독립성의 중요성을 더욱 부각한 것으로 해석하는 편이 타당합니다. 9
장이밍의 판단은 최첨단 AI를 어떻게 개발할 것인가에 대한 장기적인 베팅으로 볼 수 있습니다. 증류는 모델의 답변 품질과 추론 패턴, 벤치마크 점수를 빠르게 개선할 수 있습니다. 그러나 경쟁사의 출력을 반복해서 학습하면 그 회사가 선호하는 문제 분해 방식, 보상 신호, 답변 스타일, 평가 기준에 맞춰 모델을 최적화하게 될 가능성이 있습니다. 9
10
Seed가 택한 길은 더 느릴 수밖에 없습니다. 자체 데이터와 학습 기법, 모델 구조, 연구 우선순위를 만들어야 하기 때문입니다. 그 과정에서 경쟁사보다 리더보드 순위가 낮아질 수 있고, 다른 기업들이 활용하는 지름길을 포기해야 하는 비용도 발생합니다.
그 대신 바이트댄스가 기대하는 보상은 연구의 독립성입니다. 현재 가장 앞선 모델의 설계 선택에 묶이지 않고, 경쟁사가 아직 시도하지 않은 방법과 모델 행동을 스스로 발견할 가능성을 남겨두는 것입니다.
결국 이번 결정은 증류가 기술적으로 쓸모없다는 선언이 아닙니다. 단기적인 성능 향상이 장기적인 종속보다 가치 있는지에 대한 판단입니다. 바이트댄스의 보도된 방침은 이 선택을 선명하게 보여줍니다. Seed는 오늘의 경쟁에서 뒤처질 수는 있어도, 다른 회사의 답변을 베껴 미래의 AI를 만들지는 않겠다는 것입니다. 1
9
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
바이트댄스의 AI 연구 조직 Seed는 2023년부터 경쟁 모델의 출력을 학습 데이터에 활용하는 방식을 제한했으며, 2026년에도 단기 벤치마크 손실을 감수하겠다는 방침을 재확인한 것으로 전해졌습니다.
바이트댄스의 AI 연구 조직 Seed는 2023년부터 경쟁 모델의 출력을 학습 데이터에 활용하는 방식을 제한했으며, 2026년에도 단기 벤치마크 손실을 감수하겠다는 방침을 재확인한 것으로 전해졌습니다. 보도된 규정은 GPT 같은 폐쇄형 모델뿐 아니라 오픈 웨이트 모델까지 포함하지만, 바이트댄스가 공개적으로 발표한 공식 정책은 아닙니다.
핵심 판단은 단기 성능 향상보다 연구 독립성입니다. 경쟁사의 답변을 반복적으로 학습하면 빠르게 따라잡을 수 있지만, 장기적으로는 다른 연구소의 방법론과 ‘지능의 설계’에 종속될 수 있다는 우려입니다.