바이트댄스는 Seedance 기반으로 라이브 방송·숏드라마·게임용 상호작용 가상 세계를 생성하는 실시간 공간 영상 AI를 준비 중인 것으로 보도됐다.[1][7] 보도상 성능 수치는 초당 약 20프레임, 약 0.05초(50ms) 지연이지만 공개 벤치마크나 기술 문서로 독립 검증된 결과는 아니다.[7] 이 프로젝트는 단방향 AI 영상 생성이 아닌 ‘월드 모델’ 경쟁에 바이트댄스가 본격적으로 뛰어든 신호로 해석될 수 있다. 다만 출시 시점과 Pico에서의 실제 경험은 아직 미확정이다.[1][7]
게시자GPT-5.6 Terra로 편집GPT Image 2로 이미지 생성
연구 답변

Create a landscape editorial hero image for this Studio Global article: What is known about ByteDance’s reported real-time spatial video AI model—personally overseen by founder Zhang Yiming and potentially launch. Article summary: ByteDance is reportedly developing a Seedance-based real-time spatial-video, or “world model,” that could generate interactive 3D environments rather than conventional linear video. Zhang Yiming is said to be personally . Topic tags: general, news, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
바이트댄스가 실시간 공간 영상 생성 AI 모델을 개발 중이며, 빠르면 다음 달(2026년 10월) 공개할 수 있다는 보도가 나왔다. 이 모델은 보통의 선형 영상 클립을 만드는 AI를 넘어, 사용자가 움직이고 상호작용할 수 있는 디지털 환경을 생성하는 이른바 **월드 모델(world model)**을 지향하는 것으로 전해진다. 다만 바이트댄스는 이 프로젝트를 공식 발표하지 않았고, 일정도 바뀔 수 있다.1
보도에 따르면 새 모델은 바이트댄스의 영상 생성 기술인 Seedance를 토대로 개발되고 있다. 바이트댄스가 공개한 Seedance 2.0은 텍스트·이미지·오디오·영상을 입력으로 받는 멀티모달 오디오·비디오 생성 모델이다.
핵심은 고정된 영상을 출력하는 데 그치지 않는다는 점이다. 해당 시스템은 라이브 방송, 숏드라마, 게임 등에 활용할 수 있는 상호작용형 가상 세계를 만들 수 있는 것으로 소개됐다.7 즉 처음부터 끝까지 정해진 순서로 재생되는 영상이 아니라, 사용자의 이동이나 입력에 맞춰 장면이 반응하고 이어지는 형태가 목표로 보인다.
이 때문에 업계에서는 이를 월드 모델로 분류한다. 구글 딥마인드는 월드 모델을 환경이 어떻게 변하고 행동이 환경에 어떤 영향을 주는지를 시뮬레이션하는 시스템으로 설명한다. 딥마인드의 Genie 3 역시 텍스트 프롬프트로 실시간 탐색이 가능한 상호작용 환경을 생성하도록 설계됐다.
블룸버그 보도에 따르면 장이밍 바이트댄스 창업자는 여러 사업 부문의 작업을 조율하고, 이 프로젝트에 AI 인력·컴퓨팅 자원을 집중시키고 있다.1 이것만으로 완성된 제품이나 확정된 출시를 의미하지는 않는다. 그러나 창업자가 직접 관여한다는 보도가 사실이라면, 바이트댄스가 이를 일반적인 AI 영상 기능 하나가 아니라 장기 플랫폼 기술로 보고 있을 가능성을 시사한다.
블룸버그는 이 움직임을 메타와 알파벳(구글)을 상대로 한 경쟁으로 설명하며, 엔터테인먼트뿐 아니라 로보틱스와 자율 시스템에도 활용 가능성이 있다고 짚었다.1 당장의 상용화 접점은 인터랙티브 콘텐츠일 수 있지만, 더 큰 기술적 목표는 사용자의 행동으로 환경이 바뀌어도 일관성을 유지하는 모델에 있다.
프로젝트에 정통한 관계자를 인용한 한 보도는 이 모델이 초당 약 **20프레임(fps)**의 영상 스트림을 생성하고, 지연 시간은 약 **0.05초(50밀리초)**에 이를 수 있다고 전했다. 또한 Pico 헤드셋 사용자의 음성이나 움직임 입력에 반응하는 가상 세계를 목표로 한다는 내용도 포함됐다.7
다만 이 수치는 보도에 기반한 주장이지, 바이트댄스가 공개한 벤치마크나 기술 문서로 검증된 결과는 아니다. 실제 XR(확장현실) 경험은 생성 속도만으로 판단할 수 없다. 영상의 안정성, 공간적 일관성, 네트워크 품질, 사용자의 움직임과 화면 표시 사이의 지연, 추론 비용이 모두 중요하다.
클라우드 렌더링은 헤드셋 밖의 서버에서 연산을 처리해 기기 자체의 연산 부담을 낮출 가능성은 있다. 그러나 이것이 Pico 기기 가격을 낮추거나 메타·애플보다 결정적인 우위를 만들 것이라고 단정하기에는 이르다. 이는 가능한 전략적 함의일 뿐, 확정된 제품 결과가 아니다.
가장 주목받는 표현은 ‘빠르면 다음 달’이지만, 이는 익명 소식통을 인용한 보도 내용이다. 블룸버그는 제품이 출시 가능성에 대비 중이라고 전했을 뿐, 고정된 날짜를 발표한 것은 아니다.1 이후 이 내용을 인용한 보도들도 일정 변경 가능성을 언급했다.
8
공식 발표 전에는 다음 세 가지를 구분해 볼 필요가 있다.
바이트댄스는 AI 인프라에 투입할 수 있는 상당한 재원을 확보하고 있는 것으로 알려졌지만, 그것이 이 모델에만 배정된 예산이라는 뜻은 아니다. 로이터는 바이트댄스가 약 30개 은행으로부터 296억 달러 규모의 대출을 확보했으며, 소식통들은 자금이 해외 AI 확장을 지원하는 데 쓰일 것이라고 전했다고 보도했다. 대출 규모는 당초 목표인 200억 달러에서 확대된 것으로 알려졌다.
별도로 블룸버그는 바이트댄스가 2026년 데이터센터 및 기타 AI 인프라에 최대 700억 달러의 자본지출을 검토하고 있다고 보도했다. 이는 확정 지출액도, 특정 모델에 배정된 금액도 아닌 계획 단계의 수치다.
36Kr 보도를 인용한 매체들은 바이트댄스가 2026년 말까지 최소 한 개의 월드 모델을 공개하고, 구글 Genie 3를 기준으로 성능을 비교하는 목표를 세웠다고 전했다. 이 역시 바이트댄스의 공식 대외 공약이 아니라 보도된 내부 우선순위로 봐야 한다.
AI 영상 모델은 그럴듯한 클립을 만들 수 있다. 하지만 상호작용 환경은 더 어려운 문제를 요구한다. 시간이 지나도 장면의 구조를 일관되게 유지하고, 사용자의 입력에 따라 그럴듯하게 변화해야 한다. 이것이 월드 모델의 매력이자 기술적 난제다.
바이트댄스가 이 시스템을 성공적으로 구현한다면, 영상 생성 AI를 인터랙티브 엔터테인먼트와 XR로 연결할 수 있다. 업계 전체로는 구글과 메타 등이 공개적으로 경쟁해 온 월드 모델 분야에 또 하나의 대형 경쟁자가 더해지는 셈이다.
현재 증거가 뒷받침하는 결론은 제한적이다. 바이트댄스는 Seedance를 기반으로 한 진지한 공간 영상 월드 모델 프로젝트를 추진하는 것으로 보이며, 장이밍이 직접 관심을 두고 있다는 보도가 나왔다. 그러나 실제 품질, 출시 일정, Pico에 미칠 영향은 회사가 제품과 측정 가능한 기술 결과를 공개하기 전까지 입증되지 않았다.1
7
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
바이트댄스는 Seedance 기반으로 라이브 방송·숏드라마·게임용 상호작용 가상 세계를 생성하는 실시간 공간 영상 AI를 준비 중인 것으로 보도됐다.[1][7]
바이트댄스는 Seedance 기반으로 라이브 방송·숏드라마·게임용 상호작용 가상 세계를 생성하는 실시간 공간 영상 AI를 준비 중인 것으로 보도됐다.[1][7] 보도상 성능 수치는 초당 약 20프레임, 약 0.05초(50ms) 지연이지만 공개 벤치마크나 기술 문서로 독립 검증된 결과는 아니다.[7]
이 프로젝트는 단방향 AI 영상 생성이 아닌 ‘월드 모델’ 경쟁에 바이트댄스가 본격적으로 뛰어든 신호로 해석될 수 있다. 다만 출시 시점과 Pico에서의 실제 경험은 아직 미확정이다.[1][7]