ByteDance uppges förbereda en Seedance baserad AI modell som kan skapa interaktiva virtuella miljöer i stället för vanliga, linjära videoklipp. Modellen kopplas i rapporteringen till livesändningar, kortdramer, spel och möjligtvis Pico headset.
Publicerad avRedigerad med GPT-5.6 TerraBilder genererade med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is known about ByteDance’s reported real-time spatial video AI model—personally overseen by founder Zhang Yiming and potentially launch. Article summary: ByteDance is reportedly developing a Seedance-based real-time spatial-video, or “world model,” that could generate interactive 3D environments rather than conventional linear video. Zhang Yiming is said to be personally . Topic tags: general, news, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
ByteDance uppges utveckla ett AI-system för rumslig videogenerering i realtid – en typ av så kallad världsmodell. Tanken är inte bara att skapa ett färdigt videoklipp, utan digitala miljöer som går att röra sig i och interagera med. Bloomberg rapporterar att grundaren Zhang Yiming personligen övervakar arbetet och att en lansering kan ske redan nästa månad, alltså tidigast i oktober 2026. Tidplanen kan dock ändras och ByteDance har inte bekräftat projektet offentligt. 1
Den rapporterade modellen ska bygga på ByteDances videogenereringsteknik Seedance. Seedance 2.0 är en multimodal ljud- och videomodell som kan ta emot text, bilder, ljud och video som indata, enligt ByteDances egen lanseringsinformation.
Det nya systemet sägs gå längre än att skapa en fast videosekvens. Enligt rapporteringen ska det kunna bygga interaktiva virtuella världar för bland annat livesändningar, kortdramer och spel. 7 I praktiken handlar det om att miljön ska kunna förändras eller reagera när en användare rör sig, talar eller gör val – snarare än att bara spela upp en förberedd film från början till slut.
Det är också därför tekniken beskrivs som en världsmodell. Google DeepMind definierar sådana modeller som system som kan simulera hur en miljö utvecklas och hur handlingar påverkar den. DeepMinds Genie 3 är exempelvis utformad för att skapa navigerbara, interaktiva miljöer från textinstruktioner i realtid.
Enligt Bloombergs uppgifter samordnar Zhang Yiming arbetet mellan olika delar av ByteDance och riktar AI-resurser samt datorkapacitet mot modellen. 1 Det betyder inte att en färdig produkt eller ett fast lanseringsdatum finns. Men om uppgifterna stämmer tyder grundarens engagemang på att ByteDance ser detta som ett större plattformsprojekt – inte bara som ännu en funktion för AI-video.
Bloomberg placerar satsningen i konkurrensen med Meta och Alphabet, Googles moderbolag, inom ett teknikområde som på sikt kan få användning även inom robotik och autonoma system. 1 Först kan underhållning vara den närmaste kommersiella tillämpningen. Den större ambitionen är dock att bygga en modell som kan hålla ihop en användbar miljö även när användaren påverkar den.
En rapport, med hänvisning till personer med insyn, uppger att modellen kan generera videoströmmar med omkring 20 bildrutor per sekund och ungefär 0,05 sekunders fördröjning. Den sägs även kunna svara på röst- eller rörelseinmatning från användare av ByteDances Pico-headset. 7
Detta är rapporterade uppgifter, inte offentliga benchmarkresultat eller teknisk dokumentation från ByteDance. För att fungera väl i ett XR-headset – där XR omfattar exempelvis VR och AR – krävs dessutom mer än hög genereringstakt. Bildstabilitet, rumslig konsekvens, nätverkskvalitet, faktisk rörelse-till-bild-fördröjning och kostnaden för beräkning i molnet påverkar den upplevda kvaliteten.
Molnbaserad rendering skulle i teorin kunna flytta en del beräkningar från headsetet till datacenter och därmed minska kraven på lokal hårdvara. Men det är för tidigt att dra slutsatsen att modellen kommer att göra Pico billigare eller ge ByteDance en avgörande fördel gentemot Meta eller Apple. Det är möjliga följder, inte bekräftade produktresultat.
Formuleringen ”redan nästa månad” bygger på anonyma källor. Bloomberg rapporterade att produkten förbereds för en möjlig lansering, inte att ByteDance har annonserat ett bestämt datum. 1 Andra rapporter som återger uppgifterna betonar också att schemat kan ändras.
8
Fram till dess att ByteDance publicerar ett eget besked är det klokt att skilja mellan:
ByteDance har stora resurser för AI-infrastruktur, även om de inte är öronmärkta för just denna modell. Reuters rapporterade att bolaget säkrat ett lån på 29,6 miljarder dollar från nära 30 banker. Enligt källor ska kapitalet stödja ByteDances internationella AI-expansion, och lånet uppges ha vuxit från ett ursprungligt mål på 20 miljarder dollar.
Bloomberg har dessutom rapporterat att ByteDance övervägde investeringar på upp till 70 miljarder dollar under 2026 i datacenter och annan AI-infrastruktur. Det var en rapporterad planeringsnivå, inte bekräftade utgifter eller en budget som specifikt avser denna rumsliga videomodell.
Rapporter som bygger på 36Kr:s bevakning uppger också att ByteDance satt som intern målsättning att släppa minst en världsmodell före slutet av 2026 och jämföra den med Googles Genie 3. Även detta är rapporterade interna prioriteringar, inte offentliga löften från ByteDance.
AI-videomodeller kan redan skapa övertygande klipp. Men en interaktiv miljö ställer hårdare krav: scenen måste vara sammanhängande över tid och reagera rimligt på användarens inmatning. Just den kombinationen är både lockelsen och den svåra tekniska uppgiften för världsmodeller.
Om ByteDance lyckas kan tekniken förena bolagets AI-videoarbete med interaktiv underhållning och XR. För branschen innebär det ytterligare en tung konkurrent i ett fält där Google och Meta redan har synliga satsningar. Den försiktiga slutsatsen är ändå tydlig: ByteDance verkar driva ett seriöst projekt för rumslig video och världsmodeller, byggt på Seedance och med Zhang Yimings rapporterade stöd. Den faktiska kvaliteten, tidplanen och betydelsen för Pico är däremot inte bevisade förrän bolaget visar produkten och publicerar mätbara resultat. 1
7
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
ByteDance uppges förbereda en Seedance baserad AI modell som kan skapa interaktiva virtuella miljöer i stället för vanliga, linjära videoklipp.
ByteDance uppges förbereda en Seedance baserad AI modell som kan skapa interaktiva virtuella miljöer i stället för vanliga, linjära videoklipp. Modellen kopplas i rapporteringen till livesändningar, kortdramer, spel och möjligtvis Pico headset.
Grundaren Zhang Yiming sägs själv leda arbetet, vilket signalerar att ByteDance kan se tekniken som en strategisk plattform snarare än en enskild AI videofunktion.