ByteDanceは、Seedanceを基盤に、仮想世界をリアルタイムで生成・操作できる空間動画AIを準備していると報じられている。発表は2026年10月にもあり得るが、日程は未確定だ。 ライブ配信、ショートドラマ、ゲーム向けの用途が伝えられ、Picoヘッドセットの音声・動作入力に反応する可能性も報じられた。毎秒20フレーム、約0.05秒の遅延は、独立検証済みのベンチマークではない。
公開者GPT-5.6 Terra で編集GPT Image 2 で画像を生成
研究の答え

Create a landscape editorial hero image for this Studio Global article: What is known about ByteDance’s reported real-time spatial video AI model—personally overseen by founder Zhang Yiming and potentially launch. Article summary: ByteDance is reportedly developing a Seedance-based real-time spatial-video, or “world model,” that could generate interactive 3D environments rather than conventional linear video. Zhang Yiming is said to be personally . Topic tags: general, news, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
ByteDance(バイトダンス)は、リアルタイムで空間動画を生成するAI、いわゆるワールドモデルの開発を進めていると報じられています。これは通常の「完成した動画クリップ」を出力するAIではなく、利用者が移動したり操作したりすると応答する、探索可能なデジタル空間の生成を目指すものです。Bloombergによると、創業者の張一鳴(チャン・イーミン)氏が開発を直接監督しており、早ければ2026年10月にも発表される可能性があります。ただし、予定は変更される可能性があり、ByteDanceはこのプロジェクトを公表していません。 1
報道によれば、新モデルはByteDanceの動画生成技術Seedanceを基盤とします。ByteDanceが公開したSeedance 2.0の情報では、同モデルはテキスト、画像、音声、動画を入力として扱えるマルチモーダルの音声・動画生成モデルです。
今回報じられた空間動画システムは、あらかじめ決まった映像を一本生成するだけではありません。ライブ配信、ショートドラマ、ゲーム向けに、ユーザーが関われる仮想世界を作る用途が想定されているとされています。 7 例えば、視点を動かす、声で指示する、空間内で行動するといった入力に対し、場面が変化し続けることが狙いとみられます。
こうした性質から「ワールドモデル」と呼ばれます。Google DeepMindはワールドモデルを、環境がどう変化し、行動が環境にどのような影響を与えるかをシミュレートするAIと説明しています。同社のGenie 3は、テキストからリアルタイムで探索可能な環境を生成する仕組みとして開発されています。
Bloombergの報道では、張氏はByteDance内の複数事業部門の取り組みを調整し、AI人材・リソースと計算能力をこのモデルに振り向けているとされます。 1 もっとも、これは製品完成やリリース確定を意味するものではありません。
それでも、創業者が直接関与しているという報道が正しければ、ByteDanceがこの開発を単なる動画生成機能の追加ではなく、将来の基盤技術として扱っている可能性を示します。Bloombergはこの動きをMetaやAlphabet(Google)との競争の一部と位置づけ、エンターテインメントだけでなく、ロボティクスや自律システムへの応用可能性にも触れています。 1
関係者の話として伝えられた内容によると、このモデルは毎秒約20フレーム、約**0.05秒(50ミリ秒)**の遅延で動画ストリームを生成できる可能性があります。また、Picoのヘッドセット利用者の音声や動きに反応する仮想世界を生成することも想定されているといいます。 7
ただし、これらは報道に基づく数値であり、ByteDanceが公開した技術文書や第三者ベンチマークで裏付けられた結果ではありません。実際にXR(拡張現実)製品として成立させるには、単なる生成速度だけでなく、映像の安定性、空間としての一貫性、通信の信頼性、ユーザーの動きから画面表示までの遅延、推論コストなども重要になります。
クラウド側で描画・生成処理を担えれば、ヘッドセット本体の計算負荷を抑えられる可能性はあります。しかし、このモデルがPicoの価格を下げる、あるいはMetaやAppleに対する決定的な優位性になると結論づけるのは時期尚早です。現段階では、確認済みの製品効果ではなく、あくまで考え得る戦略上の含意にとどまります。
注目を集めている「早ければ来月」という時期は、匿名の情報源に基づくものです。Bloombergは発売日を確定情報として伝えたのではなく、製品が発表に向け準備されている可能性を報じています。 1 この内容を引用した続報でも、スケジュールは変更され得るとされています。
8
ByteDanceが正式発表するまでは、次の3点を分けて受け止める必要があります。
ByteDanceはAIインフラに大きな資金を投じられる立場にありますが、それがこの空間動画モデルに直接割り当てられる予算だと確認されたわけではありません。Reutersは、同社が約30行から296億ドルの融資を確保し、その資金は海外でのAI事業拡大を支える見込みだと関係者の話として報じました。融資枠は当初の200億ドルから拡大したとされています。
またBloombergは、ByteDanceが2026年にデータセンターなどAIインフラ向けの設備投資を最大700億ドルまで増やすことを検討していると報じています。これは検討段階の計画値であり、確定した支出額でも、特定モデル向けの配分でもありません。
36Krの報道をもとにした記事では、ByteDanceが2026年末までに少なくとも1つのワールドモデルを公開し、GoogleのGenie 3をベンチマークとする目標を掲げたとされています。 ただし、これもByteDanceによる公式の対外コミットメントではなく、報じられた社内方針です。
AI動画は見栄えのする映像を作れますが、操作可能な環境を生成するには、さらに難しい能力が必要です。時間が経っても一貫した場面を保ち、利用者の入力にもっともらしく反応し続けなければなりません。そこにワールドモデルの魅力と技術的な難しさがあります。
ByteDanceにとって成功すれば、動画生成AIを、インタラクティブなエンターテインメントやXRへつなげる足場になり得ます。業界全体では、GoogleやMetaが公に先行しているワールドモデル領域に、有力な競合が加わることになります。
現時点で言えることは限定的です。ByteDanceはSeedanceを基盤とする本格的な空間動画ワールドモデルを進め、張氏が関与していると報じられています。一方で、実際の品質、発表時期、Picoへの影響は、製品公開と測定可能な技術結果が出るまで未証明です。 1
7
Studio Global AI
このページにはソースに裏付けされた回答が含まれており、Studio Global 内で続行できます。
ByteDanceは、Seedanceを基盤に、仮想世界をリアルタイムで生成・操作できる空間動画AIを準備していると報じられている。発表は2026年10月にもあり得るが、日程は未確定だ。
ByteDanceは、Seedanceを基盤に、仮想世界をリアルタイムで生成・操作できる空間動画AIを準備していると報じられている。発表は2026年10月にもあり得るが、日程は未確定だ。 ライブ配信、ショートドラマ、ゲーム向けの用途が伝えられ、Picoヘッドセットの音声・動作入力に反応する可能性も報じられた。毎秒20フレーム、約0.05秒の遅延は、独立検証済みのベンチマークではない。
この取り組みは、一方向に再生される動画ではなく、利用者の行動に応じて変化する環境を扱う「ワールドモデル」競争へのByteDanceの本格参入を示す可能性がある。