PixVerse R2 نموذج للعوالم الصوتية والبصرية الآنية؛ يواصل المشهد أثناء تفاعل المستخدم معه بدلاً من إنتاج مقطع ثابت فقط. يمكن توجيه الجلسة بالنص والصور المرجعية والصوت والحركة، مع محاولة الحفاظ على حالة العالم وشخصياته وأشيائه بين التعليمات.
نشر بواسطةتم التحرير باستخدام GPT-6 Lunaتم إنشاء الصور باستخدام GPT Image 2
إجابة البحث

Create a landscape editorial hero image for this Studio Global article: What is AIsphere’s PixVerse R2, when was it released, and how does it let users create and explore continuous audiovisual worlds through tex. Article summary: AIsphere’s PixVerse R2 is a real-time audiovisual “world model”: instead of producing a finished video clip, it generates a scene that keeps running and responds to the user. AIsphere published an R2 technical overview i. Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
بدلاً من أن تكتب وصفاً ثم تنتظر فيديو مكتملاً، يَعِد PixVerse R2 بتجربة مختلفة: مشهد يظل جارياً ويمكنك التأثير في ما يحدث فيه. هذا هو المقصود بفكرة «نموذج العالم» هنا؛ إذ يتلقى النظام مدخلات المستخدم ويواصل توليد الصوت والصورة انطلاقاً من حالة المشهد وما سبقه.
أعلنت AIsphere عن R2 في 22 سبتمبر 2026، فيما أشارت تقارير إلى إطلاقه رسمياً في الصين في 23 سبتمبر. وكانت الشركة قد نشرت عرضاً تقنياً للنموذج في أغسطس. 1
5
9
يتيح R2، بحسب وصف PixVerse، توجيه الجلسة بالنص والصور المرجعية والصوت وأوامر الحركة. وتذكر تقارير إمكانية استخدام أزرار WASD، الشائعة في ألعاب الحاسوب للتحرك، إلى جانب أوامر نصية لتغيير الشخصية أو إضافة عنصر أو تعديل البيئة أثناء استمرار التوليد. الفكرة أن يؤثر الإدخال الجديد في المشهد الجاري وما سيأتي بعده، لا أن يبدأ كل أمر مقطعاً منفصلاً. 1
6
ويعتمد هذا التصور على متابعة حالة العالم عبر الجلسة: ما الذي حدث، وأين توجد الشخصيات والأشياء، وكيف ترتبط عناصر المكان بعضها ببعض. تقول AIsphere إن R2 يستخدم هذه المعلومات لتوليد المقطع التالي بصوت وصورة متزامنين، مع محاولة الإبقاء على العلاقات بين عناصر المشهد. 1
3
6
في Zero Mark، وهي تجربة تفاعلية تجمع الفيلم واللعبة وأعدّها صانع المحتوى Xiaolongbao، يمكن أن يتغير مسار اللقاء بحسب اختيار اللاعب. فعندما يقدّم اللاعب للتنين مخلوقاً آخر بدلاً من ورقة، يتلقى استجابة مختلفة؛ أي إن الاختيار يغيّر ما يحدث في المشهد نفسه. 12
أما عرض Eve فيقدّم شخصية رقمية تتفاعل مع أسئلة اللاعب وتطورات القصة. ويصف أحد التقارير استخدام الصوت والشخصية والذاكرة وحالة العلاقة للحفاظ على هوية متسقة عبر جولات الحوار. تظل هذه أمثلة توضيحية لطريقة التفاعل التي يستهدفها النظام، وليست تقييماً مستقلاً لمدى ثباتها في جلسات طويلة أو مواقف متنوعة. 6
تصف AIsphere بنية R2 من خلال مكوّنين رئيسيين. الأول Omni Causal AR، أي نموذج سببي متعدد الوسائط، وهو الجزء الذي يتعلم مواصلة العالم اعتماداً على حالته ومدخلاته المختلفة. والثاني Real-Time Acceleration، طبقة تسريع يُفترض أن تجعل هذه القدرات مناسبة للتفاعل الآني. 1
9
13
وتشرح الشركة آليات أخرى لدعم الاستجابة والاستمرارية وتقليل كلفة المعالجة:
أعلنت AIsphere أن تقييماتها الداخلية سجّلت انخفاضاً بنسبة 35.8% في انجراف الصورة خلال جلسة طويلة. وهذا رقم صادر عن الشركة، لا نتيجة تحقق منها تقييم مستقل عبر استخدامات ومشاهد مختلفة. 2
ولا توفر المصادر المتاحة مقارنة مستقلة واضحة لزمن الاستجابة أو معدل الإطارات أو جودة الصورة. لذلك، ورغم أن PixVerse تقدّم R2 بوصفه آنياً ومصمماً للحفاظ على الاتساق في الجلسات الأطول، لا تكفي المعلومات المنشورة هنا للحكم على أدائه في أنواع مختلفة من المشاهد أو الأوامر أو الجلسات الممتدة. العروض تشرح الفكرة، لكنها لا تحسم مدى موثوقيتها في الاستخدام الأوسع. 1
3
قدّمت PixVerse نموذج R1 في يناير 2026 بوصفه خطوة أولى نحو فيديو مولّد باستمرار وقابل للتفاعل. أما R2 فيُطرح كتطوير يركّز على مدخلات أوسع ومتابعة حالة المشهد على مدى أطول. ويربط PixVerse Game Engine الفيديو التوليدي الآني بوكلاء الذكاء الاصطناعي وآليات اللعب، بما يتيح تجارب تتضمن أدواراً وقواعد وتغيرات في حالة العالم. 14
18
توضح هذه المصادر اتجاه المنتج، لكنها لا توفر أساساً كافياً لنسبة رؤية أكثر تحديداً للعوالم التفاعلية إلى الرئيس التنفيذي وانغ تشانغهو.
Studio Global AI
تتضمن هذه الصفحة إجابة مدعومة بالمصدر يمكنك المتابعة داخل Studio Global.
PixVerse R2 نموذج للعوالم الصوتية والبصرية الآنية؛ يواصل المشهد أثناء تفاعل المستخدم معه بدلاً من إنتاج مقطع ثابت فقط.
PixVerse R2 نموذج للعوالم الصوتية والبصرية الآنية؛ يواصل المشهد أثناء تفاعل المستخدم معه بدلاً من إنتاج مقطع ثابت فقط. يمكن توجيه الجلسة بالنص والصور المرجعية والصوت والحركة، مع محاولة الحفاظ على حالة العالم وشخصياته وأشيائه بين التعليمات.
تقول AIsphere إن اختبارات داخلية رصدت انخفاضاً بنسبة 35.8% في انجراف الصورة خلال جلسة طويلة، لكن النتيجة لم تُثبت في معيار مستقل.