دراسة (Deng, Park, and Ahn, 2023) تبحث في أفضل بنية لنموذج تسلسل للنماذج العالمية الكامنة في التعلم المعزز القائم على النماذج. تقديم نموذج S4WM الذي يطبق طبقات الحالة المنظمة (S4) على التخيل البصري عالي الأبعاد.

Create a landscape editorial hero image for this Studio Global article: related work of Facing Off World Model Backbones: RNNs, Transformers, and S4. Article summary: “Facing Off World Model Backbones: RNNs, Transformers, and S4” (Deng, Park, and Ahn, 2023) studies which sequence model backbone is most effective for latent world models in model based reinforcement learning.. Topic tags: general web, productivity, code, privacy, regulation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail
تدرس ورقة بحثية بعنوان "مواجهة أعمدة النماذج العالمية: الشبكات العصبية المتكررة والمحولات ونماذج الحالة المنظمة" (Deng, Park, and Ahn, 2023) أي بنية من بنيات نماذج التسلسل هي الأكثر فعالية للنماذج العالمية الكامنة في التعلم المعزز القائم على النماذج. تقدم الورقة نموذج S4WM، الذي يطبق طبقات الحالة المنظمة (S4) على التخيل البصري عالي الأبعاد.
النماذج العالمية الكامنة / التعلم المعزز القائم على النماذج. أقرب الأسس هي وكلاء الديناميكيات الكامنة مثل PlaNet و Dreamer و DreamerV2 و DreamerV3، والتي تتعلم تمثيلات حالة مضغوطة وعشوائية وتتنبأ بالمسارات المستقبلية الكامنة لتحسين السياسات. تضع الورقة نماذج RSSM المتكررة، وخاصة Dreamer، كعائلة أساسية مهيمنة.
الشبكات العصبية المتكررة (RNNs). توفر نماذج الديناميكيات المتكررة مثل RNN و LSTM و GRU تحديثات حالة متكررة عبر الإنترنت وكانت محورية في النمذجة العالمية البصرية. قيودها الرئيسية هي التدريب التسلسلي عبر الزمن، مما يقلل من التوازي الزمني ويمكن أن يجعل نمذجة السياقات الطويلة جداً أكثر صعوبة.
النماذج العالمية القائمة على المحولات (Transformers). تستبدل نماذج الديناميكيات القائمة على المحولات، بما في ذلك TransDreamer، التكرار بالانتباه الذاتي، مما يتيح التدريب المتوازي والوصول المباشر إلى التواريخ الطويلة. تكلفة الانتباه التربيعية القياسية في طول التسلسل تجعل عمليات المحاكاة الطويلة والنمذجة البصرية طويلة السياق مكلفة حسابياً.
نماذج الحالة المنظمة (S4). S4 هو نموذج تسلسلي للحالة المنظمة مصمم للتبعيات طويلة المدى، يجمع بين تفسير الحالة المتكرر وشكل التفاف يسمح بالتدريب المتوازي للتسلسلات. تجادل الورقة بأن هذا يجعل S4 أرضية وسط واعدة: استدلال متكرر خطي وتدريب قابل للتوازي.
تميز S4WM. بدلاً من استخدام S4 في معايير التسلسل التقليدية، يدمجه S4WM في نموذج عالمي بصري كامن، مع ترميز/فك تشفير الصور وديناميكيات كامنة عشوائية، ثم يقيمه مقابل أعمدة RNN والمحولات في إطار نمذجة عالمية مشترك. المساهمة المعلنة هي أول نموذج عالمي قائم على S4 لتوليد تسلسلات صور عالية الأبعاد عبر التخيل الكامن.
بيان تحديد المواقع الموجز لمراجعة الأدبيات:
استخدمت النماذج العالمية السابقة في المقام الأول الديناميكيات الكامنة المتكررة أو المحولات. النماذج القائمة على RNN فعالة في الاستدلال ولكنها تدرب بشكل تسلسلي، بينما تقوم النماذج العالمية القائمة على المحولات بتدريب متوازي ولكن لها تكلفة زمنية تربيعية. يستكشف S4WM طبقات الحالة المنظمة كبديل يهدف إلى الاحتفاظ بالتدريب المتوازي مع دعم نمذجة الديناميكيات الفعالة طويلة الأفق.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
دراسة (Deng, Park, and Ahn, 2023) تبحث في أفضل بنية لنموذج تسلسل للنماذج العالمية الكامنة في التعلم المعزز القائم على النماذج.
دراسة (Deng, Park, and Ahn, 2023) تبحث في أفضل بنية لنموذج تسلسل للنماذج العالمية الكامنة في التعلم المعزز القائم على النماذج. تقديم نموذج S4WM الذي يطبق طبقات الحالة المنظمة (S4) على التخيل البصري عالي الأبعاد.
يعتمد على أسس مثل Dreamer وPlaNet التي تستخدم تمثيلات حالة مضغوطة وعشوائية.