”Facing Off World Model Backbones: RNNs, Transformers, and S4” (Deng, Park ja Ahn, 2023) tutkii, mikä sekvenssimallin selkäranka on tehokkain latenttien maailmanmallien rakentamiseen mallipohjaisessa tehostetussa oppimisessa. Se esittelee S4WM:n, joka soveltaa Structured State Space Sequence (S4) -kerroksia korkeadimensioiseen visuaaliseen latenttiin imaginointiin.
Latentit maailmanmallit / mallipohjainen tehostettu oppiminen. Lähimmät perustyöt ovat latenttien dynamiikkojen agentteja, kuten PlaNet, Dreamer, DreamerV2 ja DreamerV3. Nämä oppivat kompakteja stokastisia tilarepresentaatioita ja ennustavat latentteja tulevia liikeratoja politiikan optimointia varten. Tutkimus asettaa toistuvat RSSM-tyyliset mallit – erityisesti Dreamerin – hallitsevaksi vertailuperheeksi.
Takaisinkytketyt neuroverkot. RNN-, LSTM- ja GRU-dynamiikkamallit tarjoavat online-toistuvia tilapäivityksiä, ja ne ovat olleet keskeisiä visuaalisessa maailmanmallinnuksessa. Niiden päärajoitus on peräkkäinen koulutus ajan yli, mikä vähentää ajallista rinnakkaisuutta ja voi tehdä pitkien kontekstien mallintamisesta vaikeaa.
Transformer-maailmanmallit. Transformer-pohjaiset dynamiikkamallit, kuten TransDreamer, korvaavat toiston itsehuomiolla, mikä mahdollistaa rinnakkaiskoulutuksen ja suoran pääsyn pitkiin historiaan. Niiden standardi neliöllinen huomiokustannus sekvenssipituudessa tekee pitkistä kuvitelluista liikeradoista ja pitkäkontekstisesta visuaalisesta mallinnuksesta laskennallisesti kallista.
Rakenteiset tilaspace-mallit. S4 on rakenteinen tilaspace-sekvenssimalli, joka on suunniteltu pitkän kantaman riippuvuuksiin. Se yhdistää toistuvan tilaspace-tulkinnan konvoluutiomuotoon, joka mahdollistaa rinnakkaisen sekvenssikoulutuksen. Tutkimus väittää, että tämä tekee S4:stä lupaavan keskitien: lineaarisen aikavaativuuden päättely ja rinnakkaistettava koulutus.
S4WM:n eroavaisuus. Sen sijaan, että S4:ää käytettäisiin tavanomaisissa sekvenssivertailuissa, S4WM sisällyttää sen latenttiin visuaaliseen maailmanmalliin, jossa on kuvan koodaus/dekoodaus ja stokastinen latentti dynamiikka. Tämän jälkeen sitä verrataan RNN- ja Transformer-selkärankoihin yhteisessä maailmanmallinnuskehyksessä. Ilmoitettu kontribuutio on ensimmäinen S4-pohjainen maailmanmalli, joka pystyy tuottamaan korkeadimensioisia kuvasarjoja latentin imaginoinnin kautta.
Tiivis sijoituslausunto kirjallisuuskatsaukseen:
Aiemmat maailmanmallit ovat ensisijaisesti käyttäneet toistuvia latentteja dynamiikkoja tai Transformereita. RNN-pohjaiset mallit ovat tehokkaita päättelyssä, mutta koulutetaan peräkkäin, kun taas Transformer-maailmanmallit rinnakkaistavat koulutuksen, mutta niillä on neliöllinen ajallinen kustannus. S4WM tutkii rakenteisia tilaspace-kerroksia vaihtoehtoisena selkärankana, jonka tavoitteena on säilyttää rinnakkaiskoulutus samalla kun tuetaan tehokasta pitkän aikavälin dynamiikan mallintamista.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Tutkimus ”Facing Off World Model Backbones: RNNs, Transformers, and S4” (Deng, Park ja Ahn, 2023) vertailee kolmen eri neuroverkkoarkkitehtuurin tehokkuutta latenttien maailmanmallien rakentamisessa tehostetussa oppim...
Tutkimus ”Facing Off World Model Backbones: RNNs, Transformers, and S4” (Deng, Park ja Ahn, 2023) vertailee kolmen eri neuroverkkoarkkitehtuurin tehokkuutta latenttien maailmanmallien rakentamisessa tehostetussa oppim... Tutkijat esittelevät S4WM menetelmän, joka soveltaa Structured State Space Sequence (S4) kerroksia korkeadimensioisten kuvasarjojen latenttiin imaginointiin.
Lähimmät perustyöt latenttien maailmanmallien (PlaNet, Dreamer, DreamerV2 ja DreamerV3) parissa oppivat kompakteja stokastisia tilarepresentaatioita ja ennustavat latentteja tulevia liikeratoja politiikan optimointia...