為咗畀個網絡有足夠空間去接收呢啲完全唔同嘅物理,研究團隊喺神經網絡嘅架構加咗啲叫做「假狗/樽頸節點(dummy bottleneck nodes)」嘅額外參數。你可以當呢啲節點係預先訓練階段留低嘅空位,去到微調階段先至用嚟裝住奇異物理嘅訊號特徵 。
結果好令人振奮。喺啲順利嘅情況,呢套轉移學習方法可以將所需嘅「超越ΛCDM」珍貴模擬數量,劈低超過一個數量級(即係慳咗九成以上),而且仲保持到好穩健嘅推論能力 。
換句話講,呢個方法好似將全世界科學家咁多年嚟投放喺標準模型模擬嘅心血,變成一種可以重用嘅資源,直接繞過咗好似DESI呢類大型實驗所面對嘅樽頸位 。
不過,呢項研究最令人心寒嘅發現,係精準咁點出咗呢種技術會點樣出事。
當一種新物理產生嘅效果,同個AI由ΛCDM度學返嚟嘅舊知識太過似樣,AI個「既有知識庫」就會變成一個負累。呢種崩壞嘅情況,學術上叫做 「負轉移」(negative transfer):微調唔單止冇令個網絡變得更聰明,反而令佢表現仲差過之前 。
出事嘅根源係物理簡併(physical degeneracy)。舉個例說明,假設有一批大質量中微子,佢哋會壓低細尺度上嘅物質結集,呢個宇宙學訊號,同埋一個標準ΛCDM宇宙入面「物質擾動幅度(σ₈)」較低嘅情況,整出嚟嘅效果可以好似倒模咁似。
當網絡撞正呢個中微子訊號,佢由ΛCDM訓練得返嚟嗰啲加咗重權嘅「先入為主」知識就會出錯,會誤以為眼前只係標準模型嘅參數有啲普通調整,於是就會計出一個錯晒嘅結論 。有分析仲話,AI會將標準模型嘅參數關聯,編碼成深層嘅網絡偏見,「到你想訓練佢去搵啲新嘢嗰陣,呢啲偏見就會變成致命傷」。
唔係所有轉移學習技術都咁易中招。研究團隊有系統咁測試咗幾種唔同嘅神經網絡架構,發現如果就咁簡單做微調,冇用到上面提過嗰種「假狗/樽頸網絡」設計,出現負轉移嘅機會會高好多。
樽頸結構嘅關鍵作用,就係提供一個必要嘅緩衝地帶,一方面畀網絡可以重用由ΛCDM學返嚟嘅勁抽特徵提取器,另一方面又預留咗專用嘅新容量,用嚟模擬真正陌生嘅物理現象,咁先至可以攞到穩健同靠得住嘅結果 。