為了讓神經網路在第二階段有餘裕去吸收那些聞所未聞的新物理,團隊巧妙地在網路架構中增設了一組「虛擬瓶頸節點」。這些額外的參數在預訓練時就像是保留的空位,等到進入微調階段,才會被填入那些異於標準模型的物理特徵 。
成果十分顯著。在一些較為順利的案例中,這種遷移學習方法直接將所需的新物理(非ΛCDM)模擬數量砍掉超過一個數量級,卻仍能支撐穩健的物理推論 。
這項技術等於是把過去全球科學界投注在標準模型模擬上的心血,轉化成一個可以重複使用的公共資源,一舉繞過像「暗能量光譜儀」(DESI)這類旗艦級計畫的最大運算障礙,為未來的發現鋪路 。
然而這項研究最令人警醒的洞見,在於它精確掌握了這套技術的失效模式。當一個外來的新物理效應,其顯現出的「長相」與AI在ΛCDM模型中學過的東西太過神似時,AI的預備知識反而會變成一種可怕的負債。這種崩潰現象被稱為 「負遷移」:意思是微調不但沒讓模型變強,反而使它的表現更差 。
究其根源,問題出在一種物理學上常見的 「簡併性」 上。舉一個最經典的例子:有質量微中子會在宇宙小尺度上抑制物質的群聚,但這種抑制的訊號,恰恰好與標準ΛCDM模型裡「調低物質擾動幅度參數(σ₈)」所產生的效應極為相似。當神經網路在微調時接收到這個微中子的訊號,它腦中那些經由ΛCDM預訓練而深深烙印下來的加權偏見,就會讓它直接把「微中子質量」錯讀成一種標準模型內簡單的參數微調,最終得出南轅北轍的結論 。正如一份報告所解析的,AI在此過程中將標準模型的參數聯結編碼為深層的網路偏見,而「一旦訓練的目標是為了偵測某種新東西,這些偏見就會成為一種負債」。
值得慶幸的是,並非所有的遷移學習方法都同樣脆弱。研究人員系統性地測試了不同架構,發現如果不搭配那個刻意留下的「虛擬瓶頸」設計,只是進行單純的微調,那麼模型簡直就是「負遷移」的超級磁鐵。
「瓶頸節點」的存在,為這套方法提供了一道關鍵的中間地帶:它讓神經網路一方面依舊可以重用來自標準模型訓練的強大特徵萃取能力,另一方面又保有一個專屬的新容量,讓模型能夠去學習並建模那些真正陌生的、無法被舊框架同化的新物理訊號——在尋找宇宙真理的路上,這正是確保AI不被自身知識反噬的核心關鍵 。