TRACES 係 Apodex 用嚟評估開放式科學探索嘅基準,唔係單純將 AI 答案同固定答案鍵比較,而係觀察佢點樣展開調查、使用工具、吸收回饋同支持結論。[1][6] 基準會評估六種能力:Tools(工具)、Repair(修正)、Alternatives(替代假設)、Coherence(推理一致性)、Evidence(證據)同 Scope(結論範圍)。即使問題未有確定答案,都可以檢視研究過程是否可靠。[2][3] 團隊可以提交完整 solver 系統,或者提出能夠轉化成可執行、可驗證環境嘅科學問題。[1][14]
研究答案

Create a landscape editorial hero image for this Studio Global article: What is Apodex’s TRACES benchmark, launched to evaluate “discoverative AI,” how does it move beyond traditional answer-key benchmarks by pla. Article summary: TRACES is Apodex’s “reality benchmark” for evaluating discoverative AI: systems intended to investigate open scientific problems and reach potentially unknown conclusions, rather than retrieve a predefined answer. It eva. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
傳統 AI 基準通常問系統一條問題,再將答案同已知標準答案比較。Apodex 嘅 TRACES 就換咗個玩法:佢將一套完整嘅 AI「重型解題器」放入有狀態、可以執行嘅環境,觀察系統點樣調查一個未必已有定論嘅科學問題。過程中,AI 可以使用工具、接收回饋、修正失敗嘅方法,逐步推進到一個可以驗證嘅結論。
呢個分別相當關鍵,因為一個聽落合理嘅最終答案,可能只係撞彩、證據不足,甚至其他人無法重現。TRACES 想評估嘅,唔只係結果本身,仲包括得出結果之前嗰段調查過程。
TRACES 屬於 Apodex Discovery 框架。Apodex 將佢哋所講嘅「探索式 AI」(discoverative AI)理解為:唔係純粹搜尋、重述已知資料,而係嘗試推導可能未有人確立嘅新結論。為咗令呢類開放式探索可以接受測試,TRACES 使用可執行環境、episodes、任務,以及評審睇唔到嘅驗證器。
評估對象亦唔係一個基礎模型咁簡單,而係一套完整 solver,包括模型本身、負責協調流程嘅 harness、外部工具、記憶系統,以及控制 AI 行動嘅政策。
一般基準會預先定好問題、輸入資料,同埋預期答案;TRACES 就由一個現實世界目標出發,再要求 solver 將目標轉化成可以處理嘅調查。系統要喺環境入面觀察情況、採取行動、呼叫科學或計算工具,並根據類似實驗或驗證器嘅回饋調整方向。
簡單講,評估流程大概係:
所以,TRACES 記錄嘅係成條調查軌跡,而唔係淨係睇最後一段文字似唔似參考答案。當研究問題根本未有一個公認正確答案時,呢種設計尤其重要。
TRACES 個名稱對應六個用嚟驗證研究過程嘅面向,有時亦稱為 HDS6:
六個面向加埋,目標係分辨一個有根有據、可靠嘅調查,與一個講得好有信心但其實無證據支持嘅估答案。即使最終答案尚未確定,評審仍然可以檢視 solver 嘅研究方法是否合理。
Apodex Discovery 認為,要評估開放式科學探索,至少需要幾樣基礎設施:清晰嘅問題、貼近現實嘅環境、驗證機制,以及容許系統修正工作的循環。TRACES 就係將呢套方法落實成基準測試。
Apodex 表示,佢哋喺問題搜羅階段調查咗 16 個行業領域入面嘅 561 個行業,整理出 423 個高價值現實問題,再喺首輪發布揀選 20 個問題 做可執行評估。
現有資料列出嘅例子包括:
呢啲例子反映出基準希望涵蓋唔同科學同工程範疇,但目前提供嘅資料未有列出首輪發布所有任務或完整領域清單,因此唔宜將上述例子當成完整目錄。
現時 AI 系統愈來愈多被用於,或者被設想用於,提出研究假設、選擇研究方向、分析實驗結果,以及協助設計反覆測試嘅工作流程。喺呢類任務入面,識講一大堆流暢文字並唔夠。系統要知道應該測試乜、點樣解讀結果、犯錯後點樣回復,同埋避免將證據未支持嘅內容講到斬釘截鐵。
TRACES 將科學研究視為一個互動過程,正正係想填補呢個空位。一個透過可追蹤證據同適當修正而得到有用結果嘅 solver,與一個冇可靠推理路徑、只係偶然講中相同結論嘅系統,兩者嘅可信程度並唔一樣。
不過,呢套方法唔代表可以取代人類監督。研究人員同專家仍然要訂立目標及限制、評估倫理同實際風險、核實假設及證據,並判斷一個結論係咪足以支持現實世界嘅行動。TRACES 強調可檢查嘅調查軌跡同有界限嘅結論,價值正正在於令評審有更多材料可以審視,而唔係只收到一個無從稽核嘅最終聲稱。
Apodex 公開公告表示,TRACES 同時接受 solver 系統 及 科學問題 嘅公開提交。
如果提交 solver,對象應該係用嚟完成調查嘅完整系統,而唔係淨係一個底層模型,當中包括模型、協調或 harness 層、工具、記憶系統,以及控制調查流程嘅政策。
至於問題提案,就需要可以轉化成一個可執行、可驗證嘅環境。實際上,提案要清楚交代 solver 可以觀察同執行乜嘢、會收到邊類回饋,以及點樣根據明確成功準則檢查中途或最終聲稱。
TRACES 將基準問題由「AI 有冇答中預期答案?」改成「AI 有冇進行一個有紀律、以證據為本嘅調查?」對科學探索而言,呢個方向比靜態答案鍵測試更貼近真實工作;但同時亦要留意,過程分數可以改善評估,卻唔能夠單靠自己證明 AI 發現係安全、有用,或者已經適合部署。最終,科學判斷同人類監督仍然不可或缺。
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
TRACES 係 Apodex 用嚟評估開放式科學探索嘅基準,唔係單純將 AI 答案同固定答案鍵比較,而係觀察佢點樣展開調查、使用工具、吸收回饋同支持結論。[1][6]
TRACES 係 Apodex 用嚟評估開放式科學探索嘅基準,唔係單純將 AI 答案同固定答案鍵比較,而係觀察佢點樣展開調查、使用工具、吸收回饋同支持結論。[1][6] 基準會評估六種能力:Tools(工具)、Repair(修正)、Alternatives(替代假設)、Coherence(推理一致性)、Evidence(證據)同 Scope(結論範圍)。即使問題未有確定答案,都可以檢視研究過程是否可靠。[2][3]
團隊可以提交完整 solver 系統,或者提出能夠轉化成可執行、可驗證環境嘅科學問題。[1][14]