這形成一個更長的評估循環:
TRACES 這個名稱對應六個用於驗證調查過程的面向,有時也稱為 HDS6:
Apodex Discovery 認為,若要評估開放式發現工作,至少需要幾項基礎設施:定義良好的問題、與現實相連的環境、可驗證的機制,以及允許系統修正工作的循環。TRACES 就是這套方法的 benchmark 實作。
目前公開資料列出的例子涵蓋:
AI 系統正逐漸被用於,或被提出用於,產生研究假設、選擇研究方向、分析實驗結果,以及協助設計反覆試驗流程。在這些情境中,語言流暢並不夠。系統還必須知道下一步要測試什麼、正確解讀結果、從錯誤中恢復,並避免提出超出證據支持範圍的結論。
TRACES 的做法,是把科學調查視為一個互動過程。一個透過可追溯證據與適當修正取得有用結果的 solver,和另一個在沒有可靠推理路徑下碰巧得出相似結論的系統,兩者並不相同。
但這種方法並不代表可以取消人工監督。研究人員與領域專家仍須設定目標和限制、評估倫理與實務風險、驗證假設與證據,並判斷某個結論是否足以支持現實世界的行動。TRACES 強調可檢查的調查軌跡與有界限的主張,正是因為這能讓審查者檢視的不只是一句孤立、難以稽核的最終斷言。
TRACES 將 benchmark 的問題,從「AI 是否給出預期答案?」改成「AI 是否完成了一次有紀律、以證據為基礎的調查?」這讓它比靜態答案測試更貼近科學發現的實際工作方式。
不過,過程分數也不能單獨證明 AI 產生的發現安全、有用,或已經準備好部署。它能改善評估方式,卻不能取代人類的科學判斷。對高風險研究而言,如何解讀證據、衡量限制,並決定是否採取現實行動,仍然需要由人負責。