因此,一次评测通常会形成更长的闭环:
TRACES这个缩写对应六个用于验证调查过程的维度,也被称为HDS6:
Apodex Discovery认为,要评估开放式发现任务,至少需要几项基础设施:定义清晰的问题、贴近现实的环境、可执行的验证机制,以及允许系统修复自身工作的反馈循环。TRACES正是这一方法的基准测试实现。
现有材料列举的任务示例包括:
如今,AI系统越来越多地被用于,或被设想用于提出研究假设、选择实验方向、分析实验结果,以及协助设计迭代式工作流。在这些场景中,语言流畅远远不够。系统还必须知道该测试什么、如何理解结果、怎样从错误中恢复,以及何时应该停止扩大结论。
TRACES的核心做法,是把科学调查视为一个交互过程。一个能够通过可追踪证据和恰当修正取得有用结果的系统,与另一个只是给出相似结论、却无法说明推理路径的系统,实际可靠性并不相同。
不过,过程评测并不会取代人类监督。研究人员和领域专家仍需要设定目标与约束,评估伦理和实际风险,核验假设与证据,并决定某个结论是否足以支持现实行动。TRACES强调可检查的调查轨迹和有边界的表述,价值恰恰在于让评审者能够审视更多内容,而不是只能面对一条无法审计的最终断言。
TRACES把AI基准测试的问题,从“系统是否给出了预期答案”,转向“系统是否完成了一次有纪律、以证据为基础的调查”。对于科学发现而言,这比静态的标准答案测试更贴近真实工作方式。
但它也揭示了一个重要边界:过程评分可以改善评测,却不能单独证明某项AI生成的发现安全、有用,或已经适合部署。人类的科学判断仍是决定结论能否走出实验环境、进入现实世界的关键环节。