01
结果证据
输入与结果
将任务、最终响应与完成状态保留在一起,让结果可以在上下文中审查。
AGENT 与 HARNESS
记录 Agent 任务中的模型请求、工具调用、token 用量和最终结果,并支持外部回放场景。

测量 · 追踪 · 改进
每一步都有证据
任务与上下文
qwen-plus
python_exec
返回执行证据
模型继续
最终答案:18

多维证据
将任务、最终响应与完成状态保留在一起,让结果可以在上下文中审查。
记录工具输入、输出与失败状态,而不是把多步运行压缩成一个分数。
审查重试、干预信号和步骤数,了解 Agent 如何得到答案。
在为真实工作负载选择 Agent 设计时,将运行信号与正确性一起考量。
使用 EvalScope 原生循环评测,支持可配置工具、环境和步骤限制。
桥接外部 Harness,保留场景溯源、轨迹产物与有效性状态。
AGENT BENCHMARK 与漂移
Benchmark 任务今天即可让 Agent 行为具备可比性。冻结产物、审计 Judge、检查保留任务属于探索中的研究协议,而非已交付的漂移防护承诺。
将任务、环境、请求与原始产物一同保留。
区分评分契约变化与行为变化。
在声称 Harness 改进前使用保留证据。