AGENT 与 HARNESS

度量完整循环,而非只看最终答案。

记录 Agent 任务中的模型请求、工具调用、token 用量和最终结果,并支持外部回放场景。

Native agent evaluationExternal scenariosFunction calling
抽象的 Agent 轨迹闭环

测量 · 追踪 · 改进

可度量的 Agent 循环。

每一步都有证据

1

提示词

任务与上下文

2

Model

qwen-plus

3

Tool call

python_exec

4

Tool result

返回执行证据

5

Nudge

模型继续

6

Submit

最终答案:18

已有 EvalScope Agent 轨迹:Python 工具调用与提交答案
已有本地 Agent 运行 · Python 工具轨迹、提交答案与可核验结果

Agent 评测的关键度量。

多维证据

01
结果证据

输入与结果

将任务、最终响应与完成状态保留在一起,让结果可以在上下文中审查。

02
工具证据

调用与返回

记录工具输入、输出与失败状态,而不是把多步运行压缩成一个分数。

03
轨迹健康度

步骤与恢复

审查重试、干预信号和步骤数,了解 Agent 如何得到答案。

04
运行画像

Token、时延与成本

在为真实工作负载选择 Agent 设计时,将运行信号与正确性一起考量。

当前可用

原生 AgentLoop

使用 EvalScope 原生循环评测,支持可配置工具、环境和步骤限制。

function_callingreacttool use
当前可用

外部 Agent Bridge

桥接外部 Harness,保留场景溯源、轨迹产物与有效性状态。

AgentXAIPerfreplay

AGENT BENCHMARK 与漂移

让演进中的 Harness 始终锚定证据。

Benchmark 任务今天即可让 Agent 行为具备可比性。冻结产物、审计 Judge、检查保留任务属于探索中的研究协议,而非已交付的漂移防护承诺。

SWE-benchGAIAAgentBench探索中
01

冻结运行

将任务、环境、请求与原始产物一同保留。

02

审计 Judge

区分评分契约变化与行为变化。

03

检查选择

在声称 Harness 改进前使用保留证据。

让研究边界始终清晰。

查看研究协议