开源 AI 评测基础设施

评测每个 AI 系统,证据全程可查。

一条可追溯的证据路径,覆盖 LLM、VLM、Agent、评测集、压测与每个决策背后的产物。

run-evaluation.sh
export DASHSCOPE_API_KEY='…'
evalscope eval \
  --model qwen-plus \
  --api-key "$DASHSCOPE_API_KEY" \
  --datasets gsm8k \
  --limit 5
Real EvalScope qwen-plus GSM8K results

一个系统,三种测量视角

让每一次 AI 发布都有据可查。

01

模型评测

LLM、VLM、AIGC、RAG 任务,具备样本 review、Judge 契约、语义版本与可携带产物。

02

Agent 与 Harness

跨原生 Agent 评测和外部 Harness 工作流,测量请求、工具、token 与最终结果。

03

性能压测

将并发、延迟、RPS、TTFT 与吞吐转化为可复现的服务决策。

证据,而非单一分数

从输入到决策,一条可复现的路径。

输入、预测、review、报告、配置和版本化 metadata 彼此关联,结果可被审查,而不只是重复运行。

EvalScope 从输入到原生评测、Agent 和性能工作流,再到可审查产物的架构。
1

输入与配置

TaskConfig
API 模型
本地模型
评测集
自定义数据
2

原生评测

注册表
数据适配器
模型
评测器
预测
审查 / 裁判
指标与聚合
3

可审查产物

日志
配置
预测
审查
报告
仪表盘

Agent 与 Harness

Agent 循环
工具与环境
轨迹与结果
审查 / 裁判

服务性能

工作负载
服务端点
压测执行器
TTFT · RPS · 吞吐

图 01EvalScope 架构

AGENT 与 HARNESS

追踪 Agent 答案背后的执行过程。

将模型请求、工具调用、Token 用量和提交结果保留在同一份可审查的任务记录中。

任务上下文工具证据最终结果
Light Agent Trace with model requests and tool calls

性能压测

用证据而非单个数字做容量决策。

在同一份运行记录中比较并发、延迟、TTFT、吞吐与成功率,并让图表始终与配置关联。

Light performance charts and run comparison

BENCHMARK 目录

找到真正匹配问题的评测集。

在运行前查看任务类型、模态、指标与评测版本;目录始终关联自动生成的文档与可运行 metadata。

250+个评测集已收录
LLMVLMAgentAIGC

证据视图

从指标追溯到完整证据。

Light Dashboard overview
Light evaluation overview
Light performance overview
Light Agent Trace overview

开始使用

让 AI 帮你用,或一条命令开始。

通过 AI 编程助手或终端启动一次小型 API 评测;两条路径都会保留同一套证据。

需要 API 端点配置、任务提示词或排错说明?请继续阅读完整指南。

让 AI 帮你用

交给 AI 的评测说明

Use the EvalScope project skill to evaluate qwen-plus on five GSM8K samples. Ask me for the model or endpoint configuration you need before running it, then report the results and where the outputs were saved.

命令行

01

安装服务工具提供 CLI 与本地 Dashboard。

02

运行五条样本通过环境变量中的 API key 调用远端模型。

03

检查产物从 ./outputs 打开报告、预测与配置。

quickstart.sh
pip install 'evalscope[service]'
export DASHSCOPE_API_KEY='…'
evalscope eval \
  --model qwen-plus \
  --api-key "$DASHSCOPE_API_KEY" \
  --datasets gsm8k \
  --limit 5
evalscope service --outputs ./outputs