模型评测
LLM、VLM、AIGC、RAG 任务,具备样本 review、Judge 契约、语义版本与可携带产物。
开源 AI 评测基础设施
一条可追溯的证据路径,覆盖 LLM、VLM、Agent、评测集、压测与每个决策背后的产物。
export DASHSCOPE_API_KEY='…'
evalscope eval \
--model qwen-plus \
--api-key "$DASHSCOPE_API_KEY" \
--datasets gsm8k \
--limit 5
一个系统,三种测量视角
LLM、VLM、AIGC、RAG 任务,具备样本 review、Judge 契约、语义版本与可携带产物。
跨原生 Agent 评测和外部 Harness 工作流,测量请求、工具、token 与最终结果。
将并发、延迟、RPS、TTFT 与吞吐转化为可复现的服务决策。
证据,而非单一分数
输入、预测、review、报告、配置和版本化 metadata 彼此关联,结果可被审查,而不只是重复运行。
AGENT 与 HARNESS
将模型请求、工具调用、Token 用量和提交结果保留在同一份可审查的任务记录中。

性能压测
在同一份运行记录中比较并发、延迟、TTFT、吞吐与成功率,并让图表始终与配置关联。

BENCHMARK 目录
在运行前查看任务类型、模态、指标与评测版本;目录始终关联自动生成的文档与可运行 metadata。
证据视图




开始使用
通过 AI 编程助手或终端启动一次小型 API 评测;两条路径都会保留同一套证据。
需要 API 端点配置、任务提示词或排错说明?请继续阅读完整指南。
让 AI 帮你用
Use the EvalScope project skill to evaluate qwen-plus on five GSM8K samples. Ask me for the model or endpoint configuration you need before running it, then report the results and where the outputs were saved.
命令行
安装服务工具提供 CLI 与本地 Dashboard。
运行五条样本通过环境变量中的 API key 调用远端模型。
检查产物从 ./outputs 打开报告、预测与配置。
pip install 'evalscope[service]'
export DASHSCOPE_API_KEY='…'
evalscope eval \
--model qwen-plus \
--api-key "$DASHSCOPE_API_KEY" \
--datasets gsm8k \
--limit 5
evalscope service --outputs ./outputs