模型评测

把模型输出转化为可辩护的证据。

通过 benchmark metadata、样本 review、评分契约和保留上下文的报告,评测 LLM、VLM、AIGC 与 RAG 工作负载。

LLMVLMAIGCRAGOpenAI-compatible API
抽象的评测证据路径

广泛模型覆盖

一个接口覆盖每个评测层。

模型 · 任务 · 数据集 · 指标

LLM语言模型与自定义 benchmark
VLM视觉语言与多模态任务
AIGC文生图与图像编辑
RAG检索与生成质量

从一条数据到可分享的报告。

01Dataset

选定的数据集与版本定义了本次运行能够度量的范围。

经得起审查的评测。

透明 · 可复现 · 可扩展

当前可用

语义版本化

Benchmark metadata 发布评测版本,使 prompt、映射、数据或评分变化可见。

当前可用

Judge 契约

结构化 Judge 输出在无效时 fail closed;格式错误的回复不会悄悄转成分数。

当前可用

可携带产物

预测、review、报告和配置一同保留,支持本地审查和 Dashboard 下钻。