语义版本化
Benchmark metadata 发布评测版本,使 prompt、映射、数据或评分变化可见。
模型评测
通过 benchmark metadata、样本 review、评分契约和保留上下文的报告,评测 LLM、VLM、AIGC 与 RAG 工作负载。

广泛模型覆盖
模型 · 任务 · 数据集 · 指标
选定的数据集与版本定义了本次运行能够度量的范围。
透明 · 可复现 · 可扩展
Benchmark metadata 发布评测版本,使 prompt、映射、数据或评分变化可见。
结构化 Judge 输出在无效时 fail closed;格式错误的回复不会悄悄转成分数。
预测、review、报告和配置一同保留,支持本地审查和 Dashboard 下钻。