10 大评测维度
每个模型都用同一套维度打分,确保横向可比、纵向可追踪。
🇨🇳 中文理解C-Eval + 自研难句集
💻 代码能力HumanEval + MBPP + 业务集
🧮 推理能力GSM8K + MATH + 逻辑陷阱
📚 长上下文NiAH 200K + 长文摘要
🛠️ 工具调用Function Calling 准确性
👁 多模态图像 / OCR / PDF / 图表
🧠 推理透明thinking 模式可观察性
⚡ 响应速度TTFT + TPS + 衰减曲线
💰 性价比¥/任务 + 缓存折扣
🔒 安全对齐越狱抵抗 + 偏见检测
5 大公开 Benchmark
每个 Benchmark 我们都说明它测什么、不测什么、为什么选它。
📊 MMLU / MMLU-Pro
综合知识57 个学科的多任务语言理解。MMLU-Pro 加入更难的推理题,更能区分头部模型。
💻 HumanEval
代码生成164 道 Python 编程题。pass@1 是行业最常引用的代码能力指标。
🧮 GSM8K
数学推理8.5K 道小学数学应用题。对推理链路完整性要求高,是检测「会不会思考」的金标准。
🇨🇳 C-Eval
中文综合52 个学科的中文测评,覆盖基础理科 / 工程 / 人文社会 / 中国特色议题。海外模型的中文能力试金石。
📚 NiAH 200K
长上下文召回大海捞针测试。在 200K tokens 文本任意位置插入「针」,测模型能否准确找到。
5 步标准测试流程
- 01数据准备:题库严格保密 + 加随机 token 防训练集污染
- 02参数对齐:所有模型同温度 (temp=0.0) 同系统提示同调用参数
- 03三轮采样:每题独立调 3 次取均值 + 标准差,排除偶然偏差
- 04双盲评分:主观题 2 名标注员独立打分,分歧由第三人仲裁,kappa ≥ 0.8
- 05发布数据:完整原始数据公开,含失败案例、错误率、置信区间
实验室成员
5 名全职评测工程师 + 2 名客座学术顾问,背景覆盖 NLP、推荐系统、金融风控、计算语言学。
CT
陈博士
实验室负责人 · 前 BAT NLP 算法专家 · 计算语言学博士
LZ
李工
评测系统架构师 · 大规模分布式压测 · 8 年 ML 基础设施
WJ
王老师
中文语料专家 · 前社科院语言所 · C-Eval 共建者
ZS
张研究员
多模态方向 · 视觉 / OCR / 图表理解评测
我们做 / 不做
✅ 我们做的事
- 独立采购全部模型 API 用于评测
- 真实测试,公开原始数据
- 对每家模型同等严苛、同等公平
- 发布失败案例和负面评价
- 季度回顾自身评测的偏差
⚠️ 我们不做的事
- 不接受厂商付费评测 / 公关稿
- 不签独家、不签排他
- 不修改分数迎合厂商
- 不掩饰任一模型的缺陷
- 不参与任何模型的训练数据合作
评测是一种态度。如果分数会因为商业关系变化,那它就不是分数,是广告。我们做的是分数。
— 典名词元 AI 实验室