全球模型,一站接入 咨询热线:18996197307

典名词元 AI 实验室

独立 · 中立 · 透明
的模型评测方法论

为什么你看到的 Benchmark 数据可以信?因为我们不接厂商付费、不修分数、不藏失败案例。每一项指标都可复现,每一个测试集都对外公示。

10 大评测维度

每个模型都用同一套维度打分,确保横向可比、纵向可追踪。

🇨🇳 中文理解C-Eval + 自研难句集
💻 代码能力HumanEval + MBPP + 业务集
🧮 推理能力GSM8K + MATH + 逻辑陷阱
📚 长上下文NiAH 200K + 长文摘要
🛠️ 工具调用Function Calling 准确性
👁 多模态图像 / OCR / PDF / 图表
🧠 推理透明thinking 模式可观察性
⚡ 响应速度TTFT + TPS + 衰减曲线
💰 性价比¥/任务 + 缓存折扣
🔒 安全对齐越狱抵抗 + 偏见检测

5 大公开 Benchmark

每个 Benchmark 我们都说明它测什么、不测什么、为什么选它。

📊 MMLU / MMLU-Pro

综合知识

57 个学科的多任务语言理解。MMLU-Pro 加入更难的推理题,更能区分头部模型。

💻 HumanEval

代码生成

164 道 Python 编程题。pass@1 是行业最常引用的代码能力指标。

🧮 GSM8K

数学推理

8.5K 道小学数学应用题。对推理链路完整性要求高,是检测「会不会思考」的金标准。

🇨🇳 C-Eval

中文综合

52 个学科的中文测评,覆盖基础理科 / 工程 / 人文社会 / 中国特色议题。海外模型的中文能力试金石。

📚 NiAH 200K

长上下文召回

大海捞针测试。在 200K tokens 文本任意位置插入「针」,测模型能否准确找到。

5 步标准测试流程

  1. 01数据准备:题库严格保密 + 加随机 token 防训练集污染
  2. 02参数对齐:所有模型同温度 (temp=0.0) 同系统提示同调用参数
  3. 03三轮采样:每题独立调 3 次取均值 + 标准差,排除偶然偏差
  4. 04双盲评分:主观题 2 名标注员独立打分,分歧由第三人仲裁,kappa ≥ 0.8
  5. 05发布数据:完整原始数据公开,含失败案例、错误率、置信区间

实验室成员

5 名全职评测工程师 + 2 名客座学术顾问,背景覆盖 NLP、推荐系统、金融风控、计算语言学。

CT

陈博士

实验室负责人 · 前 BAT NLP 算法专家 · 计算语言学博士

LZ

李工

评测系统架构师 · 大规模分布式压测 · 8 年 ML 基础设施

WJ

王老师

中文语料专家 · 前社科院语言所 · C-Eval 共建者

ZS

张研究员

多模态方向 · 视觉 / OCR / 图表理解评测

我们做 / 不做

✅ 我们做的事

  • 独立采购全部模型 API 用于评测
  • 真实测试,公开原始数据
  • 对每家模型同等严苛、同等公平
  • 发布失败案例和负面评价
  • 季度回顾自身评测的偏差

⚠️ 我们不做的事

  • 不接受厂商付费评测 / 公关稿
  • 不签独家、不签排他
  • 不修改分数迎合厂商
  • 不掩饰任一模型的缺陷
  • 不参与任何模型的训练数据合作

评测是一种态度。如果分数会因为商业关系变化,那它就不是分数,是广告。我们做的是分数。

— 典名词元 AI 实验室

看到我们的工作?欢迎使用

基于独立评测的诚实推荐,帮你选对模型省下真金白银