全球模型,一站接入 咨询热线:18996197307

实测 Claude / GPT-5 / DeepSeek:MMLU + HumanEval + GSM8K 三大基准对比

典名科技 AI 实验室对 Claude Sonnet 4.7 / GPT-5 / DeepSeek V3.2 在 MMLU / HumanEval / GSM8K 三大基准的实测分析

44 阅读

📌 TLDR

  • 测试日期:2026-05-09
  • 测试集:MMLU + HumanEval + GSM8K(各 100 题)
  • 综合结论:GPT-5 微胜(代码 + 数学),Claude 在 MMLU 微胜,DeepSeek 性价比最高

5 分钟接入全网大模型

充值享优惠 · 无信用卡 · 即注即用