国产推理大模型决战2025考研数学，看看谁第一个上岸？-喜好网-记录每日喜好的科技时尚娱乐生活

国产推理大模型决战2025考研数学，看看谁第一个上岸？

7个月前科技 37观看

摘要图片来源：由无界AI生成随着上个月 2025 研究生考试的结束，最新的考研数学真题成为大语言模型尤其是推理模型的「试炼场」，将考验它们的深度思考能力。业内曾有着这样一种共识：大语言模型在文字水平上的表现令人印象深刻，但

图片来源：由无界AI生成

随着上个月 2025 研究生考试的结束，最新的考研数学真题成为大语言模型尤其是推理模型的「试炼场」，将考验它们的深度思考能力。

业内曾有着这样一种共识：大语言模型在文字水平上的表现令人印象深刻，但说到数学就不甚令人满意了。去年一度火出圈的「9.9 与 9.11」比大小的问题，包括 GPT-4o 在内的很多大模型都翻车了，直到深度推理模型出现后才从根本上改善了这一状况。

OpenAI 发布的 o1 模型在涉及复杂和专业的数理问题方面表现让人印象深刻，大模型在经过一定时间仔细思忖后，回答问题的能力和准确度大幅提升，这种被称为推理侧 Scaling Law 的现象已经成为继续推动大模型能力提升的关键力量。在黄仁勋最新 CES 2025 的演讲中，他也把测试时（即推理）Scaling 形容为大模型发展的三条曲线之一。

可以看到，继 o1 之后，国内大模型厂商也陆续推出了自己的深度推理模型，并在某些任务上有亮眼的表现。数了一下时间轴大概是这样的：

2024 年 11 月 21 日，深度求索团队发布 DeepSeek-r1 模型；
2024 年 11 月 28 日，阿里通义团队发布 QwQ 模型；
2024 年 12 月 16 日，月之暗面团队发布 Kimi-k1 模型；
2024 年 12 月 31 日，智谱 GLM 团队发布 GLM-Zero 模型；
2025 年 1 月 6 日，昆仑万维发布 Skywork-o1 模型。

大家也许会好奇，这些深度推理模型的能力（尤其是数学推理能力）到底有多强，又是谁能拔得头筹呢？这时就需要一场公平的标准化考试了。

清华 SuperBench 大模型测评团队（以下简称测评团队）为了全面评估这些模型在数学推理方面的能力，结合 2025 年考研数学（一、二、三）的试题，专门对以上各家深度推理模型进行了严格的评测。同时，为了确保评测的全面性，参与评测的还包括各家的旗舰基础模型。

此次选择的 13 个模型具体如下：

从结果来看，所有模型中以平均分计，第一名是 OpenAI 的 GPT-o1模型，这也是没什么意外的。第二名则是来自智谱的 GLM-Zero-Preview，它以三门数学平均 138.70 的成绩仅次于 o1，成为国产大模型第一，且距第一名不到 3 分。第三名则是来自通义的 QwQ。

测试方法

在本次评测过程中，测评团队发现并非所有模型均提供 API 支持，且部分提供 API 服务的模型在输出内容长度超出一定限制时，会出现内容截断的情况。为确保评测工作的公正性与准确性，测评团队决定统一采用各模型厂商的网页端进行测试操作。

在测试过程中，每道题目均在独立的对话窗口中进行，以此消除上下文信息对测试结果可能产生的干扰。

鉴于部分模型输出存在一定不稳定性，为降低由此引发的分数波动，测评团队设定当同一模型在三次测试中有两次及以上回答正确时，方将其记录为正确答案。

结果分析

接下来从测试总分、单张试卷分数、深度思考模型 vs 基础模型三个方面来详细分析此次测评的结果。

总分

对于总分数，测评团队对三张试卷的分数进行求和并计算平均值，按照分数高低进行排序。结果如下图所示：

从图中可以看到，GPT-o1 仍然处于领先的地位，是唯一一个达到 140 分以上的模型，相较于排名末位的 GPT-4，分数优势高达 70 分。

位于第二梯队（130 分以上）的模型有 GLM-zero-preview 和 QwQ，分别斩获 138.7 分和 137.0 分。

DeepSeek-r1-lite、Kimi-k1、Tiangong-o1-preview、DeepSeek-v3 则处于第三梯队（120 分以上）。

可以看出，深度思考模型普遍能够达到 120 + 的水平。这也彰显了深度思考模型在解决数学问题方面的强大能力。

值得注意的是，曾于 2023 年位居榜首的基础模型 GPT-4，在本次测试中仅获 70.7 分，位列末席。这一结果表明，在过去一年（2024 年）中，语言模型在数学推理领域的进步显著。

而另一方面，在缺乏深度思考能力辅助的情况下，仅凭逻辑推理能力，DeepSeek-v3 作为基础模型，已经能够跻身第三梯队，这说明基础模型和深度思考模型之间的能力并非界限分明。

单张试卷分析

为了更清晰地展现大模型在各张试卷答题能力方面的表现，测评团队对每张试卷的错题分布情况进行了深入分析。

在数学一的评测过程中，GPT-o1、GLM-zero-preview、QwQ、DeepSeek-r1-lite 四款模型的得分相同。通过进一步剖析错题情况，测评团队发现所有模型均在第 20 题（12 分，涉及曲面积分求解）以及第 21 题第二问（6 分，涉及特征向量求解）上出现了错误。

在数学二的评测中，各模型的分数分布较为分散。经统计分析发现，第 3 题、第 5 题、第 7 题成为所有模型犯错的集中区域。具体错题分布情况如下图所示：

针对数学三的评测结果显示，模型出错的重灾区主要集中在第 14 题、第 15 题、第 16 题、第 19 题。相关错题分布情况如下图所示：

综合上述各试卷错题的具体分析，我们可以清晰地看到，GPT-o1（阴影列所示）在总计 66 道题目中，仅答错 3.5 道题；并且 GPT-o1 答错的题目，其他模型亦普遍存在错误，这显示了 GPT-o1 目前依然是深度推理模型的天花板。

基础模型 vs 深度思考模型

最后，为了全面深入地探究各模型厂商在深度思考能力优化方面所取得的成果，测评团队对相应基础模型与深度思考模型进行了细致对比分析。

需要说明的是，此处对比并非意味着各深度思考模型是基于对应基础模型所做优化，其主要目的在于直观呈现各厂商在模型综合能力提升方面的进展与成效。

苹果打算明年带来AirTag 2，或与M4

在202

11-19 130阅读

消息称抖音正推进“V”项目，包括

11 月

11-19 113阅读

Redmi史上强旗舰！K80系列开启预约

11月19日

11-19 115阅读

华为放出预热视频：暗示Mate 70系

11月19日

11-19 129阅读

又一百亿独角兽申请破产了

近日，

11-19 147阅读

被审判的麦琳和妖魔化的小

作者 / 张特编辑 / 朱婷运

11-19 107阅读

一夜新娘袁昊年龄, 袁昊扮

网剧《一夜新娘》热播，男主袁昊圈

11-19 107阅读

《山河之影》是耽改吗？谢铿

电视剧《山河之影》是你根据同名

11-19 112阅读

张云龙秀恩爱庞博秀学历，《

　　年末最热血的一档综艺终于在爱奇

11-19 126阅读

中国第一网红李子柒：不希望

11月19日消息，近

11-19 133阅读

木内ラムネ作品《月のお気

木内ラム

11-19 126阅读

帝国时代4秘籍大全2024_帝

帝国时代4是帝国时代4系列游戏的最新版

11-19 173阅读

原神沙脂蛹怎么获得?原神

沙脂蛹是原神游戏中须弥地区的特产之一

11-19 127阅读

原子之心展览馆四个学生所

在原子之心游戏的展览馆中，有一个寻找四

11-19 122阅读

饥荒萤火虫怎么捕捉?饥荒

在饥荒游戏里面，我们可以通过捕捉萤火虫

11-19 110阅读