OpenAI 的 o3 AI 模型基准测试得分低于公司最初声称的水平

3个月前 科技 17观看
摘要 OpenAI 的 o3 AI 模型在一次基准测试中的得分低于公司最初所宣称的水平OpenAI 与第三方对于 o3 模型的基准测试结果存在差异,这引发了外界对于公司在透明度及模型测试流程上的质疑。当 OpenAI

OpenAI 的 o3 AI 模型在一次基准测试中的得分低于公司最初所宣称的水平Ti5喜好网-记录每日喜好的科技时尚娱乐生活

OpenAI 与第三方对于 o3 模型的基准测试结果存在差异,这引发了外界对于公司在透明度及模型测试流程上的质疑。Ti5喜好网-记录每日喜好的科技时尚娱乐生活

当 OpenAI 在 12 月份推出 o3 模型时,公司宣称该模型在 FrontierMath(一套具有挑战性的数学题集)上能够正确回答略多于四分之一的问题。这个得分显著领先于竞争对手——下一个最佳模型仅能正确解答大约 2% 的 FrontierMath 题目。Ti5喜好网-记录每日喜好的科技时尚娱乐生活

OpenAI 首席研究官 Mark Chen 在一次直播中表示:“目前市面上所有产品在 FrontierMath 上的得分都低于 2%,而我们内部观察到,通过采用 o3 模型在激进的测试时计算设置下,我们能够达到超过 25% 的得分。”Ti5喜好网-记录每日喜好的科技时尚娱乐生活

然而,事实证明,这个数字很可能只是一个上界,是由一个使用更多计算资源的 o3 版本在测试中获得的,而这并非 OpenAI 上周公开发布的那一版本所具备的计算能力。Ti5喜好网-记录每日喜好的科技时尚娱乐生活

负责 FrontierMath 的研究机构 Epoch AI 于周五发布了对 o3 模型进行独立基准测试的结果。Epoch 的测试显示,o3 模型得分大约为 10%,远低于 OpenAI 声称的最高分数。Ti5喜好网-记录每日喜好的科技时尚娱乐生活

OpenAI 已经发布了备受期待的推理模型 o3,同时还推出了继 o3-mini 之后更小且成本更低的 o4-mini 模型。Ti5喜好网-记录每日喜好的科技时尚娱乐生活

Epoch 在 Twitter 上写道:“我们在数学和科学基准测试集合上对这些新模型进行了评估,结果已在线程中公布! pic.twitter.com/5gbtzkEy1B” (2025 年 4 月 18 日)。Ti5喜好网-记录每日喜好的科技时尚娱乐生活

这并不意味着 OpenAI 本质上是在撒谎。公司在 12 月发布的基准测试结果展示了一个下界得分,这个得分与 Epoch 观察到的分数相吻合。Epoch 还指出,其测试设置很可能与 OpenAI 的有所不同,而且其评估使用了更新版本的 FrontierMath。Ti5喜好网-记录每日喜好的科技时尚娱乐生活

Epoch 在报告中写道:“我们与 OpenAI 结果之间的差异,可能是因为 OpenAI 使用了一个更强大的内部测试框架,在测试时动用了更多的计算资源,或是因为这些结果是在 FrontierMath 的不同子集上运行得到的(frontiermath-2024-11-26 中的 180 道题与 frontiermath-2025-02-28-private 中的 290 道题相比)。”Ti5喜好网-记录每日喜好的科技时尚娱乐生活

根据 ARC Prize Foundation 在 X 上的一篇博文,该组织曾测试过预发布版的 o3 模型,并指出公开版 o3 “是一个经过调优以适用于聊天/产品场景的不同模型”,这一点与 Epoch 的报告相印证。Ti5喜好网-记录每日喜好的科技时尚娱乐生活

ARC Prize 在推文中写道:“所有公布的 o3 计算层级都比我们基准测试的版本要小。”一般来说,计算资源更充足的版本预期能获得更好的基准测试得分。Ti5喜好网-记录每日喜好的科技时尚娱乐生活

当然,公开发布的 o3 模型未能达到 OpenAI 测试时所宣称的成绩,这一点实际上无关紧要,因为 OpenAI 的 o3-mini-high 和 o4-mini 模型在 FrontierMath 上的表现均优于 o3,并且 OpenAI 计划在未来几周推出性能更强的 o3 变种——o3-pro。Ti5喜好网-记录每日喜好的科技时尚娱乐生活

不过,这再次提醒我们在解读 AI 基准测试时不应只停留在表面,尤其当数据来源于一个手握商业服务的公司时。Ti5喜好网-记录每日喜好的科技时尚娱乐生活

随着厂商争相运用新模型争取头条新闻和市场关注,基准测试“争议”在 AI 行业中已日渐常见。Ti5喜好网-记录每日喜好的科技时尚娱乐生活

今年一月,Epoch 因在 OpenAI 宣布 o3 后才披露其获得的资金支持而受到批评;许多为 FrontierMath 贡献的学者直到公开报道后才得知 OpenAI 的参与。Ti5喜好网-记录每日喜好的科技时尚娱乐生活

最近,Elon Musk 的 xAI 被指控发布了误导性的基准测试图表,用以宣传其最新 AI 模型 Grok 3 的表现;而就在本月,Meta 承认曾宣传过某个模型版本的基准测试得分,而该版本与公司提供给开发者使用的版本不同。Ti5喜好网-记录每日喜好的科技时尚娱乐生活

展开全文
猜你感兴趣
国产男装,终于靠女性“支棱”起来了?

国产男装,终于靠女性“支棱”起来

文丨关樾出品丨消费最前线去年双

11-19 127阅读
大模型公司们创业未半,技术主心骨们却先弃船回大厂了?

大模型公司们创业未半,技术主心骨

2024

11-19 108阅读
「西图之光」获近千万元A轮融资

「西图之光」获近千万元A轮融资

【投

11-19 109阅读
1元水,巨头们的游戏

1元水,巨头们的游戏

今年

11-19 132阅读
这个东北小镇,拿捏年轻人的第一件貂

这个东北小镇,拿捏年轻人的第一件

你会

11-19 127阅读
9年前,那个娶了泰国“最尤物妖”的北京夫君,如今后悔了吗

9年前,那个娶了泰国“最尤

11-19 109阅读
毒铁锅 遭央视多次曝光,把美食变成 毒药 ,大家应提高警惕(遭央视多次曝光)

毒铁锅 遭央视多次曝光,把

前言 前一段时间,我国市面上出现了

11-19 105阅读
火热气氛拉满!超级音雄·巨星演唱会-汕头站12/22重磅来袭

火热气氛拉满!超级音雄·巨

  在全国收获无数好评、演出场场爆

11-19 118阅读
《角斗士2》横扫国际票房

《角斗士2》横扫国际票房

《角斗士2》在欧

11-19 106阅读
2024年全球票房十强!电影《毒液:最后一舞》中国票房破6亿

2024年全球票房十强!电影《

11月13日消息,根

11-19 107阅读
《严阵以待》DLC“深水”Steam页面开放 发售日待定

《严阵以待》DLC“深水”S

今日(11月16日),《严阵以待》DLC「Dark W

11-19 128阅读
TGA:DLC、拓展包、新赛季、重制版等均可提名所有奖项

TGA:DLC、拓展包、新赛季、

今日(11月16日),TGA主创Geoff Keighley与

11-19 120阅读
文明6秘籍大全_文明6秘籍代码及使用方法一览

文明6秘籍大全_文明6秘籍

文明6游戏支持秘籍功能,玩家可以通过在

11-19 134阅读
原神疗养观察任务流程|原神疗养观察攻略

原神疗养观察任务流程|原

原神疗养观察是游戏中须弥地区魔神任务

11-19 104阅读
原神大走廊的尽头隐藏成就|大走廊的尽头任务攻略

原神大走廊的尽头隐藏成就

大走廊的尽头是原神须弥沙漠地区的隐藏

11-19 131阅读