OpenAI甩王炸!发布新模型o3,一夜再次改变世界!

4个月前 科技 28观看
摘要 今天凌晨2点,OpenAI开启第12天技术直播,也是最后一天。不负众望终于整了个大的,发布全新预览版模型——o3。根据发布的o3测试数据显示,美国AIME数学竞赛中达到了96.7分,大幅度超过了o1

今天凌晨2点,OpenAI开启第12天技术直播,也是最后一天。不负众望终于整了个大的,发布全新预览版模型——o3。42a喜好网-记录每日喜好的科技时尚娱乐生活

根据发布的o3测试数据显示,美国AIME数学竞赛中达到了96.7分,大幅度超过了o1预览版的56.7和o1的83.3%,仅错了一道题相当于一名顶级数学家的水平。42a喜好网-记录每日喜好的科技时尚娱乐生活

而在ARCAGI的测试中,o3在低算力资源情况下实现了75.7%,而当增加计算资源后实现了87.5%,这也是首次有大模型超过了人类85%的水平,实现重大技术突破。42a喜好网-记录每日喜好的科技时尚娱乐生活

有意思的是,OpenAI直接跳过了o2发布了o3,主要原因是名字与英国著名电信公司o2发生了冲突无法使用,所以才直接来了个第三代~42a喜好网-记录每日喜好的科技时尚娱乐生活

OpenAI甩王炸!发布新模型o3,一夜再次改变世界!42a喜好网-记录每日喜好的科技时尚娱乐生活

o3主要测试数据42a喜好网-记录每日喜好的科技时尚娱乐生活

在软件风格基准测试中,由真实世界软件任务组成的3benchverified基准测试里,o3模型准确率达到71.7%,相比o1模型提升超过20%。42a喜好网-记录每日喜好的科技时尚娱乐生活

OpenAI甩王炸!发布新模型o3,一夜再次改变世界!42a喜好网-记录每日喜好的科技时尚娱乐生活

在竞赛代码领域,o3模型在CodeForces竞赛编码网站上表现卓越,达到了约2727的ELO分数,远超o1模型的1891分,甚至超越了OpenAI首席科学家Yakov的分数,接近公司内部顶尖编程高手的水平,这表明o3在处理复杂编程竞赛任务时具备出色的逻辑推理和算法实现能力。42a喜好网-记录每日喜好的科技时尚娱乐生活

在数学能力测试中,o3模型在Amy考试中的准确率高达96.7%,而o1模型为83.3%。在这个被视为美国数学奥林匹克预选考试的高难度测试中,o3模型通常仅错一题,表现十分出色。42a喜好网-记录每日喜好的科技时尚娱乐生活

42a喜好网-记录每日喜好的科技时尚娱乐生活

在衡量模型在博士阶段科学问题处理能力的GPQADiamond基准测试中,o3模型取得了87.7%的准确率,比o1模型的78%提高了约10%,甚至超越了领域专家博士通常能达到的70%的水平,这表明o3模型在数学和科学领域的复杂问题处理上已接近甚至超越人类专家水平。42a喜好网-记录每日喜好的科技时尚娱乐生活

OpenAI甩王炸!发布新模型o3,一夜再次改变世界!42a喜好网-记录每日喜好的科技时尚娱乐生活

在ARCAGI基准测试中,o3模型取得了重大突破。在低计算条件下,o3模型在ARCAGI的半私有保留集上得分为75.7,这一成绩在符合计算要求的同时,成为了新的行业领先水平。42a喜好网-记录每日喜好的科技时尚娱乐生活

当进一步提升计算能力,让o3模型进行更长时间的思考时,其在同一隐藏保留集上的得分更是高达87.5%。这一成绩尤为重要,因为人类在该测试中的表现阈值约为85%,O3模型的得分超过了这一阈值,标志着人工智能在该领域取得了新的里程碑。42a喜好网-记录每日喜好的科技时尚娱乐生活

OpenAI甩王炸!发布新模型o3,一夜再次改变世界!42a喜好网-记录每日喜好的科技时尚娱乐生活

此前,ARCAGI版本一花费了五年时间,才使领先的前沿模型从0%提升到5%,而o3模型的出色表现无疑展示了OpenAI在人工智能技术研发上的巨大进步。42a喜好网-记录每日喜好的科技时尚娱乐生活

o3Mini版本42a喜好网-记录每日喜好的科技时尚娱乐生活

与o3模型相比,o3Mini模型在性能与成本平衡方面表现出色,能够以较低的成本提供高效的服务。42a喜好网-记录每日喜好的科技时尚娱乐生活

在编码评估方面,o3Mini模型展现出了出色的性能提升。在CodeForces的评估中,随着思考时间的增加,o3Mini模型的表现不断提升,逐渐超越了o1Mini模型。42a喜好网-记录每日喜好的科技时尚娱乐生活

在中位思考时间下,o3Mini模型的性能甚至优于o1模型,能够以大约一个数量级的更低成本提供相当甚至更好的代码性能。这意味着开发人员可以在不增加过多成本的情况下,获得更高效的编程辅助,提高开发效率,降低开发成本。42a喜好网-记录每日喜好的科技时尚娱乐生活

OpenAI甩王炸!发布新模型o3,一夜再次改变世界!42a喜好网-记录每日喜好的科技时尚娱乐生活

在数学能力测试中,o3Mini模型在2024年数据集上表现出色。o3Mini低模型的性能与o1Mini相当,而o3Mini中位数模型则取得了比o1更好的性能。在处理诸如GPQA等困难数据集时,o3Mini模型也能展现出一定的优势,实现了接近即时响应的效果。42a喜好网-记录每日喜好的科技时尚娱乐生活

此外,o3Mini模型支持函数调用、结构化输出、开发者消息等一系列功能,与O1模型相当。在实际应用中,o3Mini模型在大多数评估中实现了可比或更好的性能。42a喜好网-记录每日喜好的科技时尚娱乐生活

在现场演示中,o3Mini 模型的强大功能得到了直观展示。例如,在一项任务中,模型被要求使用Python 实现一个代码生成器和执行器。当启动运行该 Python 脚本后,模型成功启动了本地服务器,并生成了包含文本框的用户界面。42a喜好网-记录每日喜好的科技时尚娱乐生活

用户在文本框中输入编码请求后,模型能够迅速将请求发送至 API,并自动解决任务,生成代码并保存至桌面,随后自动打开终端执行代码。整个过程复杂且涉及大量代码处理,但 o3 Mini 模型在低推理努力模式下依然表现出了极快的处理效率。42a喜好网-记录每日喜好的科技时尚娱乐生活

目前,该模型还处于安全测试阶段,从今天开始o3 Mini 模型率先开放给外部安全研究人员进行测试,随后 o3 模型也将参与其中。研究人员可通过访问 OpenAI 的官方网站,填写申请表格参与测试。42a喜好网-记录每日喜好的科技时尚娱乐生活

 42a喜好网-记录每日喜好的科技时尚娱乐生活

展开全文
猜你感兴趣
华为Mate 70已经到店:数量有限 抢到赚到

华为Mate 70已经到店:数量有限 抢

11月19日

11-19 68阅读
广汽传祺S7大五座SUV全球首秀,预计明年上半年上市

广汽传祺S7大五座SUV全球首秀,预

11-19 68阅读
英伟达发布PC端Nvidia应用,取代GeForce Experience

英伟达发布PC端Nvidia应用,取代Ge

11-19 69阅读
慢热的腾讯,上火的AI搜索

慢热的腾讯,上火的AI搜索

11月1

11-19 65阅读
摸着Meta过河,百度再战AI眼镜

摸着Meta过河,百度再战AI眼镜

“Goo

11-19 65阅读
冯小刚和范冰冰关系不简单, 冯小刚力挺范冰冰复出引众怒

冯小刚和范冰冰关系不简单

众所周知范爷范冰冰在还没被封杀

11-19 69阅读
《老舅》官宣开机,郭京飞、王佳佳领衔主演,重绘时代浪潮下的经典温暖记忆

《老舅》官宣开机,郭京飞、

  11月14日,由腾讯视频、鸣涧影业出

11-19 63阅读
44岁董洁:曾是无数人的“白月光”,却陷入中年尴尬

44岁董洁:曾是无数人的“白

董洁,她曾经是无数人心中的白月光,但也

11-19 68阅读
琼瑶 与诗经《木瓜》的不解之缘(与诗经木瓜的不解之缘)

琼瑶 与诗经《木瓜》的不

投我以木瓜,报之以琼琚。匪报也,永以

11-19 68阅读
炒股4年赚5千万的上海00后火了:我最近亏麻 舆论已影响自己生活

炒股4年赚5千万的上海00后

11月14日消息,近

11-19 63阅读
PS5 Pro在美国的首发销量与PS4 Pro相近

PS5 Pro在美国的首发销量

PS5 Pro 于本月早些时候发行,虽然这款

11-19 70阅读
重装机兵4失落密码大全_重装机兵4所有失落密码一览

重装机兵4失落密码大全_重

失落密码是《重装机兵4》游戏里面的一

11-19 190阅读
原子之心全部圆盘锁开锁方法详细介绍

原子之心全部圆盘锁开锁方

圆盘锁是原子之心游戏里面的一种特殊加

11-19 66阅读
原子之心能量不回复怎么办?原子之心恢复能量的方法分享

原子之心能量不回复怎么办

原子之心能量不回复怎么办?原子之心游戏

11-19 70阅读
饥荒蜘蛛网超详细获取方法分享

饥荒蜘蛛网超详细获取方法

蜘蛛网是饥荒游戏里面的一个常用材料,有

11-19 70阅读