免费o1替代品来了!谷歌新发“王炸”推理大模型:思考速度碾压其他大模型,水平堪比理科博士

4个月前 科技 25观看
摘要文章来源:AI前线图片来源:由无界AI生成在 OpenAI “12 天马拉松”发布的第 11 天,他们平平无奇的发布又被谷歌抢了风头。刚刚,谷歌发布了实验性的“Gemini 2.0 Flash Thinking”模型,它以令人印象深刻的推理能力而闻名,可以

文章来源:AI前线G0r喜好网-记录每日喜好的科技时尚娱乐生活

图片来源:由无界AI生成图片来源:由无界AI生成

在 OpenAI “12 天马拉松”发布的第 11 天,他们平平无奇的发布又被谷歌抢了风头。G0r喜好网-记录每日喜好的科技时尚娱乐生活

刚刚,谷歌发布了实验性的“Gemini 2.0 Flash Thinking”模型,它以令人印象深刻的推理能力而闻名,可以“明确地展示自己的思维”来解决复杂问题,其水平与物理、化学和生物学博士生相当。G0r喜好网-记录每日喜好的科技时尚娱乐生活

谷歌 CEO Sundar Pichai 在社交网络 X 上的一篇文章中写道,这是“我们迄今为止最周到的模型,”还配上了笑脸。G0r喜好网-记录每日喜好的科技时尚娱乐生活

顾名思义,它建立在“2.0 Flash 的速度和性能”之上。谷歌表示,它“经过训练可以大声思考”,从而“具有更强的推理性能”。G0r喜好网-记录每日喜好的科技时尚娱乐生活

为了与 OpenAI 的 o1 竞争,谷歌 DeepMind 首席科学家 Jeff Dean 在 X 上的一条发文中表示,该模型“经过训练,可以使用思维来加强其推理能力”,同时还受益于速度更快的 Gemini Flash 2.0 模型。G0r喜好网-记录每日喜好的科技时尚娱乐生活

Dean 分享的演示展示了 Gemini 2.0 Flash Thinking 如何通过“思考”一系列步骤,然后再提供解决方案,从而解答物理问题。谷歌分享了几个跨物理和概率的演示:G0r喜好网-记录每日喜好的科技时尚娱乐生活

Gemini 2.0 Flash Thinking 现已在 Google AI Studio 和 Vertex AI 中推出。它在 Chatbot Arena LLM 排行榜上首次亮相,位居“所有类别第一” 。就在昨天,谷歌在 Gemini 应用程序中推出了 2.0 Experimental Advanced,Gemini-Exp-1206 也位居排行榜榜首。G0r喜好网-记录每日喜好的科技时尚娱乐生活

这不一定是人类那样的“推理”,但这意味着机器将指令分解为可以产生更强结果的更小的任务。G0r喜好网-记录每日喜好的科技时尚娱乐生活

另一个示例由 Google 产品负责人 Logan Kilpatrick 发布,展示了该模型如何推理解决涉及视觉和文本元素的问题。“这只是我们推理之旅的第一步,”Kilpatrick 说。G0r喜好网-记录每日喜好的科技时尚娱乐生活

更易于理解和更透明的推理G0r喜好网-记录每日喜好的科技时尚娱乐生活

在开发者文档中,谷歌解释说,“思考模式的响应推理能力比基础版 Gemini 2.0 Flash 模型更强”,而基础版 Gemini 2.0 Flash 模型是谷歌最新、最出色的模型,仅在 8 天前发布。G0r喜好网-记录每日喜好的科技时尚娱乐生活

新模型仅支持 32000 个标记输入(约 50-60 页文本),并且每个输出响应可以产生 8000 个标记。在 Google AI Studio 的侧面板中,该公司声称它最适合“多模式理解、推理”和“编码”。G0r喜好网-记录每日喜好的科技时尚娱乐生活

该模型的训练过程、架构、许可和成本的完整细节尚未公布。目前,它在 Google AI Studio 中显示每个令牌的成本为零。G0r喜好网-记录每日喜好的科技时尚娱乐生活

与 OpenAI 的竞争推理模型 o1 和 o1 mini 不同,Gemini 2.0 允许用户通过下拉菜单访问其逐步推理,从而更清晰、更透明地了解模型如何得出结论。G0r喜好网-记录每日喜好的科技时尚娱乐生活

通过允许用户了解决策过程,Gemini 2.0 解决了人们对人工智能作为“黑匣子”运行的长期担忧,并使该模型(许可条款仍不明确)与竞争对手的其他开源模型相提并论。G0r喜好网-记录每日喜好的科技时尚娱乐生活

一些开发者对该模型的早期简单测试表明,它可以正确而快速地(1 到 3 秒内)回答一些对于其他 AI 模型来说非常棘手的问题,例如计算“Strawberry”一词中的 R 的数量。(见上面的截图)。G0r喜好网-记录每日喜好的科技时尚娱乐生活

原生支持图像上传和分析G0r喜好网-记录每日喜好的科技时尚娱乐生活

Gemini 2.0 Flash Thinking 是对竞争对手 OpenAI o1 系列的进一步改进,旨在处理跳跃中的图像。G0r喜好网-记录每日喜好的科技时尚娱乐生活

o1 最初是纯文本模型,但后来扩展到包括图像和文件上传分析。目前,这两种模型也只能返回文本。G0r喜好网-记录每日喜好的科技时尚娱乐生活

根据开发者文档显示,Gemini 2.0 Flash Thinking 目前还不支持与谷歌搜索落地,也不支持与其他谷歌应用和外部第三方工具集成。G0r喜好网-记录每日喜好的科技时尚娱乐生活

Gemini 2.0 Flash Thinking 的多模式能力扩展了其潜在用例,使其能够应对结合不同类型数据的场景。G0r喜好网-记录每日喜好的科技时尚娱乐生活

例如,在一项测试中,该模型解决了一个需要分析文本和视觉元素的难题,展示了其跨格式集成和推理的多功能性。G0r喜好网-记录每日喜好的科技时尚娱乐生活

开发人员可以通过 Google AI Studio 和 Vertex AI 利用这些功能,其中模型可供实验。G0r喜好网-记录每日喜好的科技时尚娱乐生活

随着人工智能领域的竞争日趋激烈,Gemini 2.0 Flash Thinking 可能标志着问题解决模型新时代的开始。它能够处理多种数据类型、提供可视化推理并大规模执行,这使它成为推理人工智能市场的有力竞争者,可与 OpenAI 的 o1 系列及其他产品相媲美。G0r喜好网-记录每日喜好的科技时尚娱乐生活

参考链接:
https://lmarena.ai/?leaderboard
https://analyticsindiamag.com/ai-news-updates/openai-sets-the-stage-for-agentic-ai-with-chatgpt-desktop-apps-for-mac-and-windows/
谷歌 大模型
展开全文
猜你感兴趣
拼多多「隐身」双十一

拼多多「隐身」双十一

纵然是在互联互通的大背景下,双十

11-19 65阅读
明星为何争做探店顶流?

明星为何争做探店顶流?

采写/陈纪英编辑/万天南明星的尽头

11-19 70阅读
极氪总裁提醒用户警惕杀猪盘:低价买车是诱饵

极氪总裁提醒用户警惕杀猪盘:低价

11月19日

11-19 70阅读
雷神G50 Ultra手柄预售:TMR摇杆+扳机震动,179元起

雷神G50 Ultra手柄预售:TMR摇杆+

11-19 67阅读
收到500万份垄断诉讼,谷歌要被拆分?

收到500万份垄断诉讼,谷歌要被拆

谷歌

11-19 68阅读
“资源弃子”杨幂还是被踢出了局,和嘉行解约的背后是被闺蜜插刀

“资源弃子”杨幂还是被踢

11-19 70阅读
陶喆深夜送美女回家, 疑似再次出轨遭经纪人否认!

陶喆深夜送美女回家, 疑似

陶喆也算是家喻户晓的歌星了,曾经

11-19 66阅读
高燃励志电影《倒数回击》定档11月20日 甜妹热辣“爆改”逆袭浴火人生

高燃励志电影《倒数回击》

  由洪子烜导演,温贞菱、丁宁主演的

11-19 59阅读
“咪粉嗨购节”上线  咪咕音乐携周杰伦加码“双十一”福利

“咪粉嗨购节”上线 咪咕

  双11来了,为了凑满减捆绑废物单品

11-19 62阅读
郭德纲外甥大婚排场大!岳云鹏张云雷引人关注,新娘面相惹争议

郭德纲外甥大婚排场大!岳云

11月18日,德云社相声演员王九龙大婚,他

11-19 62阅读
特别好评《永恒天空》明年登陆PS5 试玩Demo现已上线

特别好评《永恒天空》明年

于 2023 年 6 月发售的开放世界科幻生

11-19 72阅读
烟雨江湖千机遗迹怎么开启?烟雨江湖千机遗迹攻略流程

烟雨江湖千机遗迹怎么开启

《烟雨江湖》是一款开放世界武侠冒险手

11-19 153阅读
电脑怎么玩switch游戏?使用switch模拟器免费玩switch游戏的方法分享

电脑怎么玩switch游戏?使

电脑怎么玩switch游戏?switch游戏指的是

11-19 67阅读
饥荒体温过高怎么办?饥荒所有降低体温的方法分享

饥荒体温过高怎么办?饥荒

饥荒体温过高怎么办?饥荒游戏里面拥有体

11-19 70阅读
饥荒龙心怎么获得?饥荒快速获得龙心的技巧分享

饥荒龙心怎么获得?饥荒快

龙心是饥荒游戏里面的重要材料,可以从龙

11-19 68阅读