国产开源之光：DeepSeek-V3划重点-喜好网-记录每日喜好的科技时尚娱乐生活

国产开源之光：DeepSeek-V3划重点

7个月前科技 37观看

摘要今年早些曾经有过几篇文章关注过DeepSeek：开源模型社区又一位重量级选手掀桌子对标 OpenAI o1：DeepSeek 发布最新推理模型一路走来，从一个低调、但能引起行业普遍降价的选手，到现在的国产+开源之

今年早些曾经有过几篇文章关注过DeepSeek：

开源模型社区又一位重量级选手掀桌子

对标 OpenAI o1：DeepSeek 发布最新推理模型

一路走来，从一个低调、但能引起行业普遍降价的选手，到现在的国产+开源之光引发全球瞩目。最近刚刚其最新的DeepSeek-V3发布后，海内外一片刷屏。本篇就划几处重点：

1、V3参数量、训练数据。

一句话介绍：DeepSeek-V3 采用了 671B 参数 MoE 架构，配备约 37B 激活单元，训练使用14.8T Token数据。

国产开源之光：DeepSeek-V3划重点

2、刷榜成绩：数学代码能力显著优异。

数学能力 / MATH 500、AIME 2024 等测试：显著优于 Claude 3.5 Sonnet 和 GPT-4o；

代码能力 / Codeforces：同样优于其他主流大模型，刷新了SOTA。

国产开源之光：DeepSeek-V3划重点

3、极佳训练成本优势：总计消耗了 278.8 万 GPU 小时。按照 NVIDIA H800 每小时 2 美元的租赁价格计算，训练成本约为 560 万美元。（相比之下，Llama 3模型的计算消耗了3930万H100小时...）

低训练成本可能是本次DeepSeek-V3在海外产生的最大反响的一点：

DeepSeek-V3的训练仅使用了2048张H800 （然而，H800 的互连带宽较低：300 GB/s，对比 H100 的 900 GB/s，这在训练过程中可能成为性能瓶颈，因为节点间的通信效率会受到影响，为此DeepSeek提出了多种优化方案，例如自主研发通信内核而非依赖张量并行，以及采用混合精度（FP8）训练等技术来提升效率。）

国产开源之光：DeepSeek-V3划重点

国产开源之光：DeepSeek-V3划重点

4、定价：一线模型中的最优选，

下图直接看一线大模型性价比的比对：

国产开源之光：DeepSeek-V3划重点

5、生成速度

（搬运官方信息）通过算法和工程上的创新，DeepSeek-V3 的生成吐字速度从 20 TPS 大幅提高至 60 TPS，相比 V2.5 模型实现了 3 倍的提升，为用户带来更加迅速流畅的使用体验。

国产开源之光：DeepSeek-V3划重点

最后，根据Artifical Analysis的独立测评报告“A new leader in open source AI”:

DeepSeek-V3在其Quality Index榜单上超过GPT-4o，仅次于o1和Gemini 2.0 Flash，与Claude 3.5 Sonnet持平。

国产开源之光：DeepSeek-V3划重点

国产开源之光：DeepSeek-V3划重点

后记-

在此前DeepSeek-V2的文章中曾经提到过其核心技术创新MLA（可见开源模型社区又一位重量级选手掀桌子），这些技术在V2得到验证后，现在也成为了V3的技术核心。此外互联网上，包括大神Andrej Karpathy也给予了极高评价：

国产开源之光：DeepSeek-V3划重点

应该表示祝贺！Congratulations to DeepSeek，也祝那些真正走在星辰大海路上的选手创造更多佳绩！

国产开源之光：DeepSeek-V3划重点

展开全文

猜你感兴趣

问界理想的新擂台：问界M8 VS 理想L8

问界理想的新擂台：问界M8 VS 理想

要说近年来什么行业最“卷”，相信

11-19 107阅读

蘸拖鞋都好吃！六婆辣椒面官方狂促速囤：40包6.9元

蘸拖鞋都好吃！六婆辣椒面官方狂促

天猫【六

11-19 131阅读

小鹏汇天“陆地航母”2024 广州车展完成全球公开载人首飞

小鹏汇天“陆地航母”2024 广州

11-19 120阅读

李子柒归来，牵扯许多人情世故？

李子柒归来，牵扯许多人情世故？

“这

11-19 105阅读

“知春路时代”的创业者，被回购条款绊了一跤

“知春路时代”的创业者，被回购条

这次

11-19 130阅读

Netflix，振奋时刻下的暗潮

Netflix，振奋时刻下的暗潮

作者 / 向向运营 / 狮子座和202

11-19 109阅读

贾乃亮帮清购物车, 网友没胆安利给自家老板!

贾乃亮帮清购物车, 网友没

今天双十二，大家剁手了吗！小编是没

11-19 107阅读

要回归了？李奈映透露丈夫元斌正在选剧本有望复出拍戏

要回归了？李奈映透露丈夫元

47岁韩国男星元斌，凭着帅气

11-19 104阅读

VaVa毛衍七主理女子嘻哈厂牌Herstory Gals首支Cypher《Herstory》上线

VaVa毛衍七主理女子嘻哈厂

　　10月29日,由种梦音乐D.M.G艺人Va

11-19 127阅读

微念称与李子柒的案件已完全和解：账号其本人运营品牌由微念经营

微念称与李子柒的案件已完

11月13日消息，日

11-19 127阅读

和平精英跳伞怎么快速落地?和平精英跳伞技巧

和平精英跳伞怎么快速落地

《和平精英》游戏中玩家将通过跳伞进入

11-19 138阅读

卧龙苍天陨落武将韩当解锁方法详细介绍

卧龙苍天陨落武将韩当解锁

韩当是三国历史上孙吴阵营的名将，在卧龙

11-19 118阅读

原子之心3826设施啁啾表全收集攻略

原子之心3826设施啁啾表全

啁啾表是原子之心游戏里面的一个特殊收

11-19 117阅读

原子之心展览园死者位置_展览园全部死者位置一览

原子之心展览园死者位置_

原子之心游戏的展览园区域中一共拥有11

11-19 112阅读

原神大走廊的尽头隐藏成就|大走廊的尽头任务攻略

原神大走廊的尽头隐藏成就

大走廊的尽头是原神须弥沙漠地区的隐藏

11-19 139阅读