马斯克:我看到的最好的DeepSeek的分析文章

2025-02-09 23:42:35 8点赞 43收藏 3评论

真没想到,今年春节期间,科技领域最热门的话题并非旅游出行,也不是春晚的精彩纷呈,而是聚焦于 DeepSeek。这款源自中国的 AI 大模型,宛如一颗重磅炸弹,凭借自身强劲实力,在全球人工智能的版图上掀起惊涛骇浪,甚至引发了 GPU 算力领域的一阵恐慌。

马斯克:我看到的最好的DeepSeek的分析文章

马斯克也发文了,他说他看到了所见过最好、剖析最为透彻的一篇DeepSeek分析文章。而此文作者是美国知名科技分析人士 Gavin Baker,文中诸多观点饶有趣味,引人深思。胖二猫把此文章的几个观点附在下面,一起看看大佬写了什么:

马斯克:我看到的最好的DeepSeek的分析文章

其一,Gavin 指出,DeepSeek 在苹果应用商店的下载量独占鳌头,把 chatGPT 远远甩在身后。再者,从模型能力与质量维度审视,DeepSeek 与 OpenAI 的 O1 难分伯仲,当然,相较于 O3 仍存在一定差距。即便如此,这也充分彰显出 DeepSeek 已然跻身世界顶尖行列。

其二,据 Davin 分析,DeepSeek 的训练成本仅 600 万美元,相较于 GPT 4O 那高达 1 亿多美元的开销,看似有着天壤之别。然而,这一数字实则暗藏玄机,极具误导性。因为这 600 万美元并未涵盖前期在研究架构、算法设计以及数据消融实验等环节所投入的成本。换言之,DeepSeek 是在前期豪掷上亿美元,且依托能够访问更大规模集群的优势条件下,才得以用 600 万美元完成 R1 的训练。

其三,Gavin 提出,DeepSeek 手握远超 2048 个 GBU 的 H100 算力。早期论文也曾提及,DeepSeek 拥有由 1 万个 A100 组成的集群,这与硅谷 AI 公司 ScaleAI 的创始人 Alex 王的见解不谋而合。值得一提的是,英伟达约 20%的收入源自新加坡,不过这部分 GPU 芯片未必都在新加坡本地。如此一来,便不难理解 DeepSeek 的母公司幻方量化的布局。幻方量化作为一家量化交易公司,一方面,在利用量化交易,在金融市场赚得盆满钵满,积累了雄厚资金,这个不细说了,懂的都懂;另一方面,量化交易本身对算力需求极大,所以幻方储备一定数量的 GPU 实属常规操作。

马斯克:我看到的最好的DeepSeek的分析文章

其四,Gavin 强调,DeepSeek 的研发大量运用了知识蒸馏技术。也就是说,凭借对 OpenAI 的 GPT 4O 和 O1 的无阻碍访问权限,DeepSeek 才得以完成相关训练流程。关键在于,知识蒸馏技术能够以极少的算力达成训练目标。身为论文作者的 Gavin 还表示,当前限制 GPU 供应,却对中国使用蒸馏技术借鉴 OpenAI 前沿模型的行为不加以限制,这无疑背离了美国出口限制政策的初衷。毕竟,蒸馏技术本就由 AI 教父 Hinton 等人首创,OpenAI 的 O1、O3 等大模型同样是借助蒸馏技术构建而成,难道 DeepSeek 就无权使用了吗?就如同 Transformer 技术源自谷歌,OpenAI 的 ChatGPT 不也运用该技术搭建模型吗?科技发展的漫漫长路,本就是在前人基础上不断攀登的过程。

马斯克:我看到的最好的DeepSeek的分析文章

其五,展望未来,整个人工智能行业的走势愈发扑朔迷离,令人期待。马斯克即将推出的 Grok3 尤为引人瞩目,据悉它将动用全球规模最大的、高达 10 万卡的 GPU 算力进行训练。届时,会对中国开放无限制访问吗?会允许中国借鉴其 Grok3 大模型吗?不过 Gavin 却认为,这似乎并不会对 DeepSeek 造成太大冲击。因为 DeepSeek 的 V3 大模型仅需短短几周的强化学习,就能进阶为 R1,而 R1 又足以快速孵化出下一个版本 R3。

不知大家怎么看?

展开 收起
3评论

  • 精彩
  • 最新
  • 兼听则明

    校验提示文案

    提交
  • 总是搞技术垄断和技术竞争,美丽国的做法一点儿也不美丽啊

    校验提示文案

    提交
  • 当年我们传子不传女的各种小绝技现在在哪里,都在历史的垃圾桶🗑️里。开放,交流,公平竞争才是正道

    校验提示文案

    提交
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
最新文章 热门文章
43
扫一下,分享更方便,购买更轻松