一家成立仅两年、团队不足 200 人的中国 AI 公司,凭借极致的工程效率和开源精神,不仅训练出比肩 OpenAI 的模型,更引发了全球科技股的巨震。其创始人梁文锋的独特路径和非传统理念,为理解当下全球 AI 格局的剧烈变动提供了一个全新的视角。
智能速览
DeepSeek 创始人梁文锋出身量化基金,并非传统科技巨头背景。
其在芯片禁令前布局的万卡算力集群,成为后续逆袭的关键底牌。
DeepSeek V3 模型以约 558 万美元的训练成本,性能对标 GPT-4。
R1 推理模型以 29.4 万美元成本训练成功,API 价格仅为竞品的几十分之一。
模型发布引发全球市场震动,导致英伟达单日市值蒸发近 6000 亿美元。
精华内容
DeepSeek 的崛起并非偶然,其背后是一条截然不同的发展路径。从创始人理念到技术实现,再到组织架构,每一步都挑战着行业常规。
算力远见
故事始于量化基金幻方。创始人梁文锋并非有海外对冲基金背景的精英,而是一个本土成长的技术极客。2019 年起,他执拗地投入巨资建设算力中心,先后建起配备 1100 块 GPU 的“萤火一号”和约 10000 块英伟达 A100 芯片的“萤火二号”。
这些决策在美国对华高端芯片禁令生效前完成,使一家量化基金意外掌握了训练顶尖大模型的入场券。当别人还在质疑他买芯片的“奇怪副业”时,梁文锋已用“买钢琴”的比喻,为自己的超前布局埋下伏笔。
极客文化
DeepSeek 的团队组建方式同样反常。梁文锋没有高薪挖角硅谷资深工程师,而是招募了来自北大、清华等顶尖高校的应届博士和毕业生。他认为年轻人“可以全身心投入一个使命,不带功利心”。
公司内部没有 KPI,没有僵化的层级,算力资源对所有人开放,鼓励思想的自由碰撞。这种与大厂内卷文化截然相反的氛围,让一支约 160 人的小团队,爆发出惊人的创新能量,其效率远超 OpenAI 等千人规模的巨头。
极致效率
DeepSeek 的技术突破体现在成本控制上。其 V3 模型仅用 2048 块 H800 芯片,耗时两个月,训练成本约 558 万美元。作为对比,OpenAI 训练 GPT-4 的成本据报超过 1 亿美元,Meta 训练 Llama 3.1 的算力消耗是其十倍。
更具颠覆性的是 R1 推理模型,训练成本仅为 29.4 万美元。它跳过传统的大规模监督微调,直接用强化学习训练推理能力,大幅削减了成本。其 API 定价仅为 OpenAI o1 的几十分之一,直接冲击了整个行业的定价体系。
技术信仰
驱动这一切的是梁文锋独特的理念。他直言从商业角度看,做基础研究“不划算”,并拒绝风险投资的介入,以保持决策自由。他认为中国 AI 的真正差距在于“原创和模仿”,并批评过去三十年科技行业“只强调赚钱,忽视了创新”。
他将所有模型开源,视其为一种“文化实践”和“软实力”。这种不以短期商业回报为唯一目标,而是以解决难题和推动技术进步为核心驱动力的做法,正是 DeepSeek 能够打破常规、实现突破的根本原因。
DeepSeek 的故事证明,在巨头的算力竞赛之外,效率和理念同样是强大的武器。尽管前路仍面临芯片封锁和商业化的双重考验,但这种以技术创新为核心的非典型路径,已为全球 AI 的发展注入了新的变量和想象空间。