DeepSeek建1GW算力中心对标xAI

源自19位全网作者

07-31 09:52

内容由AI生成

精选参考来源

1. 冯骥半夜失眠写下的那段话,是Deepseek梁文锋融500亿的全部理由

2. 谁说内蒙古只有草原和羊肉串,这次我跑到呼和浩特和包头,挖出了中国经济的“隐藏款”——从AI算力到工业黄金,这才是大国重器的真面目。#安吉拉的城市vlog##内蒙古##呼和浩特##包头##一机集团##包头稀土研究院##中国移动##呼和浩特数据中心##大国重器##内蒙古算力##产业# 安吉拉洞见的微博视频

3. 张小珺对华为 Fellow、半导体首席科学家廖恒的采访,很值得一看。海思过去极少出现在媒体面前。廖恒回答接受采访有三个原因:第一,希望给世界留下一点启示。"工程师的故事代代相传,也许能给其他人一点启发。"第二,在清华讲课后感到深深的焦虑。他在清华计算机系讲了一节"计算机组成原理",发现年轻学生都追逐 AI 算法、模型训练这些热点,没人愿意学这种"鬼门关"的课——大作业要设计一个完整 CPU。"如果大家都不愿意学了,今后会不会出现人力的断档?"第三,即使是自己的下属和同事,每天辛苦工作,也缺乏完整的行业视角,容易迷茫或摇摆。"如果有机会展示一个几十年的视角和行业规律,这是个很不错的机会。"-关于芯片产业的横向全景,黄仁勋说有5层蛋糕:第1层:能源第2层:芯片第3层:基础设施(Infra)第4层:模型第5层:应用廖恒认为是18层宝塔:最1层:采矿与原料获取第2层:半导体材料:硅、稀有金属等第3层:器件设计:FinFET、GAA 等晶体管第4层:晶圆制造:在晶圆上可靠制造海量晶体管第5层:制造设备:光刻机及数百/上千种设备第6层:工艺使能、先进封装/堆叠、散热供电、产能与良率第7层:芯片架构:软件与硬件的接口第8层:编译器与运行时第9层:编程语言、算子表达与切分方式第10层:强化学习第11层:量化、低精度与新数据格式第12层:模型压缩、稀疏化第13层:算法与训练方法第14层:基础模型 / 大模型第15层:KV Cache、推理服务系统第16层:Agent 框架第17层:Agent 面向用户的产品能力第18层:应用与商业服务:微信、豆包、支付宝等你能看出:廖恒的逻辑是真的把一粒粒沙子,变成最终的芯片,并完成整个系统级的搭建,这18层似乎就是华为海思的落地路径,是全链路,最终实现量产的逻辑。从昇腾910到950,廖恒形容是磨难,但是一种有期待的磨难。910时代(断供前),海思拥有最先进的逻辑工艺,但不知道AI最大的变现机会在哪,当时想到边缘端(耳机、手机),数据中心只用于训练,完全没想象到大语言模型推理、AI Coding 这些东西。950时代(断供后),条件变得极度苛刻,廖恒说:让我记忆最深刻的感受,是激发了我极大的好胜心。第一个我要知道碰到了什么问题。我要把这些问题一个一个拆解出来,一个一个去解决。他估计当时的海思团队,只有5-10%的人选择了离开,80-90%,尤其是骨干能力最强的同事留了下来,激发了解决问题的斗志。-大环境的三个变化,给了海思思路:1、开源模型(DeepSeek、千问)提供了"裸体"解剖级的设计参照,加上自动驾驶、手机等业务闭环的反馈。2、DeepSeek R1(2025 春节后)催生了之前没意想到的推理市场。部署一个月就发现:推理的核心瓶颈不是算力,是内存带宽——算力与带宽的比例需要重新设计。3、超节点被验证:把多个芯片紧密耦合协同工作的能力,是 910C/950 "能够存活的重要原因"-Co-Design:DeepSeek 的启示:廖恒用一个精妙的比喻来解释昇腾和 Blackwell 的架构差异:"昇腾的 vector 算力和 cube 算力比例是 8:1,Blackwell 是 32:1。就像你从 100 平米的公寓搬到 400 平米的别墅——还是住一家四口,但你开始堆垃圾了。8:1 意味着空间稀缺,必须精打细算。"别人相信 Scaling Law 需要算全部参数, DeepSeek 证明:只激活32/1的参数参与运算。节省 32 倍算力,32 倍访存。1M token 的序列不需要 256 倍的 Attention 计算,挑选其中 512 或 1K 来计算,节省了巨大的算力。廖恒说:"我必须给梁文峰热烈鼓掌。他有意识地、主动地选择了更高的复杂性、更难的收敛算法。因为他有一个提前的感知——并不是等到 5 年后穷途末路时才想办法。他已经先知先觉地选择去解决一个他预期到的问题。这就是先行者的价值。"-AI 芯片与人才的本质:"当大家在采购 GPU 或 NPU 的时候,实际上是在采购内存。按今天的成本计算,80% 是 HBM 的钱,只有 10% 左右花在先进逻辑晶片上。"核心竞争不在于逻辑晶片多先进,而在于逻辑晶片 + 匹配的内存有多先进。芯片工程师的不可替代性:"一个天才博士做不了芯片。必须从模块级到系统级,经历 18-20 个月的流片周期——不止一次,好多次。因为你设计芯片 18 个月才能按一次按钮,一次花 2-3 亿。你完全没有试错的机会。不像软件——写 10 分钟代码就可以编译跑一下。"-中国的人才优势中国半导体从业者比硅谷年轻 20 岁廖恒在硅谷算是年轻的,在中国算"即将应该被淘汰的年龄"年轻人的爆发力更足,有更长的从业时段"廖恒说:全世界 70% 的优秀算法人才是中国人以上内容,根据张小珺对廖恒的视频采访进行了文字整理,感兴趣的朋友可以看这期5个小时的采访内容。

4. 华为半导体首席科学家廖恒的访谈,提炼几个信息点,1. 华为半导体首席科学家出现在公众视野,这或许本身就是一个信号,轻舟已过万重山!2. 如果脱钩断链,不需要担心我们没有算力了,只是我们的卡能耗高一些。但我们的电价,大概是其他主要经济体的四分之一及以下,3. 前段时间,DeepSeek 的模型发版速度变慢了,行业里面在传,DeepSeek 在跟本土芯片一起做适配优化。这期访谈我认为是一个亲历者,对这段经历做了证实。PS:视频内容非常长,信息量很大,我大概就看了 1/3,明天继续~

5. #梁文锋坦承华为芯片落后英伟达两年#AI圈热议的梁文锋发言,终于把华为芯片和英伟达的差距说透了,听完特别真实客观。大家别误会,他说的落后两年不是彻底不行。简单说就是,四张华为昇腾950的算力,才抵得上一张英伟达高端芯片。而且咱们最新的华为芯片,性能也就对标英伟达两年前的旧款产品。不过他觉得这个硬件差距完全能接受,靠堆芯片数量、性价比,完全可以替代使用。真正难啃的硬骨头根本不是硬件,是英伟达垄断的CUDA软件生态!所以DeepSeek花了很久,专门适配华为国产框架,自研工具链摆脱依赖,真心在助力国产算力突破。这里纠正一个网传误区,并不是彻底不用英伟达,只是主动押注国产生态。目前唯一短板就是华为芯片产能不够,限制了大模型训练。不得不说,坚持自主突围,真的很有魄力。

6. #梁文锋称华为芯片一年内平替英伟达# 网上有提到,DeepSeek梁文锋说的所谓平替,本质是“集群等效”。4张华为950卡能顶1张英伟达高端卡,硬件代差确实还有两年,价格甚至可能贵出50%到200%。但在算力被卡脖子的当下,只要任务能跑通、延时能对齐,这种溢价就是我们必须支付的“生存成本”。 从目前来看,算力存在一定问题,但这问题是芯片产能有限等综合因素造成的。从长远来看,这一问题的影响会被慢慢削弱和抹平。所以AI之争最终演变成性能和成本之争,我们还是要发挥好我们的优势,不走封闭路,敢于开放、敢于突破。

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章