华为开源openPangu 2.0,505B参数仅激活18B
源自56位全网作者
06-30 14:12
精选参考来源
1
#余承东称盘古大模型是全球先驱者#【#余承东称盘古大模型会走向世界第一#】#余承东坦言自己留的算力很有限#HDC 2026上余承东说盘古是全球大模型先驱,承认中间"没做好",现重新挂帅要带盘古从中国第一冲世界第一。他坦言华为昇腾算力大多支援了国内伙伴,自己留的很有限,所以不卷万亿参数,改拼效率——同步发布开源盘古openPangu 2.0(512K上下文、深度适配昇腾)。老余这人就这样——敢认"没做好",也敢放"不做第二"的狠话。算力被挤占是实情,转攻工程效率和软硬协同(昇腾+鸿蒙)也算务实路子。只是盘古此前争议犹在,光喊口号不够,开源2.0落地效果和开发者买不买账才是真考验。没在现场也挺您,加油把活干漂亮吧👊
2
#HDC2026# 华为自己大模型openPangu 2.0 Pro,505B 总参数配 18B 激活,28:1 稀疏比。稀疏比 28:1 在千亿参数档位的 MoE 里算是很激进的了,DeepSeek-V3 差不多 18:1.之所以要这么高的稀疏比,估计还是因为昇腾。要知道 910B 的显存带宽只有 1.6 TB/s,H200 是 4.8 TB/s 差了整整3倍,理论上不做双稀疏就根本跑不动 512K 上下文。端侧同步发了一个 30B/2B,稀疏比没那么激进是15:1 ,但逻辑是一样的,跑在手机 NPU 上也要把专家切换频率降下去,推理时减少权重搬运。等等看 Mate 90 系列的芯片怎么样。 至于盘古大模型是不是中国第一,只能说那时候盘古大模型其实是很多种模型。盘古大模型 1.0 在 21 年发布,包括了 NLP 大模型、CV 大模型、科学计算大模型三类 ,别的不提至少 NLP 用的 encoder-decoder 架构,肯定算是基于 Transformer 的 LLM 了。#余承东称盘古大模型会走向世界第一##余承东称字典里没有第二只有第一##余承东坦言自己留的算力很有限# 东莞·东莞银行篮球中心
全部
来源
来源
内容由AI生成
0
0
0评论
当前文章无评论,是时候发表评论了
提示信息
取消
确认
评论举报
已收藏
去我的收藏夹