长猫开源万亿模型,纯国产算力零英伟达
源自42位全网作者
07-06 16:28
精选参考来源
1
美团正式发布了LongCat-2.0,1.6万亿参数,全流程在5万张国产算力卡上完成训练和推理,英伟达含量为零,这是目前公开信息里,第一个在纯国产算力集群上从零跑通的万亿参数大模型。5万张国产卡,从零开始预训练,堆出了一个1.6万亿参数的MoE模型,而且是100万上下文,是非常重大的一个行业突破。虽然美团没有说用的是什么卡,但之前有报道美团自2023年起与华为深度模芯协同,打通万卡级分布式训练、国产集群容错调度整套工程方案,是国内最大规模昇腾万亿模型训练落地案例。所以大概率5万张里大部分是华为昇腾卡,少部分是寒武纪。推理部分会有更多的国产卡参与。昇腾也是国内唯一具备5万卡级大规模分布式训练成熟生态的国产算力,HCCL通信、大显存NPU、分布式框架适配能力也足以匹配万亿MoE训练需求;寒武纪、通用GPU厂商当前万卡级稳定训练落地案例则较少,还是推理为主。美团除采购昇腾、寒武纪算力卡外,一级市场还投资了沐曦、摩尔线程、紫光展锐等国产芯片企业,构建了多路线国产算力储备。
2
【#美团发布万亿级参数大模型#】#美团大模型调用量已跻身全球前三#6月30日,@美团 发文宣布,正式发布新一代万亿参数大模型LongCat-2.0,并将对外开源。正式版发布前,LongCat-2.0预览版本已跻身OpenRouter全球大模型调用量前三,月调用量在Hermes、ClaudeCode 和OpenClaw分列全球第一、第二和第三位,成为最受全球Agent开发者欢迎的模型之一。据文章介绍,LongCat-2.0是业界首个在五万卡国产算力集群上完成全流程训练与推理的万亿参数模型,总参数量达1.6T。该模型从零开始预训练,原生支持1M超长上下文,其核心设计目标是让模型在真实的Agentic Coding任务中,更高效、更稳定地完成代码理解、生成与执行。在国模国芯全栈协同方面,团队从稳定性、正确性和效率三方面攻克国产算力训练难题,最终实现稳态日吞吐超过1T tokens/day。LongCat-2.0验证了美团已具备在国产算力集群上进行大规模模型训练的能力,并让万亿参数模型能够在真实任务中稳定运行。在架构与评测方面,LongCat-2.0采用了稀疏注意力机制和多专家融合(MOPD)架构,在处理100万Token超长上下文时依然保持精准的信息定位与理解能力。在内测的真实工作场景中,LongCat-2.0展现出了可靠的“工作伙伴”能力,不仅能实现旧版代码库的迁移重构、从一句话生成可运行的完整应用或3D演示,还能构建“AI小说工厂”,将创意写作升级为自动化内容流水线,通过Web面板实时监控生成进度及质量状态,实现持续稳定的连载输出。各位网友,您怎么看?@东方财经
全部
来源
来源
内容由AI生成
0
0
0评论
当前文章无评论,是时候发表评论了
提示信息
取消
确认
评论举报
最新文章
热门文章
-
又学到了,暑期旅行的15个隐藏妙招,学会可太省心了!444 114 -
网龄十年,为何有人月领30GB,有人只有1GB?59 137 -
罗永浩怒斥电视机厂商:不毁灭没天理!153 498 -
评论有奖|这几件夏季洗护小事全网愣是争了好几年,今天一次性说清楚148 377 -
快把随手买的套套扔掉!赤尾这三款王炸,解锁情侣完美亲密体验226 143
已收藏
去我的收藏夹