海光DCU全量适配DeepSeekV4-Flash,首Token延迟低于H20

源自7位全网作者

05-30 16:09

精选参考来源

1
【中国信通院正式启动DeepSeek V4国产化适配测试工作】中国信通院今天宣布,正式启动DeepSeek V4国产化适配测试,推动模型与国产软硬件深度协同、加速产业落地。本次测试依托工信部重点实验室与AISHPerf基准体系开展,覆盖芯片、服务器、一体机、集群、开发工具链、智算平台等全栈AI软硬件产品,聚焦DeepSeek V4全系列模型的推理、微调流程。评测从适配易用性、功能完备性、优化效果、性能、成本五大维度评估,并新增长序列处理、代码能力、智能体调用成功率、任务拆解等专项指标,形成立体化评测体系。DeepSeek V4发布当日已实现多家国产硬件Day-0适配,标志国产AI软硬件进入同频迭代阶段。本次测试将客观验证适配水平,强化国产算力支撑,加快构建自主可控AI生态。DeepSeek V4包含V4-Pro(旗舰版)与V4-Flash(轻量版)双版本,两大版本均原生支持100万Token超长上下文(约75万字),采用自研DSA稀疏注意力机制,百万上下文推理成本降低70%,显存占用减少40%。V4-Pro:总参数达1.6万亿,激活参数49B,主打顶级性能上限,对标GPT-5、Claude Opus等全球顶尖闭源模型,适配复杂推理、代码生成、科研计算等高难度任务。V4-Flash:总参数284B,激活参数13B,主打高效低成本,推理能力接近Pro版,速度更快、价格更低,适合日常交互、内容创作、企业轻量化部署等场景。
2
deepseek是4月24日发布V4的,两个版本,flash和pro。day0能适配的芯片就是华为昇腾、寒武纪。day1宣布适配的是英伟达。除此之外,25日,day1,海光、沐曦、摩尔线程、昆仑芯、平头哥真武、天数智芯根据智源研究院的FlagOS宣布flash版本的全量适配和推理部署。flash版本是比较容易适配的,单卡小集群就能跑,对硬件要求低,所以这些AI芯片入手比较快,但是真正考验人的是pro版本的适配。越快能适配pro版本,才说明1)技术能力强;2)是deepseek的核心朋友圈(能提前抢跑)。我查了下最新的情况,目前能适配Pro的国产芯片有:海光、摩尔线程、壁仞科技。(根据官方号自己宣布的)
全部
来源
内容由AI生成

精选参考来源

1. 【中国信通院正式启动DeepSeek V4国产化适配测试工作】中国信通院今天宣布,正式启动DeepSeek V4国产化适配测试,推动模型与国产软硬件深度协同、加速产业落地。本次测试依托工信部重点实验室与AISHPerf基准体系开展,覆盖芯片、服务器、一体机、集群、开发工具链、智算平台等全栈AI软硬件产品,聚焦DeepSeek V4全系列模型的推理、微调流程。评测从适配易用性、功能完备性、优化效果、性能、成本五大维度评估,并新增长序列处理、代码能力、智能体调用成功率、任务拆解等专项指标,形成立体化评测体系。DeepSeek V4发布当日已实现多家国产硬件Day-0适配,标志国产AI软硬件进入同频迭代阶段。本次测试将客观验证适配水平,强化国产算力支撑,加快构建自主可控AI生态。DeepSeek V4包含V4-Pro(旗舰版)与V4-Flash(轻量版)双版本,两大版本均原生支持100万Token超长上下文(约75万字),采用自研DSA稀疏注意力机制,百万上下文推理成本降低70%,显存占用减少40%。V4-Pro:总参数达1.6万亿,激活参数49B,主打顶级性能上限,对标GPT-5、Claude Opus等全球顶尖闭源模型,适配复杂推理、代码生成、科研计算等高难度任务。V4-Flash:总参数284B,激活参数13B,主打高效低成本,推理能力接近Pro版,速度更快、价格更低,适合日常交互、内容创作、企业轻量化部署等场景。

2. deepseek是4月24日发布V4的,两个版本,flash和pro。day0能适配的芯片就是华为昇腾、寒武纪。day1宣布适配的是英伟达。除此之外,25日,day1,海光、沐曦、摩尔线程、昆仑芯、平头哥真武、天数智芯根据智源研究院的FlagOS宣布flash版本的全量适配和推理部署。flash版本是比较容易适配的,单卡小集群就能跑,对硬件要求低,所以这些AI芯片入手比较快,但是真正考验人的是pro版本的适配。越快能适配pro版本,才说明1)技术能力强;2)是deepseek的核心朋友圈(能提前抢跑)。我查了下最新的情况,目前能适配Pro的国产芯片有:海光、摩尔线程、壁仞科技。(根据官方号自己宣布的)

3. 【DeepSeek V4适配国产芯片!摩尔线程MTT S5000实现Day-0支持】今日,DeepSeek正式上线V4预览版并宣布开源,该模型支持百万字超长上下文处理。摩尔线程联合智源众智FlagOS社区宣布,在旗舰AI训推一体GPU MTT S5000上,完成对DeepSeek-V4-Flash大模型的Day-0极速适配,并实现全量核心算子深度优化与部署支持。DeepSeek-V4-Flash采用MoE架构,总参数284B、激活参数13B,支持百万Token上下文,首次采用FP4+FP8混合精度,对算力芯片提出更高要求。摩尔线程MTT S5000是国内率先原生支持FP8的全功能GPU,搭载硬件级FP8 Tensor Core,相比BF16/FP16可将显存压力降低50%,计算吞吐量翻倍。本次适配由智源FlagOS完成FP8量化,团队聚焦FP8算子与Sparse Attention算子两大关键,通过两大方向实现突破:一是依托FlagTree编译器做精细化shape对齐与矩阵计算加速;二是通过FlagOS-Tune自动搜索最优内核配置,效果超越手工调优。实测显示,开启自动调优后TTFT时延降低16.5%,ITL时延降低39.7%,吞吐量提升65.7%。目前,双方已完成DeepSeek-V4-Flash适配,并正在推进更大规模的DeepSeek-V4-Pro(1.6T)在MTT S5000上的迁移适配。开发者可在魔塔、HuggingFace下载镜像开箱即用。

4. 【#摩尔线程携手智源FlagOS#,为 MTT S5000 GPU 完成 DeepSeek-V4 模型 Day-0 适配】摩尔线程与智源 FlagOS 合作,为 MTT S5000 GPU 实现 DeepSeek-V4-Flash 模型的 Day-0 适配。该模型采用“FP4+FP8”混合精度策略,而 MTT S5000 凭借原生 FP8 支持,能有效降低显存压力,提升计算吞吐。此次适配重点攻克了 FP8 算子和 Sparse Attention 算子。#AI芯片##国产GPU#

5. 海光信息+智源FlagOS,首Token延迟赢了国际巨头

6. 智源FlagOS完成DeepSeek-V4八款芯片Day0适配,覆盖昇腾、海光、摩尔线程等

7. Step 3.5 Flash,和另一个Flash异曲同工啊

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章