本地配置300亿参数MoE模型,英伟达的AI PC又往前进了一步

2026-08-12 14:42:21 0点赞 2收藏 0评论

NVIDIA在官方博客悄然更新了Local AI PC信息,核心是围绕 RTX PC、DGX Spark、DGX Station 等客户端平台加速开源 AI 模型与智能体。无论是你手中的GeForce RTX GPU,还是计划未来购置的DGX Spark,或者AI工作站,都将成为此次更新的直接受益者。现在我们不妨花点时间,看看这次更新中有什么是值得关注的。

本地配置300亿参数MoE模型,英伟达的AI PC又往前进了一步

300亿参数MoE本地部署

重头戏自然就是NVIDIA自研开源新模型Nemotron 3.5 Lightning。这是一套拥有300 亿参数的 MoE混合专家开放权重模型,转为本地智能体设计,可在大型多智能体系统中承担特定任务。

Nemotron 3.5 Lightning可以做到token 生成速度最高达同级开源模型的4倍,智能体任务整体完成时间加快约30%。因为权重开放,用户可以微调它来写特定风格的邮件报告、掌握摄影/游戏/3D 设计等专业知识,或遵循特定的编码规范,从而驱动更个性化的本地智能体体验,比如邮件日历助手、智能家居代理、编程搭档。

本地配置300亿参数MoE模型,英伟达的AI PC又往前进了一步

目前,英伟达与 vLLM、Ollama、llama.cpp、LM Studio 合作提供本地部署体验,包括NVFP4 和 GGUF 两种格式,其中Unsloth 首日即提供优化量化版本Unsloth Desktop,这是首个既能本地训练又能本地运行AI模型全开源桌面端应用,集成推理、图像/视频扩散、微调、智能体、网页研究和代码执行,这是非常厉害的。

这套大模型覆盖的范围很广,从 NVIDIA RTX PC、DGX Spark 和 OEM GB10 系统、Jetson,向上扩展到 RTX PRO 工作站、DGX Station、GB300 桌面系统乃至数据中心和云端。可以这么理解,只要是Blackwell GPU,都有机会装载这套系统。宏碁、华硕、戴尔、惠普、联想、微星等均有 Blackwell 系统在售。

本地配置300亿参数MoE模型,英伟达的AI PC又往前进了一步

另外,NVIDIA还同步发布了NeMo Switchyard。这是一个开源路由库,可根据准确性、速度和成本自动把智能体工作流的每一步分配给最合适的模型,内部基准显示它能在保持前沿级任务完成率的同时,把成本降到单用Opus 4.8的约三分之一。

另一个同样值得关注的300亿参数模型是来自Meta的Muse Glimmer,其拥有120K+ 上下文窗口,专为编码和本地智能体打造。NVIDIA宣布RTX GPU已经对其进行了优化,包括GeForce RTX PC、DGX Spark、DGX Station 和 Jetson,其中在GeForce RTX 5090上可以跑出200+ token/s的性能表现。

本地配置300亿参数MoE模型,英伟达的AI PC又往前进了一步

Meta Muse Glimmer支持NemoClaw 构建智能体、用 NeMo Automodel 在本地微调,数据完全留在本机。而适用场景包括私有文件处理、凭据/密钥本地处理、多步骤任务和长时工作流。另外llama.cpp还支持DFlash推测解码加速,GeForce RTX 5090上解码速度最高达基准的 3.1 倍,相当于 233 token/s。

顺带一提,DFlash 推测解码是一种大语言模型推理无损加速技术,由加州大学圣地亚哥分校Z Lab 团队于 2026 年 2 月提出,核心思想是用块扩散模型做草稿、用大模型做验证。因此也可以看到RTX PC支持的速度是非常快的。

本地视频生成更猛了

另一个更新是在于本地视频生成更厉害了。NVIDIA将LTX开源视频生成模型升级到了LTX-2.5版本,同样针对RTX GPU、DGX Spark和DGX Station优化,包括新增多镜头(multishot)支持,跨剪辑保持一致性。同事,新的扩散视频解码器提升画质、减少伪影。

LTX-2.5还引入了新的提示词增强器,采用Gemma4 E2B加定制Gemma4 12B文本编码器,提示遵循度大幅提升。

本地配置300亿参数MoE模型,英伟达的AI PC又往前进了一步

另外LTX-2.5本身也提升了处理性能。在NVIDIA RTX 6000 PRO上性能提升最高20%、显存节省40%,提供NVFP4、FastVideo及开箱即用的ComfyUI工作流。

DGX Spark平台还增加了NVIDIA Sync Cluster Assistant应用,可自动发现并把多台 DGX Spark 组建成高速集群。实现方式是通过ConnectX-7端口互联,自动配置网络、跨节点调度负载并监控健康状况,无需手动组网。这样像GLM 5.2、DeepSeek V4 Flash这类大模型就能在桌面集群上运行。

本地配置300亿参数MoE模型,英伟达的AI PC又往前进了一步

而在这个月晚些时候,DGX Spark还将获得原生ARM64 Linux版Google Chrome支持,可以通过DGX Dashboard完成一件安装,并直接同步账号和完整的生态扩展。新的Sync Resource Monitor提供单机或整个集群CPU/GPU的实时与历史用量视图,无需额外监控软件,让DGX Spark的系统体验更为完善。

NVIDIA这轮更新主要是把AI PC从单纯跑模型,推进到在本地常驻运行智能体的阶段,依靠NVFP4/GGUF等格式和llama.cpp、vLLM、ComfyUI的优化把开源模型推理速度翻倍提升,靠DGX Spark集群组网和Sync工具降低多机部署门槛,再用Nemotron 3.5 Lightning 这类开放权重模型补上可定制和可微调环节,从而让整个RTX/DGX客户端平台变得更为完整。

本地配置300亿参数MoE模型,英伟达的AI PC又往前进了一步
展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
最新文章 热门文章
2
扫一下,分享更方便,购买更轻松