新华三LinSeer MegaCube体验:本地部署千亿参数大模型+OpenClaw全精通

2026-03-20 22:15:13 1点赞 13收藏 3评论

在春节前我们体验了NVIDIA DGX Spark Founders Edition这一台小巧但有力的桌面AI设备,GB10芯片加上128GB统一内存的设计确实让我们印象深刻。而和GeForce显卡一样,NVIDIA的合作伙伴们也在GB10芯片的基础上,结合各自的优势,推出了各种不一样的Spark,比如说我们今天要体验的,来自新华三的LinSeer MegaCube。

新华三LinSeer MegaCube体验:本地部署千亿参数大模型+OpenClaw全精通

视频LinSeer MegaCube介绍硬件组成

新华三LinSeer MegaCube体验:本地部署千亿参数大模型+OpenClaw全精通新华三LinSeer MegaCube体验:本地部署千亿参数大模型+OpenClaw全精通

我们以前体验的产品,大多是属于面向个人消费者的品牌和系列,而这次就有点不一样了,新华三是一个面向政企用户的公司。作为业内数字化及AI解决方案领导者,新华三的业务涉及商用服务器、存储和网络设备,而他们这次推出LinSeer MegaCube则是自家 “AI in ALL”战略的自然延伸——也就是在提供云服务的同时,也要将强劲的AI算力下沉至终端一侧。

新华三LinSeer MegaCube体验:本地部署千亿参数大模型+OpenClaw全精通

让我们聚焦设备本身,从尺寸上来说,LinSeer MegaCube和DGX Spark Founders Edition差不多,相当迷你,配色都是金色,只不过MegaCube的金色更深一点。外观方面,前面说到新华三的业务是To B为主,所以MegaCube的风格显然偏向于商用设备。

新华三LinSeer MegaCube体验:本地部署千亿参数大模型+OpenClaw全精通新华三LinSeer MegaCube体验:本地部署千亿参数大模型+OpenClaw全精通新华三LinSeer MegaCube体验:本地部署千亿参数大模型+OpenClaw全精通新华三LinSeer MegaCube体验:本地部署千亿参数大模型+OpenClaw全精通

接口方面, MegaCube和DGX Spark完全一样。4个USB-C,其中1个用于供电,剩下3个是全功能的,也支持DP输出。一个HDMI 2.1a接口。一个万兆以太网接口。还有两个QSFP光模块口连着200G的ConnectX-7网卡,两台MegaCube可以用DAC线直接连接,而从GB10到ConnectX网卡的连接规格是PCIe 5.0 x8。

新华三LinSeer MegaCube体验:本地部署千亿参数大模型+OpenClaw全精通

这里多说一句,因为新华三也有交换机方面的业务,所以他们在 MegaCube互联上也有自己的一套硬件方案,如果有需要的话可以直接打包解决。

软件部分

LinSeer MegaCube用的系统是DGX OS,是NVIDIA在Ubuntu 24.04上修改而来的。预装好了驱动和一系列软件。同时,新华三为 MegaCube准备了图灵智算平台,这是针对国内AI开发生态所做的一整套方案,也是 MegaCube有别于其他几款GB10设备的最大特色。

图灵智算平台由几个部分组成,首先是图灵模镜(https://nim.turingcm.com),作为NVIDIA授权的三家中国NIM合作伙伴之一,你可以在上面下载很多NVIDIA NGC目录同款的模型,比如说GLM-5和Qwen3 Coder Next,图灵模镜里都有。

新华三LinSeer MegaCube体验:本地部署千亿参数大模型+OpenClaw全精通

NVIDIA NIM很大一个优势就是隐去了很多设置的细节,开机即用,不需要在推理框架这些方面忙活。用户直接用docker部署就行。网页上也提供了对应的指南。相比从NVIDIA NGC目录中拉取,图灵模镜由于服务器在国内,我们显然能获得一个更稳定且速度更快的体验。对于部分企业来说,图灵模镜还解决了合规性问题,可以让大家放心用。

图灵智算平台的第二大特色便是图灵小镇,或者说是算力市场。它提供了来自云端GPU集群的澎湃算力。MegaCube做不到的事情,比如说训练模型,可以在算力平台充值图灵币,让更高性能的计算卡去做。

新华三LinSeer MegaCube体验:本地部署千亿参数大模型+OpenClaw全精通

总的来说,MegaCube和图灵小镇主打的是一个相互配合的关系,桌面级AI超算、预装好的开发环境和云服务的有机结合,讲的就是一个开机即用,满足不同算力场景需求。更进一步地,基于 MegaCube 这种开机即用的特性,新华三为不同的行业带来了灵活运用AI的方案。比如说针对教育行业的AIGC实训室计划,在这个构想里面,每个人都可以在自己的MegaCube 上进行模型部署和AIGC学习,而不用排队共享服务器,算力的独享可以让学习的过程提速。

同时,在《国务院关于深入实施 “人工智能 +” 行动的意见》、《关于加快招标投标领域人工智能推广应用的实施意见》等重要文件先后发布,国家深入推进人工智能战略如火如荼之时,新华三也积极响应,针对政企单位常见的招投标场景,基于MegaCube打造了开箱即用的招投标监管一体机方案。以单台MegaCube为例,它可在10-15分钟内完成10份标书文件检测。在招标文件审查这块速度够快之余,围串标识别的准确率还足够高。更重要的是,得益于足够强的设备端算力,MegaCube可以在不联网,物理隔离的情况下运行检测,符合招标方的合规要求,是利用人工智能发展新质生产力的有力支持。

单机体验

凭借GB10超级芯片和128GB统一内存的能力,LinSeer MegaCube单机就可以对高达200B参数的模型进行推理,以及微调70B参数的模型。

ComfyUI创作

还是先来看看最常用的创作工具ComfyUI吧。目前,ComfyUI还没有针对GB10超级芯片出一个整合好的版本,因此我们就只能手动安装了。实际上这也不麻烦,照着官方文档那样,先创建虚拟环境,装好pytorch,把ComfyUI的仓库克隆下来,安装好依赖就可以了。

从终端的启动信息可以看到ComfyUI已经支持NVFP4、FP8等格式了。NVFP4是Blackwell架构引入的一种更加高效的新格式,显存占用更低。如果你看见CUDA报错也不用担心,重新编译一次comfy-kitchen就好。

新华三LinSeer MegaCube体验:本地部署千亿参数大模型+OpenClaw全精通

ComfyUI的用法就不用特意介绍一遍了。重点还是NVFP4模型带来的速度提升,比如Z-Image Turbo、FLUX.2这些图片生成模型,NVFP4版本的生成时间比BF16少4秒多,同时图片质量其实差不多。像LTX-2这种音视频模型节省的时间就更多了,同样的设置,NVFP4版本能在2分钟内完成,BF16要花3分钟。

新华三LinSeer MegaCube体验:本地部署千亿参数大模型+OpenClaw全精通新华三LinSeer MegaCube体验:本地部署千亿参数大模型+OpenClaw全精通新华三LinSeer MegaCube体验:本地部署千亿参数大模型+OpenClaw全精通新华三LinSeer MegaCube体验:本地部署千亿参数大模型+OpenClaw全精通

LLM运行

基于llama.cpp的LM Studio

在LinSeer MegaCube上运行LLM有很多种方法,最简单的莫过于LM Studio这款llama.cpp的应用。在这里我们正好可以试一试阶跃星辰不久前推出的Step 3.5 Flash。根据官方的说明,Step 3.5 Flash的int4 gguf模型可以说正好是为LinSeer MegaCube这类拥有128GB统一内存的设备而设的。把模型导入到LM Studio非常简单,改一下模型目录就完事了,剩下的都是点点鼠标的操作,不需要用到终端。

新华三LinSeer MegaCube体验:本地部署千亿参数大模型+OpenClaw全精通

vLLM和TensorRT

接下来我们会用到vLLM和TensorRT-LLM,前者不用多说,非常主流,后者则是NVIDIA自家的推理框架,专为NVIDIA GPU打造。和前面的LM Studio相比,它们的操作是有点复杂,基本上是终端不离手。

不过有一件好事就是,以上两个框架都在NVIDIA NGC中提供了docker镜像,直接拉下来就能用,至少免去了安装这一步骤。而NVIDIA提供的Playbook里面提供了非常详细的指南,如果你的网络比较通畅,能够直连Hugging Face,那直接复制粘贴这堆命令下来运行也不是什么问题。不过我更喜欢从魔搭社区下载模型,然后把这些命令换成脚本,这样省事很多。

新华三LinSeer MegaCube体验:本地部署千亿参数大模型+OpenClaw全精通

具体的性能测试方面,我们选择比较成熟的Qwen 3 30B A3B系列。在这里我们可以看到Blackwell架构新增的FP4精度所带来的效率提升。同样的参数设置下,NVFP4量化比FP8、BF16这些格式拥有更高的吞吐量,同时延迟更低。

新华三LinSeer MegaCube体验:本地部署千亿参数大模型+OpenClaw全精通

如果你使用TensorRT-LLM这一款专为NVIDIA GPU优化的框架,你能发现效率还能进一步提升。从测试数据中你可以看到,随着并发数的提升,TensorRT-LLM的优势也逐渐增大。一般来说,TensorRT-LLM更适合实际部署,毕竟它的性能更好,且稳定。

新华三LinSeer MegaCube体验:本地部署千亿参数大模型+OpenClaw全精通

而想要体验最新推出的模型,则还是用vLLM这种更新频率比较高的框架会更好。比如新鲜出炉的Qwen3.5-122B-A10B,根据vLLM Recipes的指南,我们使用了vLLM Nightly版本去运行它。当然,运行的版本也是社区的NVFP4量化版。虽然部分启动参数相比于上面的测试有所更改,但是从输出速度来看,MegaCube的表现确实不错,单用户使用时能达到35tok/s以上。

新华三LinSeer MegaCube体验:本地部署千亿参数大模型+OpenClaw全精通

真·本地龙虾养殖场

自年初以来,OpenClaw这只赛博龙虾的热度可以说是节节攀升。而目前大部分OpenClaw的本体虽说是装在本地,但AI算力还是要云端来提供——毕竟普通PC的显存容量相对较小,无法很好地一个让OpenClaw能够充分发挥的大模型。不过对于拥有128GB统一内存的MegaCube来说,开一个少烧点云端Token的“真·本地龙虾养殖场”是完全有可能的!

目前新华三MegaCube已经支持预装OpenClaw + 本地部署Qwen3.5-122B,可以开箱即用,这十分适合没有技术基础但又想体验前沿技术的用户。而我们这部分是在前面测试的基础上进一步扩展的,适合想要自己设置模型的AI爱好者。

新华三LinSeer MegaCube体验:本地部署千亿参数大模型+OpenClaw全精通

首先我们还是先让模型跑起来,也就是继续用vLLM Nightly运行Qwen3.5-122B-A10B-NVFP4。不过因为OpenClaw需要调用工具,而且使用场景偏向单人,因此我们还根据vLLM Recipes调整了部分参数,比如启用了MTP-1推测解码。附带一提,如果想要OpenClaw的响应速度快一点,可以切换到更小参数量的模型,比如在视频里面,我们用的是Qwen3.5-35B-A3B-NVFP4。

新华三LinSeer MegaCube体验:本地部署千亿参数大模型+OpenClaw全精通

相比调整vLLM参数,安装OpenClaw本体和飞书插件倒是相当简单。在这里先假定你没有在MegaCube上配置Node.js,直接使用OpenClaw的一键安装命令就能完成所有的步骤,之后快进到首次配置也就是OpenClaw onboard了。

新华三LinSeer MegaCube体验:本地部署千亿参数大模型+OpenClaw全精通

在OpenClaw onboard中提供了vLLM这一模型提供商,由于是本地运行的模型,API Key这个随便填也无所谓,重点还是把模型的名字写对。至于飞书插件的安装,现在已经很简单了,甚至能通过手机**的方式,一键创建连接OpenClaw的飞书机器人,这点就还请参照飞书团队的文档吧。

新华三LinSeer MegaCube体验:本地部署千亿参数大模型+OpenClaw全精通新华三LinSeer MegaCube体验:本地部署千亿参数大模型+OpenClaw全精通

飞书插件提供了手机**一键配置

安装完成后,怎么用OpenClaw就交由大家的自行发挥了。本地龙虾有几个好处:第一自然是费用的问题,单台MegaCube运行120B级别的模型已经能做到相当多的事情,你完全可以将一些日常事务交给本地模型,从而在云端API这块少花点钱;第二便是来自于自由度,在满足软硬件要求的前提下,你想在MegaCube上跑什么开源模型都可以,无论是国内的Qwen、MiniMax,还是国外的gpt-oss、Nemotron,也就几行启动参数的事;第三就是大家常常念叨的隐私问题了,MegaCube的运算全部在本地进行,拔掉网线并不会影响其核心功能——当然,这是略微激进点的举例,为了让网页搜索、飞书机器人等插件保持运作,非必要的情况下还是保持联网吧。

新华三LinSeer MegaCube体验:本地部署千亿参数大模型+OpenClaw全精通

最后不得不提的一点是,MegaCube运行时十分安静。就算它放在离我30cm不到的地方,在GPU占用率保持95%的时候,我仍然难以察觉其风扇噪音。考虑到OpenClaw是一款全天候运行的AI助手应用,MegaCube的这种“无感”设计相当重要。

双机并行

前面说到了LinSeer MegaCube可以多机堆叠。2台 MegaCube可以直接拿DAC线互联,实现256GB的统一内存。这时候,它们能跑的模型就更多了,得益于RoCE无损网络级联,两台最高可支持 405B 参数的模型推理。如果借助新华三S9855-40B这样的高性能 200G交换机,多台MegaCube甚至能运行671B级别的模型。

新华三LinSeer MegaCube体验:本地部署千亿参数大模型+OpenClaw全精通

当然,我们还是从2台互联开始做起。用DAC线把2台LinSeer MegaCube连起来只是第一步。在这里可以参考Playbook的做法,先给2台LinSeer MegaCube分配好IP地址,设置SSH无密码登录。多说一句,可以在这里顺便设置了个端口转发,这样就可以在主机上访问到第二台机的DGX Dashboard。

新华三LinSeer MegaCube体验:本地部署千亿参数大模型+OpenClaw全精通

vLLM和Tensor-LLM都支持多机互联,其中vLLM用的分布式计算框架是Ray,Tensor-LLM则是OpenMPI。以TensorRT LLM为例,因为它要利用OpenMPI进行分布式运算,所以需要先创建一份host表,把2台机器的IP都写进去。然后再在单机运行的脚本上加入一堆和互联有关的环境变量,以及一个启动SSH服务器的脚本。把MPI的host表复制到主机的容器后,接下来的操作就和单机运行时无异,只是运行的参数有一点修改,你可以看到在trtllm-serve前面加了mpirun、trtllm-llmapi-launch这些命令,都是跟多机并联有关的。

新华三LinSeer MegaCube体验:本地部署千亿参数大模型+OpenClaw全精通

这里我们展示的是Playbook同款的Tensor-LLM运行Qwen-3-235B-A22B-NVFP4。这个模型在每台MegaCube上大约占了80GB的内存,算下来一共是160GB左右,剩余的空间称得上相当充裕。至于速度方面,这吐字速度也是不错的。如果启用Eagle-3推测解码,速度还能更快一点。

新华三LinSeer MegaCube体验:本地部署千亿参数大模型+OpenClaw全精通

值得一提的是,上面提到的招投标一体机方案还支持双机并行的设置。根据新华三提供的数据,双机运行检测应用时,7-9分钟即可核查单文件46个检测点,且准确率远高于业界整体水平。这种解决方案以及工作效率提升可以说是人工智能助力传统场景业务转型,贯彻落实国家关于人工智能发展战略相关精神的优秀例证。而除了招投标外,目前需要AI赋能的场景可以说是只多不少,相信新华三在未来还会基于MegaCube带来更多适合政企单位使用,合规且高效的应用。

总结

新华三LinSeer MegaCube体验:本地部署千亿参数大模型+OpenClaw全精通

从上面的操作可以看出,LinSeer MegaCube体积虽小,但可以运行的模型却很大,一些平时可能要三、四张显卡才能跑得起来的模型,也许一台MegaCube就能解决,实在不行,还能再来一台。得益于先进的Blackwell架构和充分的社区支持,MegaCube可以让你不错过AI领域的任何热点,无论是体验新模型还是安装像OpenClaw这类的AI工具,这台小机器也不在话下。同时,在软件层面, MegaCube也是十分出彩,除了NVIDIA提供的一系列手把手教学的Playbook外,新华三的图灵智算平台更是这台小机器的坚实后盾,云端的图灵小镇和本地的MeagCube相配合,可让算力不再成为限制。不管是作为AI教学设备,还是作为AI开发用机,MegaCube都已经准备完毕,可以随时出发。

超能网**

**关注我们,浏览热门硬件评测

随时查看最新天梯榜

展开 收起
3评论

  • 精彩
  • 最新
  • 能说一下一台多少钱呢?

    校验提示文案

    提交
    3~4万

    校验提示文案

    提交
    收起所有回复
  • 这是新华社的下属企业吗

    校验提示文案

    提交
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
最新文章 热门文章
13
扫一下,分享更方便,购买更轻松