这是一次面向个人AI开发者的硬核设备验证。当主流工作站因显存瓶颈卡在120B模型加载环节,Ascent GX10用8秒完成加载、35 tokens/秒持续输出,揭示了Blackwell架构与FP4量化协同带来的性能跃迁,为本地大模型部署提供了新解法。
智能速览
Ascent GX10搭载NVIDIA Blackwell GB10,统一内显存128GB,预装完整AI开发工具链
Qwen3 32B单并发测试中,GX10输出9 tokens/秒,约为RTX 5000 Ada(22 tokens/秒)的41%
GPT-o-s 120B测试中,GX10加载仅需8秒,RTX 5000 Ada因32GB显存不足耗时9分钟
同一设备上,120B模型推理速度(35 tokens/秒)反超32B模型(7.5 tokens/秒)达4倍
性能反转源于GB10对FP4格式MoE权重的原生硬件加速,非通用算力堆砌
桌面级设备实现专业级大模型推理,填补个人开发者与云端之间的关键能力断层
精华内容
算力数字容易被高估,但真实模型加载时间与推理吞吐不会说谎。当一台桌面设备在120B模型场景下碾压专业工作站,背后是架构、量化与软件栈的深度咬合。
硬件底座
Ascent GX10采用NVIDIA Blackwell架构GB10芯片,配备128GB统一内存带宽,彻底取消CPU-GPU间数据搬运瓶颈。相比RTX 5000 Ada的32GB显存+PCIe带宽限制,GX10的内存池可一次性加载65GB以上的GPT-o-s 120B模型权重,避免分片加载与内存交换带来的延迟。
系统预装DGX OS,集成VS Code、Ollama、Comfy UI及LLaMA Factory等工具,并附带标准化部署指南与耗时预估,降低本地AI环境搭建门槛。
整机尺寸为标准ATX机箱规格,无需专用机房或额外散热改造,适配普通办公桌面环境。
32B模型表现
在Qwen3 32B单并发推理测试中,GX10输出稳定在9 tokens/秒,接近人类默读节奏;RTX 5000 Ada达22 tokens/秒,领先144%。
进入4并发压力测试后,GX10平均输出降至7.5 tokens/秒,RTX 5000 Ada为9.9 tokens/秒,差距收窄至24%,说明其多任务调度与内存带宽管理能力具备较强韧性。
该轮结果印证:在中小规模模型场景下,传统高端显卡仍具吞吐优势,GX10尚未展现颠覆性价值。
120B模型反转
GPT-o-s 120B模型实测中,GX10从启动到首次token输出仅耗时8秒;RTX 5000 Ada因显存不足,需将部分权重卸载至系统内存,加载耗时达540秒——相差67.5倍。
推理阶段,GX10稳定输出35 tokens/秒,RTX 5000 Ada为13 tokens/秒,前者快2.7倍。
更关键的是,在GX10上运行120B模型的响应速度,比运行同台设备上的32B模型高出4倍,打破‘模型越大越慢’的常规认知,指向特定技术路径的优化红利。
架构级解法
性能反转根源在于GPT-o-s采用MoE结构,并将专家权重以FP4格式量化后进行后训练;而Blackwell GB10是首款支持FP4张量核心的消费级GPU,可直接执行FP4矩阵乘法,免去格式转换开销。
实测显示,FP4权重在GX10上激活率超92%,推理延迟降低38%;而在Ada架构显卡上,FP4需先解压为FP16再计算,额外引入17ms平均延迟。
这种软硬协同并非通用加速,而是针对特定模型结构与精度策略的深度适配,凸显专业级AI工作站向垂直场景收敛的趋势。
Ascent GX10的价值不在于参数表上的1000 TOPS,而在于它让120B模型真正‘可用’——从加载到响应全程可控、可预测、可复现。对于需要本地调试、数据不出域、快速迭代的小团队而言,这台设备缩短的不仅是等待时间,更是从想法到验证的整个闭环周期。当更多模型开始拥抱FP4+MoE路线,这类架构优先的设计会否成为下一代AI工作站的标准范式?