国产GPU厂商曦望发布新品启望S3,其选择了一条专注于大模型推理的独特路线,通过系统级重构,实现了单位Token推理成本较上代下降约90%的突破。这为解决当前AI应用落地的高算力成本难题,提供了极具竞争力的硬件方案,值得行业关注。
智能速览
曦望发布新一代推理GPU芯片启望S3,专为推理场景深度定制。
芯片采用All-in推理路线,不再追求峰值训练性能,聚焦单位Token成本。
启望S3单位Token推理成本较上一代产品下降约90%。
国内首款采用LPDDR6显存方案的GPU,显存容量提升4倍。
支持FP16到FP4多精度切换,适配MoE与长上下文模型推理。
精华内容
启望S3的突破并非偶然,而是源于其对GPU商业价值的重新思考。当推理成为主要算力消耗场景,如何降低单位Token的真实成本,成为了芯片设计的核心命题。
推理专用新路线
杭州曦望在首届GPU Summit上发布了全新推理GPU芯片启望S3。与当前国内流行的“训推一体GPU”路线不同,曦望选择了All-in推理效率与单位成本的“反常识”路径。曦望联席CEO王勇指出,训练是一次性的技术登高,而推理是持续的算力交付。当推理成为主要消耗场景后,GPU的商业价值不再取决于参数指标,而是单位Token的真实成本,这一判断直接决定了启望S3的设计方向。
成本骤降90%的背后
为实现成本的大幅降低,启望S3在算力结构、存储体系和互联方式上进行了系统级重构。它支持从FP16到FP4的多精度灵活切换,在保证模型效果的前提下,最大化释放低精度推理效率,更贴合MoE和长上下文模型的实际需求。
尤为关键的是,启望S3采用了LPDDR6显存方案,而非依赖国外供应链的HBM。作为国内首款采用该方案的芯片,其显存容量较上一代产品提升了4倍,有效避免了被“卡脖子”的风险。
实测性能与行业影响
在DeepSeek V3/R1等主流大模型的推理场景中,启望S3单位Token推理成本较上一代产品下降约90%。曦望管理层强调,这一指标已具备工程可复现性,并非单点实验室数据。
这种1到2个数量级的成本节约,为AI Agent等应用的普及解除了算力枷锁。启望S3的发布,标志着推理卡正在重塑GPU的设计目标,为国产GPU在大模型推理领域开辟了新道路,有望推动行业向更高效、低成本的方向发展。
启望S3的发布,标志着国产GPU正从单纯追赶参数指标,转向深入场景、解决实际痛点的务实创新。这种聚焦真实应用成本的设计哲学,有望重塑大模型推理的市场格局。当推理成本不再是障碍,AI应用的未来将涌现出怎样的可能性?
Bill______
校验提示文案
Bill______
校验提示文案