当前位置:
AIGC文章详情

摩尔线程发布TensorFlow-MUSA v1.5:你司的推荐系统可能真能搬上国产卡了,但先算清这三笔账

源自29位全网作者

08-24 15:14

8月21日,摩尔线程发布了TensorFlow-MUSA v1.5。这是面向其MUSA架构GPU的TensorFlow插件,官方定位很直接:把MUSA设备注册为TF原生设备,开发者就能在摩尔线程的GPU上直接跑AI模型的训练和推理,不用修改原有模型代码。知乎如果你司的推荐、搜索、广告(搜广推)系统还跑在TensorFlow上,这次发布值得停下来看一眼——官方说得很明确,本次版本重点针对TensorFlow应用最广泛的搜索、广告、推荐核心场景做了深度优化。

但先别急着兴奋,有三笔账要算清楚。

为什么是TF,为什么是搜广推

在大厂做过算法的都懂这种尴尬:学术界早就PyTorch一统天下了,工业界的推荐系统却还有大量TensorFlow在跑。知乎问题「2026年,做深度学习研发还有人用TensorFlow吗」下面,回答很真实:学术界发论文肯定是torch一统天下,工业界体感还是TF,以及各家围绕自家业务封装的各种TF变体。知乎存量比想象中还大:TF的企业市场份额38%、25000多家公司在用,但顶级会议论文里用TF的只剩约15%。知乎而国内搜广推业务长期高度依赖TensorFlow等海外深度学习生态,向国产算力迁移时,框架兼容性不足、算子完备性欠缺、迁移成本较高,是常见的几类问题。知乎这正是TF-MUSA瞄准的存量:让这些团队用PyTorch重写模型不现实,但如果TF能直接跑在国产卡上,逻辑就成立了。

对摩尔线程自己来说,这一步也是连贯打法。MUSA生态本质上是一套贴着CUDA做的软件栈,80万注册开发者已经完成了生态的第一次迁徙。36氪此前Torch-MUSA、SGLang-MUSA、vLLM-MUSA陆续落地,这次TF-MUSA补上的是搜广推这块最大的存量资产。知乎

摩尔线程发布TensorFlow-MUSA v1.5:你司的推荐系统可能真能搬上国产卡了,但先算清这三笔账

而且这次不是烧钱换吆喝。摩尔线程2026年上半年营收17.36亿元,同比大幅增长147.42%,已超2025年全年营收,毛利总额9.89亿元,同比增长103.78%。小红书2026年一季度归母净利润0.29亿元,是公司成立以来第一次单季盈利。36氪国产GPU的竞争已经从信创替补的叙事,走到了抢真实大客户订单的阶段,而TF-MUSA瞄准的,正是这批客户推荐系统的训推场景。

摩尔线程发布TensorFlow-MUSA v1.5:你司的推荐系统可能真能搬上国产卡了,但先算清这三笔账

这次发了什么

具体拆开看:

  • 支持TF 2.6.1和2.15.1两个版本,配合MUSA SDK 4.3.5或5.1.0使用,GitHub开源,同时提供预构建镜像;

  • 全面兼容Wide&Deep、DeepFM、DCN、DIN、MMoE等经典模型,以及Wukong、RankMixer、OneTrans、TokenMixerLarge等前沿新架构模型。知乎

  • 优化手段包括BF16/TF32精度、多流执行、算子融合与图优化、XLA编译。

这份模型名单值得多看两眼。WDL、DeepFM、DIN、MMoE是经典搜广推模型的底座,Wukong、RankMixer、OneTrans、TokenMixerLarge则是近两年新一代大规模推荐架构的名字——清单指向谁,很清楚。

三笔账

第一笔,版本账。 说的是支持TF,实际只支持两个版本:2.6.1和2.15.1。而且官方把话说得很明白:鉴于TensorFlow 2.15.1之后版本的功能增量有限,且移除了tf.estimator等早期特性,摩尔线程后续将主要维护TensorFlow 2.15.1版本。知乎而TF主线今年3月已经发到了2.21,发布说明里甚至写了一句不寻常的话:建议新生成式AI项目优先选择Keras 3、JAX或PyTorch。知乎所以现实是:你司TF版本落在2.6到2.15区间,这波红利才吃得到;还在跑1.x老代码的,完全不在这次覆盖范围里。第一步不是研究卡,是先查版本号。

第二笔,「不改代码」的边界账。 MUSA注册为原生设备,意味着官方清单里那些标准模型的训练推理代码确实可以不动。但「不改」不等于「不测」:模型里有自定义算子、自研量化工具,或者后面还挂着TFLite移动端链路的,都不在标准模型的承诺范围内,每一处都要单独回归。搜广推系统通常还深度耦合自家特征处理库,这部分风险只有自己评估过才知道。

第三笔,性能账。 官方给出的MTT S5000实测数据:以前沿新架构模型TokenMixerLarge为例,单步训练耗时138.048ms,相较国际主流GPU加速比达到1.81倍。知乎官方同时表示,在TokenMixerLarge等前沿搜广推模型的训练中,训练吞吐相较国际主流GPU可提升1.5倍至1.85倍。两个提醒:其一,这是厂商实测数据,对比对象只写了「国际主流GPU」,没有点名具体型号;其二,作为参照,公开测评里torch.compile在标准基准上带来的提速一般是30-60%,TF的XLA在同等条件下为20-40%。知乎方向可以乐观,做容量规划时请用自家业务实测的数字。

摩尔线程发布TensorFlow-MUSA v1.5:你司的推荐系统可能真能搬上国产卡了,但先算清这三笔账

谁该搬,谁该等

三笔账算完,可以对号入座:

  • TF版本在2.6-2.15、且有信创或国产算力指标的团队:值得先动手。拉一个预构建镜像,把DeepFM、DIN、MMoE这类基准模型跑起来,先拿到自家模型的实测报告,成本最多几天。

  • TF 1.x老系统:先别盯MUSA,把升级到2.15.1或者技术债清偿排上日程——连Google自己都要靠专门的AI智能体系统来加速内部TF 1.x代码的迁移。知乎

  • 已经用上TF 2.16+或Keras 3的代码:观望。官方策略冻结在2.15.1,短期内增量支持有限。

  • 学术研究和新项目方向:Torch-MUSA更对口,不必绕道。

摩尔线程自身的基本面也要看一眼。亏损收窄是真的,但公司扣非归母净利润仍亏1.51亿元,利润口径要拆开看。小红书业务面上,MTT S5000智算集群已实现规模化销售。小红书下半年供货和集群落地的持续性,会决定它对生态投入的持续性。

摩尔线程发布TensorFlow-MUSA v1.5:你司的推荐系统可能真能搬上国产卡了,但先算清这三笔账

值得继续盯的信号

准备动手的团队,建议把这几个信号盯起来再开工:

  1. tensorflow-musa在GitHub上的算子覆盖度和issue响应速度——框架生态项目最怕热乎三个月;

  2. 是否出现第三方(非摩尔线程)的S5000搜广推基准测试数据;

  3. 其他国产卡厂商是否跟进TF支持——只有一家支持的话,绑定风险是真实存在的;

  4. 摩尔线程下半年的供货与大客户落地进展。

对TF现在的处境,Reddit上有个流传很广的比喻:TensorFlow是「ML界的COBOL」,没人拿它写新系统,但运行在无数核心基础设施上。知乎对握着这份存量资产的团队来说,国产卡第一次开出了一扇写着「不用重写」的门。要不要走进去,先把上面三笔账算清楚。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章