Token工厂,小厂的死局|爱分析访谈
并行科技举办并行计算性能优化比赛已经十几年,每年比赛结束,组委会都会复盘做一件事,把比赛中所有参赛队使用的优化技术点汇总之后,可以得到一个最高性能的版本,冠军、亚军、季军基本上是使用了其中技术点数量最多的前几名。
“你看,优化能力不是一招鲜,而是把很多点拼起来,所以算力优化能力会随时间趋同的。谁优化得快,谁就先上到一个层面,但最终大家会追平。”并行科技董事长陈健认为,并行科技真正需要抓住的,不仅是优化能力,更是终端的用户。
并行科技是一家从超算、高性能计算体系里走出来的算力服务商。陈健不把并行科技定义成卖卡的公司,也不把Token工厂简单看成新的云服务生意。
过去十几年,并行科技建立了覆盖全国的算力网——并行算网,以及围绕高校、科研和企业做按需算力服务,积累了数万用户、60多个合作算力中心和几十个行业的应用特征数据。到了大模型时代,这套体系被迁移到推理和Token生产上。
在访谈中,陈健反复强调:“算力生意不是资源业,是服务业。”但这并不意味着资源不重要。相反,在Token工厂这场供给侧淘汰赛里,订单、卡和优化能力缺一不可。小玩家如果没有订单、没有足够的卡,也投不起持续优化的钱,最后很难活下来。

核心观点
Token工厂的胜负取决于订单、卡和优化能力。有订单才能开工,有卡才能产出Token,优化能力决定单位卡的产出效率,三者缺一不可。
长期看,优化能力会趋同,订单和卡是终极门槛。优化是集大成者,推理涉及约30多项技术,但领先优势随时间收窄,最终决定生死的是订单和卡。
小厂不适合做Token工厂。优化能力至少需要每年数千万元的研发投入,卡的成本差异可能达到数倍,账期和供需周期又会持续挤压现金流,小玩家很容易被淘汰。
算力生意的本质不是资源业,而是服务业。服务好客户的业务,才是并行科技一切打法的出发点。
不押注重资产,基于算网模式穿越周期。 根据市场供求关系平衡算力资源自建与合作的比例,供大于求时,加大合作资源比例,供不应求时,增加自建资源比例。
01 Token工厂是供给侧的淘汰赛,小厂结局会很惨烈
爱分析:怎么看Token市场未来的发展趋势?
陈健: Token市场在我们这里分为两大类。第一类是Token工厂,Token工厂约等于算力,就是服务模型厂商。第二类是MaaS,包括服务大客户与中小客户。
Token工厂和MaaS不是一回事。Token工厂是供给侧的事情,MaaS是需求侧的事情。它们可以对接,但不能混在一起。
爱分析:一个Token工厂要跑出来,最关键的要素是什么?
陈健:我们理解,Token工厂有三个要素,订单、卡资源、优化能力,缺一不可。
第一是订单,一定要先有订单。模型厂商认为你的技术能力过硬,质量过关,技术验证通过之后,才会给你订单。现在Token工厂基本上都是阶梯价格,你的供给量越大、能拿到的价格越好。
第二是卡资源,有卡对应的是你能产多少Token。
第三是优化能力,你产出的效率怎么样,TPM怎么样,这也非常关键。
以某头部最新模型为例,如果不做优化,一台B300大概产出200万TPM(每分钟Token吞吐量)。优化做得好,能到1000万以上TPM。对模型厂商来说,采购Token工厂算力的价格可能定在900万TPM,如果不具备优化能力,很难存活。
爱分析:优化能力是不同Token工厂最大的区别?
陈健:在当前模型快速迭代的阶段,优化能力是最大的变数。
优化这个事情有个特点,刚开始提升很快,随时间推移会趋同。现在模型三个月一迭代,谁优化得快,谁就能领先。但未来模型版本稳定,大家围绕同一个模型版本优化,经过半年时间大家的优化结果就会慢慢接近,最终达到同一水平。
当下做Token工厂,首先你得是国内第一梯队的优化专业队,大家拼的是优化推出的速度。如果你不是这个级别的专业队,这个市场跟你就没关系。
爱分析:这也是并行科技投资多个推理优化公司的原因?
陈健:优化这个事情涉及面特别广,可能涉及几十项技术,不是一家公司能全搞定的。最好的优化一定是集大成者,每一项技术都要找最好的团队。我们自己是一条优化路线,生态里面还有几条优化路线,看谁最后跑得更好。所以,我们投趋境科技、投清程极智,本质上是把最牛的优化技术变成利益共同体。每家拿出自己最好的那部分,最后一起拼出一个最快的版本。
爱分析:推理优化的天花板在哪里?
陈健:第三方做优化,大多数情况下不可能超过原厂。因为原厂是白盒优化,第三方是黑盒优化。而且,原厂可以吸收各家的技术之长,天然立于不败之地。但稳定的服务、低成本算力供给、足够多的卡,仍然是第三方的核心价值。
爱分析:您对Token工厂终局的判断是什么?
陈健:我个人认为,Token工厂是一个极其惨烈的市场,最后很多玩家很难存活,尤其是小玩家。
提一个点,同样的定价,优化能力差30%,别人赚10%毛利,小厂可能亏20%。Token一上量,小厂会巨亏。另外,你还得拼卡,没有卡也不行。
爱分析:Token工厂长期的壁垒还是卡吗?
陈健:对,长期看技术优化是门槛,但最核心的还是得有卡。在模型厂商眼里,我们不只是优化服务商,我们更是算力供应商,我们的算力供给可以是卡,也可以是Token。
当模型能力收敛时,推理优化也可能趋同,但卡规模是终极的壁垒。当成为模型厂商的头部供应商后,模型厂商也希望头部这些伙伴发展的更好,以提供更稳定的供给,当然也会给予支持。
爱分析:Token领域做按需服务和整租服务的商业模型差别有多大?
陈健:这两种模式在商业模式上存在本质差别。
长期整租模式,核心是提供了资产价值,不做上层服务,如 PaaS 层及业务保障等,不受资源利用率波动影响。
按需模式,除了提供资产价值,还需要资源调度、针对业务的 SRE 和对不断变化业务的需求沟通确认及交付支持等,同时需要承担资源利用率波动产生的空置损失。所以,按需服务更考验服务能力、客群数量和资源调配能力。
02 模型厂商第一优选的供应商
爱分析:并行科技之前的积累是超算,未来的业务重心会逐步转向智算,这其中什么能力是不变的?
陈健:从算力资源角度看,超算到智算是变化,但并行科技是做算力服务的,不是做算力资源的。
过去20年,我们重点布局两个方向,一个是覆盖全国所有算力资源的算力网,品牌叫并行算网,另一个是算力终端用户。很多算力资源上线第一天,甚至还没上线,我们就提前对接合作了。这是以前做超算的时候,我们积累下来的能力。终端用户层面,我们做了十几年科研教育,这个行业的用户是我的大本营。
算力服务领域最重要的一点是,用户用的不是算力,而是算力上的软件。不管这个软件是超算应用软件、工程软件,还是今天的大模型,本质上都是软件。我们只要服务好软件,用户就满意了,至于软件用什么硬件,是我们的事。
所以,不管算力资源怎么变化,我们的重点一直没有变过,一是服务好客户,另一是为算力资源合作伙伴赋能。
爱分析:所以并行科技不是简单卖资源、卖Token,而是围绕用户使用的应用提供服务?
陈健:对,这是算力服务的核心逻辑。用户用的是算力上的一款软件,放到现在,用户用的软件就是大模型。
大模型部署到硬件上肯定需要安装、调试、适配,运营过程中也要持续处理问题,这些是我们干的活。这么多年下来,我们获得了客户的绝对支持。教育、科研是我们的传统优势领域,CAD、新能源、汽车、仿真、泛互联网,这些企业市场里我们做得也很深。
爱分析:这种算力服务能力,在大模型客户里怎么体现?
陈健:我讲算力服务有五句话。第一,真有卡,很多人说自己有卡,实际上没见到物理卡。第二,真空闲,你有卡,但当下不能用,也没有意义。第三,真可用,模型上去能跑起来。第四,真好用,性能要满足要求。第五,真降本,价格有优势。
前两个点,需要足够的人力物力投入去覆盖。国内单集群超过256张卡的资源,我们都有专人在跟进,从它准备建设开始就跟进,这是我们成立开始就积累下来的算力网能力。后面三个点,跟运营、适配和优化有关。
现在,中国头部模型厂商,很多第一优选供应商都是并行科技。原因之一是,并行算网替大家把全国大多数智算中心都覆盖到了。
爱分析:这套算力网是靠系统,还是靠人堆出来的?
陈健:只靠人远远不够,但也离不开人,因为算力资源是实时动态变化的。去年我们推过算力买手模式,非常成功,要求客户提出算力需求之后,1小时内把哪些地方的卡能满足要求、每一套报价是多少,全给客户拉出来。客户选完以后,4小时交付使用。
2025年这个买手模式运行效果很好。全行业空卡闲置的时候,跟我们合作的算力利用率都很高,我们自己和整包运营的算力利用率都很高。
如果没有并行算网,用户要把市场上能找的资源都找一遍,再适配,再询价,再比较,再交付。这个过程可能一个星期就过去了。我们能压到1小时返单、4小时交付,靠的是两个核心东西:第一,我们对算力资源建了库;第二,我们积累了大量的大模型应用运行特征。
只要客户告诉我们是什么场景,我们就知道需要什么运行指标。我们拿指标去匹配算力资源库,再做性能预测,再根据价格预算提供合适的解决方案。
爱分析:这种能力是从超算时代迁移过来的?
陈健:对。我们2008年、2009年就在用这套软件系统。对我们来说,大模型不是一个全新的技术领域,只是在算力资源之上多了大模型训练和大模型推理两种应用程序。
03 依靠行业口碑穿越周期
爱分析:当下的算力资源供不应求,算力服务商的处境如何?
陈健:着急,看着海量的需求,产能供给跟不上。所以,核心都要解决扩产问题。
爱分析:过去算力网的模式不需要持有算力,目前也必须自持算力资产了?
陈健:我们的目标不是持有卡,我们的目标是服务好客户。
如果市场上能找到卡,我们就不买卡,把一部分利润让给持卡的合作伙伴。但也有两种情况必须买卡:第一,我们要的卡市场上没有,或者都租出去了;第二,我们认为自持的性价比比市场上能找到的好很多,至少好一倍,有些场景里甚至可能好三四倍。
供不应求的今天,自持部分毛利率会较好,但合作部分毛利率较低。但是,未来供大于求的时候,自持风险就很高,需要有足够的用户基数保障利用率,以穿越不同的周期。
爱分析:算力资产的自持和合作大概是什么比例?
陈健:大致各一半。
爱分析:这个比例更多来自经验,还是测算?
陈健:经验和测算都有。
我们经历过很多轮周期,我们做超算到今天快20年了,经历过2-3次供需周期。智算这次也是,2022年供大于求,2023、2024年供不应求,2025年又供大于求,到今天又供不应求。
经历了这么多周期,我们知道不能把所有东西都押在自持上。这个生意要想穿越周期,需要自持加合作。但问题是,如何让客户、上游算力供给方可以深度配合你、信任你?这里拼的就是行业口碑。
爱分析:这个行业口碑怎么理解?
陈健:2023年一卡难求的时候,客户找我们签约,我们好不容易抢到期货,客户给了预付款,我们给上游也付了预付款。后来上游交不了卡,我们做的第一个事情是把客户预付款退回去,并严格按照罚则进行了赔付。还有,近期算力的价格暴涨,我们也听到了很多违约提价的情况。并行科技只要签了合同,不管发生什么,都要履约,我们获得了上游伙伴和最终用户双方的信任,以及我们常年的 7x24 小时服务,这些长期积累形成了行业口碑。
爱分析:海外有一类算力服务商将重资产模式做到极致,直接去做推理芯片,这个对于国内有借鉴意义吗?
陈健:做芯片的前提,一定是模型版本稳定。但一旦模型稳定下来,流片就是成熟工业流程了。这个时候,模型厂商做推理芯片更合理,尤其当模型厂商每年几百亿的Token收入时,更具规模效应。
04 国家队、运营商和能源玩家都不会缺席
爱分析:国家建立超算和智算中心,在未来算力供给体系中会扮演什么角色?
陈健:国家做超算、智算,本质上是解决技术捅破天的问题。超算以前很多是科技部项目,目标很明确,要解决最前沿、最大规模的顶尖问题。这些问题太大了,不建超级计算机就算不了。但国家超算中心也会面临资源利用率不高的问题,并行科技可以导入流量,更有效地利用好这些尖端超算资源。过去的一些年,并行科技与主要的国家超算中心合作得很顺畅。
爱分析:长期来看,运营商会成为算力基础设施里的重要力量?
陈健:我觉得会。托管服务天然适合运营商,有点像流量包。但它又涉及系统优化、调度等很多软的东西,而软的东西对大央企来说一般比较难。
所以极有可能是它们把这个业务分出来,再找行业里的玩家把这些能力补齐。长期看,Token基础设施可能真会有运营商或国家队来运行,上面有一些服务商,就像酒店管理集团一样。
爱分析:能源大厂未来也会扮演重要角色吗?
陈健:AI的终极是算力,算力的终极是电。能源厂商还是奔着电力去的,中间的算力质量大概率还是交给其他专业的公司做。
很多能源厂建的AIDC项目,目的都是拿风电、光伏指标。比如一些地方,政府说你投多少算力,我给你多少风电指标,至于那些算力的建设与运营,需要专业的合作伙伴补齐。
爱分析:如果国家队力量越来越强,并行科技会受到比较大的竞争威胁?
陈健:我们主要做用户侧,和国家队是合作关系,不是竞争关系。用户买的是服务,持有卡或者算网只是方法,不是目的,我们的目的是服务好用户。
至于算力是自持还是合作,跟着市场周期平衡就好。并行科技更期望发挥20年积累的运营、服务能力,充分释放已建和在建算力的产能和产出,轻资产化扩张。
