三周连发三个模型、知乎吵成两派:星火X2.5的真实信息量,藏在0.24、64K、238.8万这三个数字里

源自115位全网作者

01:28

9月1日,端侧开源模型 Spark X2.5-4B/1.7B 上架;9月7日,293B 的云端旗舰星火 X2.5 上线开放平台;9月16日,语音基座 Spark-Audio-1.0-Preview 又补了一刀。三周三连发,把这个国产大模型阵营里的"老玩家"直接顶回了讨论区前排。知乎知乎

有意思的是社区的分裂:知乎上"讯飞星火X2.5,是机会还是泡沫?“的问题挂了两周,一边是"业界首个百万上下文端侧模型”“4B 跨级打 9B"的刷屏解读,另一边是"上一次更新还是春节期间”“缓存 0.24 还是有点贵"的冷水。 争论分裂的底层,其实是两张反差极大的账:一边是星火 App 月活 236 万、在国内 AI 应用榜排第 22(AI产品榜今年6月口径),对面是豆包、千问们亿级的活跃用户;另一边是上半年研发投入 30 亿+、同比增长 25.73%,扣非净亏损扩大到 6.37 亿,大模型中标数量和金额还继续保持行业第一。 36氪那句"做得早、投入久、没离开牌桌,但换不来用户和商业回报”,说的就是这种错位——模型在牌桌上,生意在后台里。知乎36氪

三周连发三个模型、知乎吵成两派:星火X2.5的真实信息量,藏在0.24、64K、238.8万这三个数字里

做独立横评的博主 toyama nao 给了个克制的位置:X2.5 在纯国产算力阵营里超过所有对手,极限来到国模第三梯队头部,但稳定性和前代类似,“不确定性极大”。知乎

判断型内容最怕只信一面。这篇不复述任何一张跑分表,把三周里的多源信息并到一起,只算三个数字:0.24、64K、238.8万。它们分别对应选型时的三本账:跑分可信度、端侧真实边界、Agent 用量成本。

第一本账:跑分表里有多少是"自测"

先把开源这事的细节对齐:这次开源的两款端侧模型,发布方是科大讯飞全资子公司"词元星火"(Hugging Face 账号 XHToken),不是讯飞本号;许可证 Apache-2.0,可商用;云端那个 293B-A30B 的 X2.5 则没有开源。 有人因此嘀咕"开源换了个马甲",这个动作本身值得记一笔,但不改变模型卡上的数字。知乎知乎

数字怎么读?官方模型卡里最炸眼的一条:BrowseComp 40.9,对标 Qwen3.5-9B 的 8.3——4B 尺寸在 Agent 检索类基准上跨过 9B 打。τ³-bench、MCP-Atlas、IFBench 这些智能体指标也普遍越级。但要注意两条口径:其一,成绩全部来自官方 thinking 模式自测,路过银河和独码侠都交叉核对过 DataLearnerAI 与魔搭镜像,确认"一致"——问题是这些镜像的源头还是同一份官方模型卡;其二,SWE-Bench Verified、GPQA 等通用项并没有全面领先,符合"参数规模的物理规律"。知乎

反证信号也得放进来:toyama nao 的逻辑题横评给 X2.5 的定位是"第三梯队头部、稳定性差",这位博主上一句还是"半年前的模型仿佛来自上世纪"——在"2 个月进化一代"的节奏里,讯飞这次是把进度条拉回来了,而不是领跑。

这页账的结论:拿它当"国产算力阵营里最强的端侧开源选项"来看是成立的;拿"打 9B"的截图去期待它替代云端主力,目前只有自测证据。

第二本账:"端侧百万上下文"在你的机器上是 64K

1M 上下文是这轮最大的卖点:1 层全注意力 + 3 层滑动窗口注意力的混合架构,config 里 max_position_embeddings 写到 1,048,576,宣称一份几十页的手册一次读完。

官方口径和实测口径之间,隔着内存。把 X2.5-4B 拉进本地 Agent 客户端跑了 12 项任务的实测(Apple M1 Pro、32GB 统一内存、llama.cpp)给出的修正是:BF16 权重约 8GB 常驻,默认以 64K 上下文启动就能覆盖绝大多数任务;实测可稳定拉到 128K;所谓"一次读完"的超 64K 大输入,需要显式以 ≥128K 启动才会不溢出——超了直接长度中断。1.7B 更保守,-c 49152。4bit 量化后权重还能再砍半,进 8GB 显存级设备才有谈"原生 1M"的余地。知乎

三周连发三个模型、知乎吵成两派:星火X2.5的真实信息量,藏在0.24、64K、238.8万这三个数字里

另一处坑在工程侧而非模型侧:官方 fork 的 /v1/responses 只实现了 function 类工具,Codex 原生的文件类、web_search 工具类型会被丢弃,导致 Codex 驱动本地模型时"空回复退场";换 Claude Code(Anthropic 协议)或 Hermes 走 OpenAI 协议才跑得通。也就是说,"官方深度集成 Codex/Claude Code"这句话,在你的笔记本上要按客户端和协议版本逐条验证。知乎

三周连发三个模型、知乎吵成两派:星火X2.5的真实信息量,藏在0.24、64K、238.8万这三个数字里

干活能力本身,实测是"能干活,但结论要人工复核":77 行订单表埋 32 处异常,4B 自己写脚本标出 73 处——总量方向对,但"重复订单"判定用整行匹配漏掉了同单号不同内容的行;两份 8000 字技术方案对比,4 类埋雷全抓出,报告自述"13 处核心差异"与明细逐类相加的 14 处又对不上。 4B 的问题是长报告的自我统计一致性,这恰是把它接入自动化流水线前必须设人工关卡的地方。知乎

第三本账:定价页比跑分页诚实

云端 X2.5 的定价值得单独看:输入 1.6 元/百万 Token、缓存命中输入 0.24 元、输出 6 元,限时 5 折(原价 3.2/0.48/12)。智东西的首发实测给了一份天然的账单:让 X2.5 做一款 HTML 枪战游戏,两轮生成合计 17 分 30 秒,累计 Token 约 238.8 万——其中缓存读取 227.9 万、未缓存输入 6.51 万、输出 4.39 万。知乎

三周连发三个模型、知乎吵成两派:星火X2.5的真实信息量,藏在0.24、64K、238.8万这三个数字里

按 5 折价算:227.9万×0.24 + 6.51万×1.6 + 4.39万×6 ≈ 0.91 元,一个可玩的 Agent 任务。但看结构:95% 的 Token 走的是 0.24 的缓存价。如果缓存完全不命中,同一次任务光输入就要 3.7 元上下,原价口径直接逼近 7.5 元。做 coding agent 的用量成本,几乎由缓存命中率一个变量决定——定价页把缓存价压到输入的 15%,说明讯飞清楚自己要吃的就是多轮重复上下文的工作负载。

反方账本也摆出来:星空灵核那句"缓存价格 0.24 还是有点高了,个人没什么兴趣",前提是同日上线的讯飞星辰 MaaS 对 X2.5 端侧/云端 API 开放限时免费,个人玩家还有魔搭和 GGUF 本地路线——而且这个 MaaS 平台本身已整合 50 多个主流开源模型、兼容 OpenAI/Anthropic 协议,星火只是货架上最新的一层。 所以对号入座:API 定价账只对"量大到免费额度罩不住"的人成立,普通尝鲜者先薅限时免费和本地开源。知乎36氪

谁该动、谁再等

  • 端侧模型玩家/本地 Agent 折腾党:值得马上动手,下载 Q4 量化跑你自己的真实任务(官方推荐采样 temperature=1.0 / top_p=0.95),别拿跑分截图当预期;内网、数据不出设备的场景,Apache-2.0 + 昇腾训练 + vLLM/SGLang/llama.cpp 全家桶支持,是目前国产端侧里工程选项最全的一档。

  • 用开放平台的个人开发者:先查自己的缓存命中率再算账,5 折是"限时",盯紧恢复原价的时间点;轻量需求先用星辰 MaaS 免费额度顶。

  • 等语音能力落到硬件的人:Spark-Audio-1.0 号称 202 种方言、99 种语言端到端识别,但官方口径是 API 后续才上开放平台,实时延迟、长音频上限均未公布——10 月的 1024 开发者大会才是消费硬件侧跟进的信号点,现在不用为它改变购买决策。知乎

  • 纯围观用户:这轮更新短期内不会改变耳机、录音笔这些产品的价格,等等党维持原判。

接下来盯三个信号

  1. 星火 X2.5 的"限时 5 折"何时收,以及 293B 云端版会不会松动开源口径;

  2. Spark-Audio API 上开放平台后的定价,以及讯飞消费硬件有没有任何一款官宣接入;

  3. 迭代节奏——toyama nao 那句"2 个月是模型的地质纪年"是说给所有国产厂商的:讯飞上一次和这一次之间隔了大半年,如果下个版本又要等半年,这次的三连发就只是补课,不是转身。

你现在把星火 X2.5 系列接进工作流了吗——是本地 4B 党、MaaS 免费额度党,还是被 0.24 缓存价劝退的那一派?评论区聊聊你的实测账单。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章