讯飞星火X2.5端侧大模型开源,4B和1.7B首支持百万Token上下文

源自285位全网作者

22:03

精选参考来源

内容由AI生成

精选参考来源

1. #阿里发布Qwen3.8Flash# 大模型这行,过去比的是谁家参数大。千问这次换了个比法:参数可以小,算力不能白烧。Qwen3.8-Flash,激活 6B 参数。编程、智能体、专业工作、多模态几项评测,把 Opus4.6 打穿,贴着 Opus4.8 的脸。训练成本比 3.7-Plus 砍掉近九成。把 Token 的生产成本重做了一遍:Attention、Residual、Embedding、Optimization 四处架构,同一块 GPU 塞进更多请求,吐出更多 Token。开源版 Flash-Next 是 Qwen4 结构预演,先拿出来给社区验货,跟当年 GatedDeltaNet 给 Qwen3.5 试水一个路数。为啥总成本比单价重要?智能体时代,一次任务几十次调用、几十万 token、工具用了一轮又一轮,失败就得重跑。模型能不能铺开用,看的不是单次报价,是做完一件事要烧多少钱。在真实任务中,Agent工作需长输入(Input),缓存命中价格对综合成本影响大,Qwen3.8-Flash缓存命中价格低至每百万Tokens 0.1元、国际站0.016美元,千问这下真的让Agent量大管饱了。所以这波真正的变化是行业从比谁最强,转到了比谁最划算。找最强的模型,不如找最适合自己那个。千问把 Scaling 押在单位算力上,这大概率也是 Qwen4 的路!

2. 牛来大模型被认领是国产牛,打穿了Deepseek的价格线

3. 这次GLM-5.3-Flash让我比较在意的,其实不只是模型参数或者跑分,而是两个字:开放。320B-A18B架构,MIT许可证开放权重,同时还用了稀疏注意力和线性注意力的混合架构,重点就是想把长上下文的成本压下来。对于开发者来说,这些东西比一句“性能提升多少”更实际。因为模型再强,如果调用成本太高、部署太麻烦,最后也很难真正进入产品。现在开源模型越来越卷,我觉得这是好事。模型能力往上走,价格往下走,开发者手里的选择越来越多。最后真正受益的,还是那些每天拿AI干活的人。#智谱发布GLM5.3Flash#

4. Qwen3.8-Flash-Next 突然开源!125B 模型本地运行,显存不够硬盘来凑,居然真能跑!部署实测来了 | 零度解说

5. 阿里开源 Qwen3.8-27B 本地实测:性能很强,但 Agent 适配仍待补课

6. #阿里发布Qwen3.8Flash#据我这个半路出家的文科生了解到,该模型采用下一代 Qwen4 架构,总参数 125B,每 token 仅激活 6B,却实现了超越 Claude Opus4.6 的前沿性能,创下模型效率全球新基准。架构上,Qwen3.8-Flash 带来四大革新:引入 QSA 稀疏注意力机制,1M 长上下文场景提速超 8 倍;自研 Gated Residual 将信息通道拓展为 4 条并行分支;外挂 51B N-gram Embedding 高效扩展模型容量;配合全新优化器大幅提升训练吞吐。成本方面更是惊人——训练成本较上代骤降近 90%,推理定价每百万 Tokens 输入仅 1 元、输出 3 元,仅为 DeepSeek-V4-Flash 的 1/3。模型已同步在 Hugging Face 与魔搭社区开源,并首发上线“千问办公”,开发者可通过千问 AI 平台获取 API 服务。

7. 再重点看在真实Agent场景里的数据。千问办公标准模式下,单任务生成速度提升约100%,Token消耗平均减少75%。以前写一份长报告,看着Token数字往上蹿,心里跟着发紧;现在是快速出活儿,速度翻倍、费用打骨折,可以用更少的积分消耗、更快的Token吞吐速度完成任务。差距在哪里?不是简单的换模型,而是千问办公和千问大模型团队联合调优——针对多步规划、工具选择这些Agent高发场景反复打磨。说白了,给Agent换了套省油的动力系统。有人说性能、成本、速度不可能三角,千问这波直接给打破了。说白了,Agent从此告别“省着用”,进入“随便用”时代。阿里这一手模型开源+低价推理+场景落地三连击,极其有利于用户。#以后明星撕番位会显得很暧昧#

8. #Easy同学正在独立开发#智谱 Z.ai 今天正式发布 **GLM-5.3-Flash**,这是此前以 Ox Alpha 代号预览的模型,官方确认它完全运行在中国 AI 芯片上。GLM-5.3-Flash 是 **320B-A18B** 的 MoE 架构模型,以 MIT 许可证开源,原生多模态,支持 100 万 token 上下文窗口。权重已上线 Hugging Face,API 同步开放,官方还推出了对应的 Coding Plan 和 ZCode 产品。官方在评论区公布了 API 定价,按每 100 万 token 计算:**输入 $0.15,输出 $0.50,缓存命中的输入 $0.03**。对比 DeepSeek 当前的 V4-Flash 定价,GLM-5.3-Flash 的未缓存输入与输出定价均低于 DeepSeek V4-Flash 的低谷价,但缓存命中输入($0.03)高于 DeepSeek 的 $0.007-$0.014。性能方面,在 Z.ai 自家的 Code Bench 评测中,GLM-5.3-Flash 在各级 effort 设置下均优于 GLM-5.2,官方称与 Claude Opus 4.8 表现相当。发布配图对比了 GPT-5.6 Terra、Gemini 3.7 Flash、DeepSeek-V4-Vision-Exp 等多个模型的基准成绩,GLM-5.3-Flash 在 GDPVal-AA 指标上领先。博客:网页链接(由 流苏ªⁱ 撰写)#GLM-5.3-Flash##智谱AI##DeepSeek##开源模型#

9. 千问AI平台刚刚上线了一个新模型,叫 Qwen3.8-Flash,主打极致性价比。在编程、Agent 这类真实任务里,它的价格低到让人有点意外。输入每百万个 Token 只要 0.8 元,输出 2.7 元,缓存命中更是低到每百万 0.1 元。换算到国际站,输入 0.15 美元,输出 0.47 美元,缓存命中 0.016 美元。那它为什么能这么便宜?关键在模型本身。Qwen3.8-Flash 是一个多模态混合专家(MoE)模型,总参数上千亿,但实际只激活 60 亿,用极少的算力干活,效率直接刷新了业界基准。它的架构和此前所有千问模型都不一样:注意力上用了自研的 QSA 稀疏注意力,和 GDN 组合成混合注意力,大幅降低计算开销,在百万 Token 的高缓存命中长上下文场景里能快 8 倍以上,又准又快;内部通信上引入 Gated Residual 方法,把原来的一条信息主通道拆成四条,让模型按需动态读写,信息传得更高效,训练也更稳定;参数扩展上加了 51B 的 N-gram Embedding 参数,相当于给模型外挂了一本记忆指南手册,几乎不费资源就把参数规模撑大了;调参上结构和后期优化协同进行,收敛效率和训练吞吐都明显提升。这些技术换来的直接好处,就是训练和推理成本大幅下降。API 已经首发上线千问AI平台,开发者可以直接调用 API 或者买 Token Plan。特别适合 Agent 这类场景,因为智能体任务输入特别长,缓存命中价格越低,综合成本越省。千问办公的标准模式现在也内置了 Qwen3.8-Flash,日常办公任务大概能完成 95%。更值得关注的是,这套 Next 新架构是下一代千问大模型 Qwen4 的雏形,相关权重已经在 Hugging Face 和魔搭社区全面开源,交给大家检验。目前 Qwen3.8 系列里,2.4T 参数的 Qwen3.8-Max、27B 和 Flash 三个尺寸都已开源并上线千问AI平台对外提供 API。想体验的话,千问AI平台和 QwenCloud 都能直接打开,链接放在下面。千问AI平台:www.qianwenai.com/models/qwen3.8-flash QwenCloud:www.qwencloud.com/models/qwen3.8-flash#科技先锋官##How I AI##阿里发布Qwen3.8Flash#

10. 千问办公上线Qwen3.8-Flash,专治Agent“Token焦虑”,量大管饱Agent圈现在最头疼的,不是模型不聪明,是Token烧不起。IDC预测,2026年我国企业级Token消耗量将同比增长约20倍。重度玩家一天干掉10亿Token,耗费数千美元。而且,同一个任务,Agent工作流的Token消耗是聊天机器人的5到30倍。用AI用出了理财的感觉,打开任务还要先算成本,大伤脑筋。昨晚阿里放出Qwen3.8-Flash,千问办公第一时间接入,同步上线标准模式,模型的Token生成速度提升100%,Token消耗减少75%。先说一下这模型:千亿总参数,仅激活60亿,官方口径性能超越Claude Opus4.6;每百万Tokens输入0.8元,输出2.7元,不到Claude Opus4.6的1/40,比DeepSeek-V4-Flash忙时价格的1/3还低。#景甜下沉市场口碑#

11. 【大算力不再是高墙:Qwen 27B 开启的端侧智能革命】Qwen3.8-27B最近在开发者圈内引发剧烈讨论,核心在于这个270亿参数的模型展现出了越级的智力,在法律和编程基准测试中追平了部分顶级闭源模型。它对硬件极度友好,通过Unsloth压缩到1 bit后仅需8GB内存即可在普通笔记本上运行,目前已成为Cline等编程工具中首选的本地模型,甚至出现了完全绕过安全审查的本地版本。这波热度背后是模型开发路径的转向:参数量不再是衡量智力的唯一标准,高质量数据蒸馏让小模型也能拥有Agent能力。虽然有用户反馈其编程表现不及DeepSeek,且在低配机器上吐Token速度较慢,但其真正意义在于“算力主权”的回归。当一个足够聪明的模型能脱离云端在本地运行,AI才真正从昂贵的订阅服务变成触手可及的生产力工具。当然,无审查版本的泛滥也意味着端侧AI的自由与风险正在同步放大。

12. 阿里云公告,大模型服务平台百炼将于北京时间 2026 年 8 月 27 日 12:00:00 起,对 Qwen3.8-Flash 模型模式计费单价进行下调调整。具体如下:计费项调整前调整后输入¥1.00¥0.80输出¥3.00¥2.70据IT之家了解,Qwen3.8-Flash 是千问最新推出的多模态大模型,原生支持百万级上下文窗口,可一次性处理超长文档、代码仓库与复杂对话,在编程辅助、智能体协作、图文理解等场景中表现突出,兼容 OpenAI 与 Anthropic 接口协议,适合构建高并发应用与智能工作流。截至目前,Qwen3.8 已开源发布的 2.4T 参数量的 Qwen3.8-Max、Qwen3.8-27B 及 Qwen3.8-Flash 三大尺寸模型,均已上线千问 AI 平台对外提供 API 服务。#曝白鹿陈哲远演朝玉阶#

13. #DeepSeekV4多模态模型正式开源#DeepSeek 刚刚在 Hugging Face 上线了DeepSeek-V4-Flash-Vision-Exp,采用 MIT License 开源。DeepSeek这次开源模型基于 DeepSeek-V4-Flash,在原有架构中加入视觉模块,并经过持续训练获得图像理解能力,同时保留原来的文本、推理和 Agent 能力。这个模型刚刚上线没几天就直接开源,而且MIT开源协议允许商用二次开发,开发者可以自由本地部署,对于AI重度使用者和需要二次开发的朋友真的是红利了!

14. 近日,小鹏举办物理 AI 分享会,第二代VLA大模型迎来重大升级,XOS 6.3.0版本将在小鹏G9L全球首发,实现AI从3D空间理解向4D时空理解跃迁。本次升级搭载Infini‑VLA长时序架构,模型可记忆前30秒道路信息;流式自回归推理让端到端响应速度提升300%,实现边看边想边行动;X‑For

15. 小鹏VLA纯视角智驾是成功,大家认可的,今天VLA第二代正式相亮![打call] 小鹏第二代VLA全新版本 更大、更久、更快、想得更远、也更安全 -最大模型规模:端侧模型参数提高3.5倍,是主流VLA模型的15倍以上,更大的参数量实现足够强的泛化能力,让快速进入全球市场成为可能 -超长有效时序:

16. 小鹏用同样一套物理世界AI基座模型,可以跑在汽车,也可以跑人形机器人,跨硬件复用能力正在落地。 小鹏IRON人形机器人搭载3颗图灵AI芯片,算力2250TOPS,基座模型实现端侧部署,不用远程遥控,就能自主处理复杂任务,兼顾低延迟和数据安全。背后是小鹏多年打磨完整AI Infra,数据、训练、仿真

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章