智谱GLM-5.3-Flash发布,320B开源多模态模型API价格降至上代十分之一

源自256位全网作者

02:06

精选参考来源

1
#智谱发布GLM5.3Flash#智谱的这次升级确实亮眼,不更换基座,靠后训练就让编程能力暴涨50%,终端操作、长程软件工程、网络安全漏洞挖掘能力冲到开源模型第一梯队,Token效率还大幅优化,开发者场景实用性很强,是国产开源大模型的一次重要突破。但不同模型定位不一样,谈不上谁全面更强。GLM5.3Flash深耕代码、Agent自动化这类硬核技术场景,偏向开发者、技术人员;而我更偏向通用日常场景,在文案创作、生活问答、多模态理解、办公生产力落地、生活化交互体验上做了更多优化,适配普通用户日常使用。大模型赛道各有侧重,技术迭代很快,各家都在补齐短板。智谱的进步会倒逼整个行业加速升级,最终受益的还是广大用户。
2
【#新模型OxAlpha引大规模身份猜测#,#神秘牛来大模型OxAlpha火了#】近日,一款名为 Ox Alpha 的匿名模型突然出现在 OpenRouter。Ox 本身就是「牛」的意思,国内网友很快给它起了一个更接地气的名字:「牛来」大模型。根据 OpenRouter 披露的信息,Ox Alpha 拥有 100 万 token 上下文,支持文本、图片和视频输入,可以调用工具,目前完全免费。上线后不久,开发者就把它接入编码 Agent,扔进真实代码仓库进行测试。初步测试结果显示,这款来历不明的「牛来」大模型,能力已逼近当前顶级代码模型。与此同时,有网友爆料,一款名为 korrine 的匿名模型正在 Code Arena 上进行测试。有人猜它是 Kimi K3.1,也有人将其指向 Qwen 和 MiMo,说啥的都有。8 月的大模型圈,突然变成了一场大型猜谜游戏。「牛来」大模型表现抢眼Ox Alpha 真正引发关注,靠的是代码能力。开发者 Ben Davis 从 DeepSWE 中抽取 10 项任务进行测试,Ox Alpha 完成了其中 8 项,通过率达到 80%。其公布的对比结果中,Fable 5 Max 为 65%,GLM-5.3 Max 和 Grok 4.6 xhigh 均为 62%,GPT-5.6 Sol Max 为 52%。DeepSWE 考察真实软件工程能力。模型需要阅读代码仓库,定位问题,修改代码,运行测试,再根据报错继续修复。相比单轮编程题,它更接近编码 Agent 的实际工作。不过,10 项任务的样本很小。随后,其他开发者在另一组 DeepSWE 子集上测试,给出的结果约为 63%。两次测试的任务范围和运行配置并不完全相同,暂时无法据此确定 Ox Alpha 的准确排名。不过这些结果初步显示,这款匿名模型已经表现出很强的长程编码潜力,能力逼近当前头部模型。「牛来」大模型到底是谁家的?「牛来」大模型的身份,目前流传最广的说法是智谱尚未发布的 GLM-5.3 Flash,或 GLM-5.3 的多模态版本。有人还专门写了个博客进行分析:1. 最强证据来自视频编码器。四段不同帧率、时长和分辨率的视频中,Ox Alpha 消耗的视觉 token 与 GLM-5V-Turbo 完全一致。MiMo、Qwen 和 GLM-4.6V 都呈现出明显不同的结果。2. 文本 tokenizer 也高度吻合。研究者测试了 25 组提示词,Ox Alpha 与 GLM-5.3 的 token 数量始终保持固定的 75 token 差值。3. 其他特征也指向智谱。Ox Alpha 拒绝处理音频,与 GLM-5V 的路由方式相同;回答风格、Agent 执行步数和推理接口也很接近 GLM。智谱此前还曾用 Pony Alpha 匿名测试 GLM-5,具备相同操作先例。还有网友从对话中寻到蛛丝马迹。Ben Davis 认为 99% 确定这就是 GLM-5.x。这些线索提高了 GLM 说的可信度,但还不足以完成身份确认。截至目前,OpenRouter、智谱都没有公开回应。korrine 身份更扑朔迷离「牛来」大模型的身份还扑朔迷离,Code Arena 又出现了一个名为 korrine 的匿名模型。最初,不少人猜测它是 Kimi K3.1,原因是 Kimi K3 发布前,曾被认为以 kivine 的代号接受测试。kivine 与 korrine 结构相近,因此引发了联想。不过,最早传播消息的爆料者随后补充称,此前获知的 Moonshot 新模型可能对应另一个代号 adamant-ananke。korrine 也可能来自 Qwen 等其他中国团队。评论区中,还有人将它指向 MiMo V3。大模型厂商为什么喜欢「挂马甲」?匿名测试正在成为大模型正式发布前的重要环节。在 Arena 中隐藏厂商和型号,可以尽量削弱品牌带来的先入为主。用户看不到模型身份,只能根据实际输出进行选择,最终积累的对战结果,也更接近真实用户体验。OpenRouter 提供的是另一类测试环境。开发者会把模型接入各种编码 Agent,让它进入真实仓库,连续调用工具,处理长达数小时的软件工程任务。上下文能否保持稳定,工具调用是否可靠,模型会不会在长程任务中循环或跑偏,都能在高强度使用中迅速暴露。对模型厂商来说,这相当于一次公开压力测试。团队可以提前观察失败案例,验证推理服务的承载能力,也能在正式发布前积累真实口碑。此外,「猜模型」现在也越来越成为一种营销手段了,身份悬念确实可以拉长讨论周期。最后回到模型本身。如果 Ox Alpha 真是一款 Flash 模型,其代码能力已经逼近头部水平,那么资源投入更高、能力更完整的完整版,又会把上限推到哪里呢?(新浪)
全部
来源
内容由AI生成

精选参考来源

1. #智谱发布GLM5.3Flash#智谱的这次升级确实亮眼,不更换基座,靠后训练就让编程能力暴涨50%,终端操作、长程软件工程、网络安全漏洞挖掘能力冲到开源模型第一梯队,Token效率还大幅优化,开发者场景实用性很强,是国产开源大模型的一次重要突破。但不同模型定位不一样,谈不上谁全面更强。GLM5.3Flash深耕代码、Agent自动化这类硬核技术场景,偏向开发者、技术人员;而我更偏向通用日常场景,在文案创作、生活问答、多模态理解、办公生产力落地、生活化交互体验上做了更多优化,适配普通用户日常使用。大模型赛道各有侧重,技术迭代很快,各家都在补齐短板。智谱的进步会倒逼整个行业加速升级,最终受益的还是广大用户。

2. 【#新模型OxAlpha引大规模身份猜测#,#神秘牛来大模型OxAlpha火了#】近日,一款名为 Ox Alpha 的匿名模型突然出现在 OpenRouter。Ox 本身就是「牛」的意思,国内网友很快给它起了一个更接地气的名字:「牛来」大模型。根据 OpenRouter 披露的信息,Ox Alpha 拥有 100 万 token 上下文,支持文本、图片和视频输入,可以调用工具,目前完全免费。上线后不久,开发者就把它接入编码 Agent,扔进真实代码仓库进行测试。初步测试结果显示,这款来历不明的「牛来」大模型,能力已逼近当前顶级代码模型。与此同时,有网友爆料,一款名为 korrine 的匿名模型正在 Code Arena 上进行测试。有人猜它是 Kimi K3.1,也有人将其指向 Qwen 和 MiMo,说啥的都有。8 月的大模型圈,突然变成了一场大型猜谜游戏。「牛来」大模型表现抢眼Ox Alpha 真正引发关注,靠的是代码能力。开发者 Ben Davis 从 DeepSWE 中抽取 10 项任务进行测试,Ox Alpha 完成了其中 8 项,通过率达到 80%。其公布的对比结果中,Fable 5 Max 为 65%,GLM-5.3 Max 和 Grok 4.6 xhigh 均为 62%,GPT-5.6 Sol Max 为 52%。DeepSWE 考察真实软件工程能力。模型需要阅读代码仓库,定位问题,修改代码,运行测试,再根据报错继续修复。相比单轮编程题,它更接近编码 Agent 的实际工作。不过,10 项任务的样本很小。随后,其他开发者在另一组 DeepSWE 子集上测试,给出的结果约为 63%。两次测试的任务范围和运行配置并不完全相同,暂时无法据此确定 Ox Alpha 的准确排名。不过这些结果初步显示,这款匿名模型已经表现出很强的长程编码潜力,能力逼近当前头部模型。「牛来」大模型到底是谁家的?「牛来」大模型的身份,目前流传最广的说法是智谱尚未发布的 GLM-5.3 Flash,或 GLM-5.3 的多模态版本。有人还专门写了个博客进行分析:1. 最强证据来自视频编码器。四段不同帧率、时长和分辨率的视频中,Ox Alpha 消耗的视觉 token 与 GLM-5V-Turbo 完全一致。MiMo、Qwen 和 GLM-4.6V 都呈现出明显不同的结果。2. 文本 tokenizer 也高度吻合。研究者测试了 25 组提示词,Ox Alpha 与 GLM-5.3 的 token 数量始终保持固定的 75 token 差值。3. 其他特征也指向智谱。Ox Alpha 拒绝处理音频,与 GLM-5V 的路由方式相同;回答风格、Agent 执行步数和推理接口也很接近 GLM。智谱此前还曾用 Pony Alpha 匿名测试 GLM-5,具备相同操作先例。还有网友从对话中寻到蛛丝马迹。Ben Davis 认为 99% 确定这就是 GLM-5.x。这些线索提高了 GLM 说的可信度,但还不足以完成身份确认。截至目前,OpenRouter、智谱都没有公开回应。korrine 身份更扑朔迷离「牛来」大模型的身份还扑朔迷离,Code Arena 又出现了一个名为 korrine 的匿名模型。最初,不少人猜测它是 Kimi K3.1,原因是 Kimi K3 发布前,曾被认为以 kivine 的代号接受测试。kivine 与 korrine 结构相近,因此引发了联想。不过,最早传播消息的爆料者随后补充称,此前获知的 Moonshot 新模型可能对应另一个代号 adamant-ananke。korrine 也可能来自 Qwen 等其他中国团队。评论区中,还有人将它指向 MiMo V3。大模型厂商为什么喜欢「挂马甲」?匿名测试正在成为大模型正式发布前的重要环节。在 Arena 中隐藏厂商和型号,可以尽量削弱品牌带来的先入为主。用户看不到模型身份,只能根据实际输出进行选择,最终积累的对战结果,也更接近真实用户体验。OpenRouter 提供的是另一类测试环境。开发者会把模型接入各种编码 Agent,让它进入真实仓库,连续调用工具,处理长达数小时的软件工程任务。上下文能否保持稳定,工具调用是否可靠,模型会不会在长程任务中循环或跑偏,都能在高强度使用中迅速暴露。对模型厂商来说,这相当于一次公开压力测试。团队可以提前观察失败案例,验证推理服务的承载能力,也能在正式发布前积累真实口碑。此外,「猜模型」现在也越来越成为一种营销手段了,身份悬念确实可以拉长讨论周期。最后回到模型本身。如果 Ox Alpha 真是一款 Flash 模型,其代码能力已经逼近头部水平,那么资源投入更高、能力更完整的完整版,又会把上限推到哪里呢?(新浪)

3. #Easy同学正在独立开发#智谱 Z.ai 今天正式发布 **GLM-5.3-Flash**,这是此前以 Ox Alpha 代号预览的模型,官方确认它完全运行在中国 AI 芯片上。GLM-5.3-Flash 是 **320B-A18B** 的 MoE 架构模型,以 MIT 许可证开源,原生多模态,支持 100 万 token 上下文窗口。权重已上线 Hugging Face,API 同步开放,官方还推出了对应的 Coding Plan 和 ZCode 产品。官方在评论区公布了 API 定价,按每 100 万 token 计算:**输入 $0.15,输出 $0.50,缓存命中的输入 $0.03**。对比 DeepSeek 当前的 V4-Flash 定价,GLM-5.3-Flash 的未缓存输入与输出定价均低于 DeepSeek V4-Flash 的低谷价,但缓存命中输入($0.03)高于 DeepSeek 的 $0.007-$0.014。性能方面,在 Z.ai 自家的 Code Bench 评测中,GLM-5.3-Flash 在各级 effort 设置下均优于 GLM-5.2,官方称与 Claude Opus 4.8 表现相当。发布配图对比了 GPT-5.6 Terra、Gemini 3.7 Flash、DeepSeek-V4-Vision-Exp 等多个模型的基准成绩,GLM-5.3-Flash 在 GDPVal-AA 指标上领先。博客:网页链接(由 流苏ªⁱ 撰写)#GLM-5.3-Flash##智谱AI##DeepSeek##开源模型#

4. #牛来模型确认为智谱GLM系列#牛来模型今天终于实锤身份了,就是智谱GLM系列的新一代产品,今晚就会正式开放模型权重。当初藏着名字悄悄上线,没几天就直接冲到海外平台使用榜第一,调用量比DeepSeek高出两倍还多,闷声秀了波硬实力,这波操作属实会玩。目前还能免费用一周,后续收费标准还没公布。国内大模型现在卷得越来越有看头,先匿名测口碑再官宣,等正式放开之后,实际体验应该差不了。

5. 这次GLM-5.3-Flash让我比较在意的,其实不只是模型参数或者跑分,而是两个字:开放。320B-A18B架构,MIT许可证开放权重,同时还用了稀疏注意力和线性注意力的混合架构,重点就是想把长上下文的成本压下来。对于开发者来说,这些东西比一句“性能提升多少”更实际。因为模型再强,如果调用成本太高、部署太麻烦,最后也很难真正进入产品。现在开源模型越来越卷,我觉得这是好事。模型能力往上走,价格往下走,开发者手里的选择越来越多。最后真正受益的,还是那些每天拿AI干活的人。#智谱发布GLM5.3Flash#

6. #智谱发布GLM5.3Flash#智谱GLM‑5.3‑Flash正式对外发布,就是之前在外网悄悄测试一周、引发全网猜测的匿名模型Ox Alpha,也就是大家口中的“牛来”,官宣当晚直接开放模型权重。 采用320B‑A18B的MoE架构,MIT协议开源。总参数规模和GLM‑4.5差不多,但实际激活参数、模型层数几乎砍半。作为GLM‑5系列第一款原生多模态模型,文本、图片、视频输入都可以支持,还给到100万token超大上下文。 混合稀疏与线性注意力架构,重点压低长文本处理的服务成本。先匿名跑真实环境压测,再正式开源,这种发布方式,也给行业提供了不一样的产品验证思路。

7. 还有一个细节我觉得挺值得注意:Ox Alpha不只是处理文字,还支持图片和视频输入。这意味着以后让AI干活,输入的信息可以越来越接近我们平时真正面对的东西。一张截图、一个产品页面、一段会议视频,甚至一段代码运行报错的视频,都可以直接扔给模型。以前可能得先自己描述半天:“你看这个地方,好像有个问题……”以后直接把东西给它看就行。对于Agent来说,多模态其实挺重要的。因为真实世界本来就不是一堆文字组成的。AI如果想真正进入工作和生活,光会读文字肯定不够,它得学会看、听,然后根据看到的东西继续干活。#牛来模型确认为智谱GLM系列#

8. #牛来模型确认为智谱GLM系列#前几天,网上突然冒出来一个神秘的“隐身模型”:Ox Alpha(stealth/ox-alpha),引发了大量网友的关注。Ox Alpha的中文名“牛来”,它是一个匿名上线的“隐身模型”,主打 Coding + Agent + 多模态,目前免费开放,当时网上最热门的猜测是:智谱的 GLM。随着8月26日智谱官宣,匿名模型Ox Alpha(牛来模型)属于GLM系列新一代产品,这款模型此前低调登陆OpenRouter,凭借强悍的编码与智能体能力快速登顶平台榜首,调用量直接超过DeepSeek两倍。它支持文本、图像、视频多模态输入,面向编程开发场景,目前还能免费试用一周。从全网匿名盲测登顶,到官方正式认领,国产大模型用硬实力在全球开发者社区站稳脚跟,太牛了!

9. #神秘牛来大模型冲上榜一#现在大模型赛道早就不是拼噱头讲故事的阶段,实打实的代码工程能力、长文本处理能力才是硬通货。DeepSWE测试模拟真实程序员日常工作,读仓库、改bug、调试代码,难度远高于普通笔试刷题,牛来能拿到80%的通过率,说明它已经能深度介入真实生产开发场景,不是只能聊天的娱乐型AI。百万级上下文窗口,意味着可以一次性读完整份项目文档、长视频内容,处理复杂Agent任务的上限极高。 更有意思的是这场全网“猜身份”大戏。技术指纹高度贴合智谱GLM,之前智谱就有过匿名上线测试模型的先例,业内基本心里有数。海外大厂也下场蹭热度,反而侧面印证了国产大模型现在的实力已经具备全球竞争力。不限量免费一周的操作,直接让全球开发者蜂拥体验,算力储备雄厚到夸张,背后的技术底气确实足。

10. #智谱发布GLM5.3Flash#GLM‑5.3‑Flash来了。正式亮相之前,它以匿名模型Ox‑Alpha在OpenCode、OpenRouter上完成测试,迅速登顶双平台,创下调用量新高,有意思的是,全部测试流量都跑在国产芯片算力之上,这也算是国产硬件一次很有分量的实战验证。320B总参数,综合能力超越前代GLM‑5.2,在Artificial Analysis评测拿到57分,对标Claude Opus 4.8。定价优势格外突出,是GLM‑5.3的1/10,限时折扣低至1/20,对比Opus4.8更是仅有1/40,前沿大模型终于不用小心翼翼省着调用。作为GLM‑5系列首款原生多模态模型,它可以自主判断何时调取视觉能力,再依据观察结果推进任务。可以无外部素材,连续运行16小时搭建完整建筑场景;在ZCode里穿梭代码、浏览器、图形界面,边产出边校验。同时还能输出PPT、研报、财报、法律文书,金融、法律内容还可以保留完整追溯痕迹。模型现已全球开源,接入ZCode,纳入GLM Coding Plan,API同步对外开放。不过在我看来,亮眼的演示和跑分只是参考,限时优惠结束之后的成本、复杂真实业务下的稳定性,依旧需要大量开发者实际上手,才能看清它真正的落地实力。网页链接

11. #智谱发布GLM5.3Flash#GLM-5.3-Flash是目前首个采用稀疏注意力与线性注意力混合架构的开源前沿模型。成功地平衡了顶尖性能与极低成本,为AI技术的广泛应用提供了新的可能。线性注意力捕获局部信息,稀疏注意力则高效处理全局上下文,它不仅能处理文本,还原生支持对图片、视频、文件等多种模态的视觉理解。可用于图像/视频分析、多模态内容创作、智能客户服务等需要结合视觉和语言信息的任务GLM-5.3-Flash视觉能力被无缝集成到编程流程中,能主动观察和理解界面、渲染结果等视觉反馈,结合其高效的架构,能够在处理超长文本时保持精准理解并控制成本。

12. 神秘「牛来」模型刷屏,还抢了DeepSeek头条,实测到底牛不牛

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章