“牛来”是智谱的,权重当晚就开源:80%的跑分要按63%看,免费窗口关上之前,Agent用户该抢的抢、该等的等

源自45位全网作者

01:49

一、谜底揭晓:牛来就是智谱,权重当晚就开源

8月20号深夜,OpenRouter上悄悄冒出一个叫Ox Alpha的匿名模型。没品牌、没官宣,上线12小时,它冲到了OpenRouter调用量榜首。知乎六天后谜底揭晓:智谱正式发布并认领了它,定名GLM-5.3-Flash,确认后当晚开放模型权重。微博

规格值得划重点:Ox Alpha的正式名字是GLM-5.3-Flash,也是GLM系列首个原生多模态模型,支持1M上下文,重点强化Coding和Agent能力,上线即以MIT协议开源。微博它是320B-A18B的MoE架构,总参数与GLM-4.5相当,但激活参数只有18B、层数45层,几乎减半,用稀疏注意力加线性注意力的混合架构把长上下文的服务成本压下来。微博

智谱当晚同步放出了六项基准的官方成绩:Terminal Bench 2.1拿到84.3,DeepSWE v1.1为63.4,GDPVal-AA v2为1773,在对标Claude Opus 4.8、GPT-5.6 Terra、Gemini 3.7 Flash的六项测试里多项领先。

“牛来”是智谱的,权重当晚就开源:80%的跑分要按63%看,免费窗口关上之前,Agent用户该抢的抢、该等的等

二、跑分要打折看:80%是10道题的成绩

牛来匿名期刷屏的那个"80%通过率",来源是这样的:有人拿了十个真实的软件工程任务去考它,让模型自己读代码仓库、找bug、改完再跑测试,结果Ox Alpha通过了八个,通过率八成。知乎拿10道题的通过率当模型整体实力,就像用一次摸底考当高考分。

全量数据是另一回事:独立研究者Ben Davis随后跑了全量113题测试,Ox Alpha的成绩落在63%附近,和GPT-5.6 Sol基本打平,并没有拉开差距。知乎智谱官方给出的DeepSWE v1.1完整成绩也是63.4%,两边能对上;部分社区复测图里还出现过58%附近的更低读数。Artificial Analysis在8月26日更新的智能指数里,把GLM-5.3-Flash按折后价格计,给出57分,正好卡在成本-智能帕累托前沿的拐点上——这个位置的含义是"性价比突出",而不是"智能登顶"。

海外的兴奋情绪也在降温:Abacus.AI CEO Bindu Reddy公开说测试表现低于预期,沃顿商学院教授Ethan Mollick的评价是「惊艳程度一般」。知乎国内开发者刘聪的实测则给出了另一面:ox除了视觉之外,coding能力也不错,实现卡丁车小游戏,登录系统、排名、多场地、多车型选择,直接就好了。知乎

“牛来”是智谱的,权重当晚就开源:80%的跑分要按63%看,免费窗口关上之前,Agent用户该抢的抢、该等的等

所以正确的打开方式是:把80%的传闻按58%~63%来看。它大概率是目前最强的开源Agent模型之一,但不是神话。

三、免费窗口:用量爆炸,白嫖要讲姿势

牛来这波热度,一半来自实力,一半来自"免费"。OpenCode官方确认,Ox Alpha在平台上免费使用一周,窗口期内用量直接爆炸:它一夜之间冲到调用榜第一,还终结了DeepSeek在OpenCode连续56天的霸榜纪录。微博连正在收购OpenRouter的Stripe CEO帕特里克·科里森都亲自上手测了一圈,然后在X上留下一句「非常令人印象深刻」。知乎

“牛来”是智谱的,权重当晚就开源:80%的跑分要按63%看,免费窗口关上之前,Agent用户该抢的抢、该等的等

流量数据能说明这轮白嫖有多猛:光OpenRouter前6个完整自然日,就跑出23.2万亿Token,ox-alpha以23.2T排在用量榜第一,是第二名的2.3倍。小红书截至8月24日,仅Hermes、Claude Code等前五大调用入口,对Ox Alpha的累计调用就突破了4万亿token,OpenRouter全站日使用量达到DeepSeek的两倍以上。知乎

对准备上手的用户,三条白嫖纪律:

  1. 不传敏感数据。 免费通道本质是匿名测试通道,数据处理没有商用级承诺,代码仓库和商业文档别直接喂进去。

  2. 不建长期依赖。 免费窗口一关,端点随时可能变价、限流或下线,把生产流程挂在上面等于裸奔。

  3. 存好自己的配置。 趁窗口把prompt、工作流配置和测试记录保存下来,窗口关了还能带着结论迁移。

另外留一个时间锚点:智谱今年1月8日在港股上市,下周一(8月31日)将发布2026年中期财报。知乎定价和商业化节奏大概率在那前后明朗,免费窗口还剩几天,该测的抓紧测。

四、OpenRouter成了大厂匿名试验场:本周还有两场戏

把视角拉远一点,牛来不是孤例:此前已有Pony Alpha(智谱)、Hunter Alpha(小米)、Elephant Alpha(蚂蚁)和Owl Alpha(美团)等多款国产匿名模型上线。小红书匿名上线、全网免费、全网猜身份、白嫖真实压测数据、官宣认领——这套打法已经标准化了,OpenRouter实质上成了大厂的匿名试验场。

“牛来”是智谱的,权重当晚就开源:80%的跑分要按63%看,免费窗口关上之前,Agent用户该抢的抢、该等的等

本周还有两个值得盯的节点。一是Anthropic的Opus 5.1:预测网站也显示,Anthropic有74%的概率在两周内发布其下一代旗舰模型(极有可能是Mythos或Fable 5.1)。微博另有消息人士爆料本周就会正式发布。二是Claude Fable 5.1已在灰度:Fable 5.1已开启灰度测试,部分Claude用户已悄悄用上,参照Fable 5当初的发布节奏(先抽5%用户测试,当天全量推送),业内推测Fable 5.1的全量发布已近在眼前,大概率8月底前上线,且定价不会上涨,仍延续每百万输入token 10美元、输出50美元的现价。微博如果Opus 5.1真的本周落地,那就是"开源性价比之王"和"闭源旗舰"同周对撞,Agent用户正好拿自己的任务集当裁判。

五、三类用户,三种操作

现在就想用的Agent/编程党: 趁免费窗口,用你自己的2~3个真实任务集跑通它,重点记录任务完成率和token消耗,和你现在的主力模型对比。窗口关闭后按折后定价重算一遍成本,再决定要不要长期切换——别拿别人的跑分替自己做决定。

开源自部署党: MIT协议、权重已放,这是你的主场。先确认集群能不能装下320B总参(18B激活是利好),重点验证混合注意力架构在你自己的长上下文负载下的成本表现,官方口径是注意力计算量比GLM-5.3降低3.01倍、KV缓存降低4.44倍,这是它相对上一代最大的变量。

观望吃瓜党: 不用急。牛来这波最大的价值是验证了"开源Agent模型能打",等三件事落地再看:Opus 5.1官宣后的实测对比、智谱8月31日前后的定价和财报口径、以及更多独立复测把DeepSWE全量成绩钉在58%还是63%。

继续观察的信号清单:①本周内Opus 5.1是否官宣,以及它与GLM-5.3-Flash的同题实测;②免费窗口关闭后OpenCode/OpenRouter的正式定价;③国产芯片集群的实际推理成本披露;④下一个匿名马甲什么时候出现——按现在的节奏,不会太久。

内容由AI生成

精选参考来源

1. 智谱认领神秘AI模型Ox Alpha牛来,使用量已达DeepSeek两倍以上!

2. 实测对比神秘模型-Ox牛来 和 DeepSeek-V4-Flash-Vision,谁是真牛?

3. 神秘新模型 OxAlpha 免费上线,引爆 AI 圈,这背后有哪些信息值得关注?

4. 【#智谱发布GLM5.3Flash#】智谱GLM-5.3-Flash于2026年8月26日正式发布,此前以匿名模型Ox Alpha(中文社区称“牛来”)在OpenRouter和OpenCode上测试一周,确认后当晚开放模型权重。320B-A18B MoE架构,MIT许可证开源,总参数与GLM-4.5相当但激活参数(18B)和层数(45层)几乎减半。GLM-5系列首个原生多模态模型,支持文本、图像、视频输入,100万token上下文窗口,采用稀疏注意力与线性注意力混合架构,大幅降低长上下文服务成本。

5. 大家好像已经习惯把前沿智能和前沿价格绑在一起,并认为这是技术进步必须支付的成本。但今天,GLM-5.3-Flash 来了。发布前,它以匿名模型Ox-Alpha 在 OpenCode 和 OpenRouter 上测试,迅速成为当周最受欢迎的模型,创下双平台调用量新高。这些请求流量,全部由国产芯片提供算力。📊 同样智力,1/40 价格320B 总参数,能力超过上一代 GLM-5.2。在 Artificial Analysis 综合智能指数中取得 57 分,与 Claude Opus 4.8 持平。定价是 GLM-5.3 的 1/10,限时折扣内 1/20,Opus 4.8 的 1/40。前沿智能,第一次不需要省着用。👁 GLM-5 系列首个原生多模态模型它会自己判断什么时候需要看一眼,再用看到的结果决定下一步。没有任何外部素材,自主运行 16 小时,搭出一套约 400 平方米的主厨自宅与测试厨房。在 ZCode 中,它能在代码、浏览器与图形界面之间协同工作,边做边验证自己的产出。💼 超越Coding的工作伙伴它能输出精美准确的PPT、研报、会计报表、法律文书。金融全程可追溯,法律按律师惯例批注留痕。GLM-5.3-Flash现已面向全球开源,接入 ZCode,纳入 GLM Coding Plan,API 同步开放。#智谱##How I AI###牛来模型确认为智谱GLM系列# 智谱的微博视频

6. 就在刚刚,Ox Alpha 的马甲终于掉了,居然是智谱!说实话,我一开始真以为,Ox Alpha是某家海外大厂藏起来测试的新模型😂毕竟它上周五突然匿名空降OpenCode和OpenRouter,一夜之间冲到调用榜第一,还终结了DeepSeek在OpenCode连续56天的霸榜纪录。海外开发者追着问它到底是谁家的,有人猜小米MiMo,连Gemini也参与了“认领”,不少网友干脆给它取名“牛来”。今天,这场狼人杀终于迎来了大结局。Ox Alpha的正式名字是GLM-5.3-Flash,也是GLM系列首个原生多模态模型。支持1M上下文,重点强化Coding和Agent能力,上线即以MIT协议开源。能力定位达到Opus 4.8级别,价格大约是后者的1/40。所以,这几条全AI圈都在讨论的“牛来”大模型,到底为什么热度这么高?1先重点聊一下GLM-5.3-Flash的Visual Coding能力。这里说的视觉,不是让模型识别一张图片,再告诉你里面有什么。对于前端和3D项目来说,你需要让它理解画面里的版式、空间和设计关系,继续把这些信息变成一个可以运行的产品。比如下面这个就是GLM-5.3-Flash在Blender中构建一个厨房,没有任何外部素材......我测试的时候,只给了它一张很简单的米色线框草图,让它从零制作一个LumaSeed桌面生态灯的3D发布页。没有现成产品图,草图只规定了大致版式,视觉细节需要它自己完成。可以看到,它做出来出的页面几乎没什么AI味,天气、时间和植物生长也被很好的组织在同一套产品逻辑里。我又给它换了一个更复杂的任务,又让它做一个引擎的3D 交互演示。外壳可以切换透明,叶轮和等离子流持续运动。拖动爆炸视图以后,五层零件沿轴线展开,标注还不能互相遮挡。下面是一次直出的效果👇我还让它做了一个3D版的云上风电岛,不仅要生成画面,还要让 15 点的雷暴触发风机停机,让 19 点的电池参与调峰。最后一道题,我让它从零做一款能通关的横版游戏《深海邮差》,需要自己处理潜艇移动、氧气、包裹完整度、洋流和危险物,还要加入视差、光束、粒子和无障碍模式。是不是视觉效果都非常不错?很多模型可以很快做出第一版,但功能增加几轮以后,前面能用的部分可能突然坏掉。这也是原生视觉能力进入Coding以后最有价值的地方。模型可以打开浏览器观察自己的输出,发现渲染和交互中的问题,再回到代码里修改。2我们再回头来看一下价格。GLM-5.3-Flash 的能力对标 Opus 4.8,但价格只有后者的约1/40,GLM-5.3的1/10。但Token便宜,不代表完成任务一定便宜。1/40价格真正有意义的前提,是模型能够完成那些原本需要昂贵模型处理的工作。GLM-5.3-Flash把激活参数降到18B,可以理解成一支专家团队每次只派合适的小组工作。它还采用了线性注意力与稀疏注意力结合的混合架构,相较GLM-5.3,注意力计算量降低3.01倍,KV缓存大小降低4.44倍。当然,这套架构也不是所有指标都已经做到最好,它的KV缓存仍略高于Kimi-K3和DeepSeek-V4-Flash,后面还有继续优化的空间。3值得一提的是,GLM-5.3-Flash的全部线上流量,由10万张国产卡提供服务!让模型在实验环境中跑通,和接住全球开发者突然涌入的真实流量,是两回事。这次Ox Alpha上线完全匿名,很多海外用户也不知道这个模型来自中国,尤其这里面还有多模态Coding、1M上下文和长时间Agent任务。这些请求对显存、通信、调度和稳定性都提出了更高要求,反而让测试结果更有说服力。为了适配国产芯片,智谱重新优化了推理引擎,并把多模态编码、提示词预填充和逐Token解码拆成可以单独调度的工作池。与最初的系统相比,端到端服务性能提高了3倍,单Token成本已经达到与主流英伟达GPU相当的水平!有意思的是,这套系统本身也有GLM-5.3参与优化,模型帮助工程师诊断瓶颈,改进后的系统再反过来承载模型。GLM-5.3-Flash已经正式面向全球开源,同步开放了API调用。这才是前沿智能从展示能力,走向真正普惠的重要一步。#牛来模型确认为智谱GLM系列# 微博vibelab# #vibework#

7. #智谱发布GLM5.3Flash#之前AI圈刷屏的神秘“牛来”终于官宣真身,智谱GLM‑5.3‑Flash正式发布,作为GLM‑5系列首个原生多模态模型,直接开源权重。 MoE架构兼顾性能与推理成本,编程、多模态能力拉满,评测可以对标海外第一梯队,价格却大幅下探,视觉还能直接参与代码调试流程。 国产大模型现在玩法越来越有意思,匿名先行跑测数据,再正式亮相。兼顾硬核能力、开源生态和亲民定价,不管开发者还是普通用户,都能实实在在吃到红利。

8. 今天,又有消息曝出:全新Opus 5.1模型,据传将在本周突袭发布。从此,智能体赛道又要大洗牌了。它有碾压级的编程能力、复杂的逻辑推理和长时间运行的AI Agent能力。单Token的智能水平,将再次被推到极限!而且,预测网站也显示,Anthropic有74%的概率在两周内发布其下一代旗舰模型(极有可能是Mythos或Fable 5.1)。巧的是,今天OpenAI也刚刚曝出一个十万亿参数模型,据传已完成后训练。GPT Astra、Fable 5.1/Mythos、Grok 4.7,我们即将迎来下半年最密集大模型发布潮!Opus 5.1本周登场,智能体赛道大洗牌「没有人准备好迎接即将到来的一切。下一代模型将带来一场本体论层面的冲击。」硅谷初创CEO Pietro Schirano在X上的一句感叹,形象描述了最近ASI赛道的盛况。消息人士爆料:Anthropic将在本周正式发布Opus 5.1模型。要知道,Opus 5才刚刚上线没几周,这种「卷死同行」的迭代速度,简直让人瞠目结舌。上一次出现类似的早期访问标识泄露时,正式发布仅隔了两周不到。那么,这个被寄予厚望的Opus 5.1,到底强在哪?据泄露信息显示,这一次升级并非简单粗暴地堆砌参数规模,而是将核心发力点放在了「单Token的智能水平」上。模型将重点强化以下三大能力: 碾压级的编程能力:直指「代码王座」,试图让Opus成为专业工程开发的「新默认选项」。 复杂的逻辑推理:面对多步骤任务不再「脑雾」。 长时间运行的AI Agent能力:能够真正自主接管复杂的工作流。业内猜测,Anthropic这么着急把Opus 5.1推上台前,一方面是为了缩小它与自家顶级模型Fable系列之间的能力差距。另一方面,也是感受到了来自死对头OpenAI的极大压力。在强敌环伺的下半年战场上,Anthropic必须抢占智能体应用生态的高地。

9. Fable 5.1已开启灰度测试,部分Claude用户已悄悄用上。参照Fable 5当初的发布节奏(先抽5%用户测试,当天全量推送),业内推测Fable 5.1的全量发布已近在眼前,大概率8月底前上线,且定价不会上涨,仍延续每百万输入token 10美元、输出50美元的现价。此前Anthropic曾一同发布Fable 5与Mythos 5,但完整版Mythos 5只向极少数国家安全机构开放,普通用户能用的公开版Fable 5加装了「安全分类器」,上线仅三天就因性能过强被紧急叫停,直到7月1日才恢复。一旦触发安全分类器,对话还会被Opus 5接管,安全限制近期仍在持续加码。因此开发者对Fable 5.1呼声很高,希望能取消5小时使用限制、扩大覆盖量。爆料者Pankaj Kumar则直言,Anthropic不会放出完整版Mythos。更巧的是,就在新模型消息传出当天,Claude突发全球大宕机,Mythos 5、Fable 5、Opus 5、Sonnet 5、Haiku 4.5全线波动近3小时,这已是今年第166次服务中断,最近五天就崩了7次。频繁宕机的背后,大概率是算力紧张,Claude Code每周50%的额度提升也延长到月底。而就在宕机前一天,Anthropic年化收入已飙至650亿美元,较去年底暴涨7倍,甩开OpenAI的400亿身位,年底剑指千亿规模。为接住这波增长,Anthropic通过SPV结构锁定约710亿美元芯片租赁债务,拿下AMD 50亿美元战略投资,并签下多份大型数据中心合同,全力冲向9到10月那近万亿美元的IPO窗口。一边是模型冲刺万亿估值,一边是服务频繁宕机,这就是当下Anthropic的冰火两重天。对Anthropic而言,Fable 5.1不只是版本号加0.1,更是证明公司能消化百亿级算力投资、IPO前夜必须打出的一张王牌,如果性能提升不明显,恐将面临更大压力。

10. 匿名模型"牛来"Ox Alpha 屠榜全球AI圈

11. 23万亿Token匿名跑,背后没有英伟达

12. GLM-5.3-Flash:Competitive Performance at Flash Cost

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章