当前位置:
AIGC文章详情

智谱认领匿名模型Ox Alpha,代码能力破DeepSeek56天霸榜今晚开源

源自158位全网作者

08-26 20:32

精选参考来源

1
#神秘牛来大模型冲上榜一#最近AI圈突然冒出来一个叫Ox Alpha的匿名模型,因为英文Ox是"牛",中文社区给它起了个接地气的名字叫"牛来大模型"。8月20日它低调上线OpenRouter平台后,调用量直接冲上榜首,刷新了平台单日调用纪录——光前五大应用对它的累计调用就突破了4万亿Token,还终结了DeepSeek连续56天霸榜的局面。更关键的是,它完全免费开放,每天算力据说达到100万亿Token级别。性能也很能打:在软件工程测试中得分80%,超过了GPT-5.6的52%和Claude的65%。开发者直呼"非常困惑"——一个来历不明的模型,把几家头部大厂都压了一头。那它到底是谁家的?社区已经扒了24小时"技术指纹":tokenizer、视频编码、报错码全都指向智谱GLM系列,甚至有开发者说99%确定就是智谱的东西。但谷歌DeepMind那边也有人暗示可能是Gemini新版。最有意思的是,到现在没人出来认领。主动匿名、免费放量、技术这么强——这操作本身就挺值得琢磨。各家厂商似乎都愿意"让产品自己说话",而不是靠品牌先入为主。无论最后是谁家的,这场猜谜游戏本身已经说明:AI的竞争方式变了,实力藏不住,也装不出来。
2
牛来进军 AI 行业了。。。牛来 SOTA AI !!!Ox Alpha(OpenRouter 上的模型 ID 为 stealth/ox-alpha,也有 OpenCode 上的免费版)。上线时间:大约2026年8月20日深夜(北京时间21日凌晨)以“隐身模型”(stealth model)身份低调出现在 OpenRouter 等平台。主要规格:约100万 token 上下文窗口最大输出约13万 token支持文本 + 图片 + 视频多模态输入支持工具调用目前限时免费(约一周,到8月27日左右),调用额度很宽松(平台宣称日处理量可达100T token级别)性能表现(初步测试):Ox Alpha 通过率约 80%Claude Fable 5 Max 约 65%GPT-5.6 Sol Max 约 52%其他如 GLM-5.3、Grok 4.6 也在60%左右这让它在编程/Agent编码能力上引发大量关注,看起来逼近甚至局部超过当前头部模型。但注意:测试样本量较小(10道题左右),后续有人复测结果有波动。身份猜测:目前没有官方认领,完全匿名。社区通过“指纹分析”(比如视频token消耗模式、错误提示语言、审查口径等)做了大量对比:最主流猜测:智谱(Zhipu AI)尚未正式发布的 GLM-5.3 相关版本(可能是 Flash 版或带多模态的视觉版),证据匹配度较高。
全部
来源
内容由AI生成

精选参考来源

1. #神秘牛来大模型冲上榜一#最近AI圈突然冒出来一个叫Ox Alpha的匿名模型,因为英文Ox是"牛",中文社区给它起了个接地气的名字叫"牛来大模型"。8月20日它低调上线OpenRouter平台后,调用量直接冲上榜首,刷新了平台单日调用纪录——光前五大应用对它的累计调用就突破了4万亿Token,还终结了DeepSeek连续56天霸榜的局面。更关键的是,它完全免费开放,每天算力据说达到100万亿Token级别。性能也很能打:在软件工程测试中得分80%,超过了GPT-5.6的52%和Claude的65%。开发者直呼"非常困惑"——一个来历不明的模型,把几家头部大厂都压了一头。那它到底是谁家的?社区已经扒了24小时"技术指纹":tokenizer、视频编码、报错码全都指向智谱GLM系列,甚至有开发者说99%确定就是智谱的东西。但谷歌DeepMind那边也有人暗示可能是Gemini新版。最有意思的是,到现在没人出来认领。主动匿名、免费放量、技术这么强——这操作本身就挺值得琢磨。各家厂商似乎都愿意"让产品自己说话",而不是靠品牌先入为主。无论最后是谁家的,这场猜谜游戏本身已经说明:AI的竞争方式变了,实力藏不住,也装不出来。

2. 牛来进军 AI 行业了。。。牛来 SOTA AI !!!Ox Alpha(OpenRouter 上的模型 ID 为 stealth/ox-alpha,也有 OpenCode 上的免费版)。上线时间:大约2026年8月20日深夜(北京时间21日凌晨)以“隐身模型”(stealth model)身份低调出现在 OpenRouter 等平台。主要规格:约100万 token 上下文窗口最大输出约13万 token支持文本 + 图片 + 视频多模态输入支持工具调用目前限时免费(约一周,到8月27日左右),调用额度很宽松(平台宣称日处理量可达100T token级别)性能表现(初步测试):Ox Alpha 通过率约 80%Claude Fable 5 Max 约 65%GPT-5.6 Sol Max 约 52%其他如 GLM-5.3、Grok 4.6 也在60%左右这让它在编程/Agent编码能力上引发大量关注,看起来逼近甚至局部超过当前头部模型。但注意:测试样本量较小(10道题左右),后续有人复测结果有波动。身份猜测:目前没有官方认领,完全匿名。社区通过“指纹分析”(比如视频token消耗模式、错误提示语言、审查口径等)做了大量对比:最主流猜测:智谱(Zhipu AI)尚未正式发布的 GLM-5.3 相关版本(可能是 Flash 版或带多模态的视觉版),证据匹配度较高。

3. 【#新模型OxAlpha引大规模身份猜测#,#神秘牛来大模型OxAlpha火了#】近日,一款名为 Ox Alpha 的匿名模型突然出现在 OpenRouter。Ox 本身就是「牛」的意思,国内网友很快给它起了一个更接地气的名字:「牛来」大模型。根据 OpenRouter 披露的信息,Ox Alpha 拥有 100 万 token 上下文,支持文本、图片和视频输入,可以调用工具,目前完全免费。上线后不久,开发者就把它接入编码 Agent,扔进真实代码仓库进行测试。初步测试结果显示,这款来历不明的「牛来」大模型,能力已逼近当前顶级代码模型。与此同时,有网友爆料,一款名为 korrine 的匿名模型正在 Code Arena 上进行测试。有人猜它是 Kimi K3.1,也有人将其指向 Qwen 和 MiMo,说啥的都有。8 月的大模型圈,突然变成了一场大型猜谜游戏。「牛来」大模型表现抢眼Ox Alpha 真正引发关注,靠的是代码能力。开发者 Ben Davis 从 DeepSWE 中抽取 10 项任务进行测试,Ox Alpha 完成了其中 8 项,通过率达到 80%。其公布的对比结果中,Fable 5 Max 为 65%,GLM-5.3 Max 和 Grok 4.6 xhigh 均为 62%,GPT-5.6 Sol Max 为 52%。DeepSWE 考察真实软件工程能力。模型需要阅读代码仓库,定位问题,修改代码,运行测试,再根据报错继续修复。相比单轮编程题,它更接近编码 Agent 的实际工作。不过,10 项任务的样本很小。随后,其他开发者在另一组 DeepSWE 子集上测试,给出的结果约为 63%。两次测试的任务范围和运行配置并不完全相同,暂时无法据此确定 Ox Alpha 的准确排名。不过这些结果初步显示,这款匿名模型已经表现出很强的长程编码潜力,能力逼近当前头部模型。「牛来」大模型到底是谁家的?「牛来」大模型的身份,目前流传最广的说法是智谱尚未发布的 GLM-5.3 Flash,或 GLM-5.3 的多模态版本。有人还专门写了个博客进行分析:1. 最强证据来自视频编码器。四段不同帧率、时长和分辨率的视频中,Ox Alpha 消耗的视觉 token 与 GLM-5V-Turbo 完全一致。MiMo、Qwen 和 GLM-4.6V 都呈现出明显不同的结果。2. 文本 tokenizer 也高度吻合。研究者测试了 25 组提示词,Ox Alpha 与 GLM-5.3 的 token 数量始终保持固定的 75 token 差值。3. 其他特征也指向智谱。Ox Alpha 拒绝处理音频,与 GLM-5V 的路由方式相同;回答风格、Agent 执行步数和推理接口也很接近 GLM。智谱此前还曾用 Pony Alpha 匿名测试 GLM-5,具备相同操作先例。还有网友从对话中寻到蛛丝马迹。Ben Davis 认为 99% 确定这就是 GLM-5.x。这些线索提高了 GLM 说的可信度,但还不足以完成身份确认。截至目前,OpenRouter、智谱都没有公开回应。korrine 身份更扑朔迷离「牛来」大模型的身份还扑朔迷离,Code Arena 又出现了一个名为 korrine 的匿名模型。最初,不少人猜测它是 Kimi K3.1,原因是 Kimi K3 发布前,曾被认为以 kivine 的代号接受测试。kivine 与 korrine 结构相近,因此引发了联想。不过,最早传播消息的爆料者随后补充称,此前获知的 Moonshot 新模型可能对应另一个代号 adamant-ananke。korrine 也可能来自 Qwen 等其他中国团队。评论区中,还有人将它指向 MiMo V3。大模型厂商为什么喜欢「挂马甲」?匿名测试正在成为大模型正式发布前的重要环节。在 Arena 中隐藏厂商和型号,可以尽量削弱品牌带来的先入为主。用户看不到模型身份,只能根据实际输出进行选择,最终积累的对战结果,也更接近真实用户体验。OpenRouter 提供的是另一类测试环境。开发者会把模型接入各种编码 Agent,让它进入真实仓库,连续调用工具,处理长达数小时的软件工程任务。上下文能否保持稳定,工具调用是否可靠,模型会不会在长程任务中循环或跑偏,都能在高强度使用中迅速暴露。对模型厂商来说,这相当于一次公开压力测试。团队可以提前观察失败案例,验证推理服务的承载能力,也能在正式发布前积累真实口碑。此外,「猜模型」现在也越来越成为一种营销手段了,身份悬念确实可以拉长讨论周期。最后回到模型本身。如果 Ox Alpha 真是一款 Flash 模型,其代码能力已经逼近头部水平,那么资源投入更高、能力更完整的完整版,又会把上限推到哪里呢?(新浪)

4. #神秘牛来大模型冲上榜一#现在大模型赛道早就不是拼噱头讲故事的阶段,实打实的代码工程能力、长文本处理能力才是硬通货。DeepSWE测试模拟真实程序员日常工作,读仓库、改bug、调试代码,难度远高于普通笔试刷题,牛来能拿到80%的通过率,说明它已经能深度介入真实生产开发场景,不是只能聊天的娱乐型AI。百万级上下文窗口,意味着可以一次性读完整份项目文档、长视频内容,处理复杂Agent任务的上限极高。 更有意思的是这场全网“猜身份”大戏。技术指纹高度贴合智谱GLM,之前智谱就有过匿名上线测试模型的先例,业内基本心里有数。海外大厂也下场蹭热度,反而侧面印证了国产大模型现在的实力已经具备全球竞争力。不限量免费一周的操作,直接让全球开发者蜂拥体验,算力储备雄厚到夸张,背后的技术底气确实足。

5. 这两有关ox alpha的猜测很多,有人因为其服务器在美国就猜测这可能是美国的模型。不过就在刚刚,知情人士保证这肯定是一个中国模型,并且下周就发布。我猜应该是小米的mimo,毕竟上次更新已经挺久了,智谱则是前段时间才更新过。

6. 刚看到那个 Ox Alpha 空降榜首把 DeepSeek 拉下马了,调用量夸张到万亿级别,技术参数也猛。社区里很多人猜是智谱或谷歌,但都不认账,小米也已辟谣。这匿名玩法挺刺激但风险也明摆着,商业代码别乱喂。我押智谱,但没实锤前就当吃瓜吧。#神秘牛来大模型冲上榜一#

7. 【匿名模型Ox Alpha:一场关于技术血统与审查边界的压力测试】OpenRouter近期上线了代号为Ox Alpha的匿名模型,因其身份成谜引发了开发者圈的集体围观。从Token生成速度、思维链CoT的逻辑风格以及对特定历史事件在不同语种下的差异化反应来看,这极大概率是来自智谱AI的GLM 5系列变体,或者是小米、阶跃星辰等国内大厂的未发布新作。该模型在英文环境下能详尽讨论敏感议题,切换到中文则触发回避机制,这种双重标准揭示了国产模型在出海适配与合规边界间的微妙平衡。目前它在处理复杂代码任务时表现出了逼近顶级模型的潜力,但在视觉推理和CSS布局上仍有明显短板。这种匿名发布实际上是厂商在不背负公关压力的情况下,利用真实流量进行灰度测试的手段。大家热衷于用特定话题去试探它,并非真的想在AI里学历史,而是将其作为识别模型血统的矿井金丝雀。对于用户来说,争论美国实验室的隐私策略与中国模型的开放权重哪个更可靠,往往不如性能性价比来得实在。当算力博弈进入深水区,模型性能的吸引力往往会战胜对数据流向的疑虑。这提醒我们,AI的工具属性正在超越其国别标签,而用户在享受免费推理的同时,也正以数据为对价,默认参与了一场大规模的算法压力测试。

8. #神秘牛来大模型冲上榜一#最近AI圈被一头“牛”刷屏了——代号 Ox Alpha 的匿名大模型悄悄上线 OpenRouter,结果直接冲上榜一,还刷新了平台单日用量纪录!网友给它起了个接地气的名字:“牛来”大模型。几个值得关注的点:· 配置拉满:100万token上下文,支持文本+图像+视频多模态,目前完全免费· 代码能力亮眼:DeepSWE测试通过率约80%,超过Claude Fable 5和GPT-5.6 Sol· 终结了DeepSeek在OpenCode连续56天的霸榜纪录· 周调用量飙到11.6万亿Token,冲进全球前二最精彩的是“猜身份”环节——社区通过视频编码器、文本分词器等技术指纹比对,发现多项特征高度指向智谱GLM系列;但也有谷歌DeepMind研究员暗示可能是Gemini新版。截至目前,没有任何厂商正式认领。匿名上线、免费压测、靠实力说话,这波操作确实有点意思。你觉得“牛来”到底是谁家的? #微博AI创作季#

9. 实测了 OpenCode 免费的神秘模型 Ox Alpha:三行代码,它就“招了”

10. 全网爆火的牛马大模型,大概率是GLM-5.4V?

11. 神秘“牛来大模型”火爆外网,部分测试超过 Fable、GPT-5.6

12. 中国神秘大模型登顶,超越Claude! 【网易新闻】8月20日,模型分发平台OpenRouter上悄悄冒出一个没有署名的AI模型,代号stealth/ox-alpha,提供为期一周的免费访问。它不挂任何公司招牌,却在编程测试里跑出了让不少人吃惊的成绩。独立研究人员Ben Davis在8月21日发布的测试报告里写下一句分量很重的判断,他"99%确定"这个匿名模型属于智谱尚未发布的GLM-5.x系列。 Davis的溯源从几个技术维度同时下手,其中视频编码器被认为是最硬的证据。 在四组受控视频测试中,ox-alpha与GLM-5V-Turbo的video token消耗完全一致,两者都呈现出帧率无关的帧采样方式、约每秒147 token的时长缩放比例以及逐帧分辨率缩放机制这三项相同特征。相比之下,被列为候选的小米MiMo v2.5、Qwen 3.8 Max和GLM-4.6V都表现出明显不同的视频编码特征。分词器测试同样指向同一个方向,对25个不同提示词测试后,ox-alpha的token计数与GLM-5.3完全吻合,只存在固定的+75 token隐藏封装差异,意味着两者很可能共享同一套词汇表。再加上ox-alpha拒绝音频输入的行为与GLM-5V一致,而主要竞争候选MiMo v2.5恰恰支持音频输入,这一条又把后者的可能性往下压了一截。连输出风格这种细节都没放过,ox-alpha每千字符约使用1.3个emoji,与GLM和Qwen系列接近,而Claude、GPT-5.6和Grok在相同环境下emoji使用率接近于零。 而能力数据是另一条线索。报告援引DeepSWE基准称,ox-alpha在10个确定性任务中通过8个,Pass Fable 5通过率65%,GLM-5.3和Grok 4.6均为62%,GPT-5.6-sol为52%。在meriyah-explicit-resource-declarations这个任务上,ox-alpha一次通过,而GLM-5.3、GPT-5.6-sol和Grok 4.6此前都是0/4。它还保持了51469项回归测试全部通过,并在一次包含69次工具调用的智能体任务里只出现一次错误、没有发生重试循环。不过要客观说一句,不同模型的测试次数并不完全一致,ox-alpha目前样本量也偏小,这些数字还需要更多独立测试来验证,不能直接当成定论。 此外,时间点也对得上,智谱8月14日刚发布纯文本版GLM-5.3,统一视觉旗舰一直是社区盯着的方向。更重要的是智谱有过先例,此前的Pony Alpha最终被确认与GLM-5有关,这种通过隐身渠道先放出来试水的做法并不陌生。规模上也说得通,报告称ox-alpha解码速度与GLM-5V-Turbo相差约6%,后者拥有744B总参数、40B激活参数,由此推测ox-alpha可能采用类似规模的MoE架构。报告还认为如果激活参数确实在40B左右,运营方声称的每日100万亿token服务能力在技术和成本层面才更具可行性。与此同时,DeepSeek因没有发布视频能力且分词器不同被排除,谷歌、Qwen、xAI、OpenAI和Anthropic也因分词器、输出风格或视频编码器不匹配而被逐一划掉。 需要反复强调的是,以上所有结论都建立在个人测试与技术推断之上,智谱至今没有作出官方回应。在正式认领之前,ox-alpha究竟来自何方还不能盖棺定论。免费窗口可能持续到8月27日,Davis也提到此前一些类似的隐身模型在免费测试结束后由相关中国AI实验室正式认领。如果这次最终证实是智谱的下一代多模态旗舰,那么这场OpenRouter上的匿名测试就成了一次正式发布前的公开预演。 总之,从中国AI产业的视角来看,无论它最终姓谁,能在编程和多模态推理上与国际头部模型正面较劲的国产力量又多了一个,这本身就是一个积极的信号。多项独立测试把线索指向同一个方向,接下来几天,答案大概率会自己浮出水面。

13. 神秘AI模型编程测试超越GPT-5.6和Claude,技术特征指向智谱未发布新模型

14. 国产匿名大模型悄然登顶

15. 9个探针黑箱测大模型!Ox Alpha与GLM-5.3Tokenizer指纹4项全匹配

16. 神秘Ox Alpha模型限免:DeepSWE跑分碾压Claude Fable 5

17. Gemini 4.0重大泄露:DeepSeek V4 Flash Vision与V5爆料,OX Alpha疑似Minimax?|AI新闻

18. Ox Alpha 大模型测评报告!谁家模型这么能打?

0
扫一下,分享更方便,购买更轻松
1评论

  • 精彩
  • 最新
  • opencode go 之前是又卡又慢,现在报错,无了

    校验提示文案

    提交
提示信息

取消
确认
评论举报

最新文章 热门文章