当前位置:
AIGC文章详情

刷屏的免费"牛来":一天80%一天63%,接不接入先看这篇

源自33位全网作者

01:56

这周的大模型圈,主角是一头没有名字的"牛"。

8月20日,一个叫OxAlpha的匿名模型突然出现在OpenRouter上。36氪Ox是"牛"的意思,国内网友很快给它起了个吉利的名字:“牛来”。先说清楚,它不是最近刷屏的那部同名动画电影——这个没有票房,但有104.86万token的上下文。

而且是免费的。新智元OpenCode还直接把它接进了自家平台,社区传言"几乎不限量",免费窗口大约一周。微博配上单次13万token输出、文本/图片/视频多模态输入、支持工具调用、专攻代码和长程Agent这套规格,开发者圈一下就炸了:有来测跑分的,有来猜身世的,更多的是来薅羊毛的。

刷屏的免费

跑分打架,信哪边都只能信一半

"牛来"刷屏,主要靠一组跑分:开发者Ben Davis从DeepSWE里抽了10项任务,OxAlpha完成了8项,通过率80%。36氪他给出的对比里,Fable 5 Max是65%,GLM-5.3 Max是62%,GPT-5.6 Sol Max只有52%。微博

刷屏的免费

数字看着很炸裂。但很快,另一位开发者在不同DeepSWE子集上测出的结果只有63%左右。36氪Abacus.AI的CEO Bindu Reddy公开说,他们测下来只达到较早一代模型的水平;沃顿教授Ethan Mollick也评价"惊艳程度一般"。微博从80%到63%,差得不算冤枉。DeepSWE考的是真实软件工程能力:读代码仓库、定位问题、改代码、跑测试、再根据报错继续修,这种长程任务本来就波动大,10道题的样本,抽得好一点或差一点,结果就是十几个百分点的差距。两次测试的任务、配置还不完全一样,严格说根本没法互相对比。

所以结论可以收着点说:OxAlpha的长程编码能力摸到了一线水准的边,但离"碾压旗舰"还差得远。对一个免费模型来说,"值得测一测"本身已经是足够的理由。

全网在做亲子鉴定,证据链指向智谱

让这头牛出圈的第二件事,是没人知道它是谁家的。官方一个字不说,社区只好自己做"数字DNA鉴定":

有人拿25组提示词对比OxAlpha和GLM-5.3的token计数,发现永远固定差75个token,很可能就是一段隐藏系统提示词——tokenizer就像模型的基因序列,很难造假;四段不同帧率、分辨率的视频,OxAlpha消耗的视觉token和智谱GLM-5V-Turbo完全一致;连API报错信息的格式,都被扒出和智谱服务端有对应关系。微博再加上智谱有前科——当年GLM-5发布前,就是挂着PonyAlpha的名字匿名测试的。36氪开发者Ben Davis直接说"99%确定是GLM-5.x系列"。

刷屏的免费

也有猜谷歌的:一位DeepMind研究员近期发言暧昧,而Gemini 3.5 Pro确实迟迟没露面。微博还有更野的说法,是Cursor拿智谱开源模型自己训了一版,套了个牛头。截至目前,OpenRouter和智谱都没有回应。

其实它是官方试水还是事件营销,对用户没那么重要。重要的是这套"匿名挂马甲+免费开放"的玩法正在变成模型厂商的标准动作:用免费换真实流量压测,用匿名换无偏评测,用揭晓换一波传播。PonyAlpha之后有OxAlpha,后面大概率还排着队。

免费期怎么薅,以及三个坑

如果你平时在用Claude Code、Codex、OpenCode这类编程Agent,这个羊毛值得薅。

上手路径两条:一是在OpenRouter上直接选用OxAlpha;二是OpenCode里输入/models,选择Ox Alpha Free(Zen接口里对应x-preview-f-free)。按OpenCode Zen文档的说法,这个模型零数据留存,也不会拿你的数据做训练。知乎

刷屏的免费

但别把匿名模型当正式员工。有实测过的知乎用户说得挺对:拿它做可验证、可回滚的任务——解释一个小仓库、补测试、重构一段独立函数、和你常用的模型同题对比,好不好看diff、看测试结果说话。知乎刚被这轮API调价刺到的朋友,也可以把它当一段时间的免费备胎。

三个坑先摆在这:

  1. 免费期随时可能结束。目前说法是一周左右,参数和限制随时可能调整。今天薅可以,别把工作流搭在它身上;

  2. 别喂敏感代码。就算承诺零留存,提供方毕竟不明,按你自己的安全规范处理;

  3. 关键任务不要押上去。匿名模型没有SLA,出了问题没处说理;哪天官方揭晓它只是个"Flash"或者实验版,能力再波动一次也别意外。

至于完全不写代码的朋友,不用焦虑。这头牛卷的是编程Agent的底层,离你日常的问答、写文档还有一层距离,瓜可以看,但不必逼自己记模型ID。

接下来,比揭晓谜底更值得盯的

两个信号值得留意。第一,按OpenRouter此前几次匿名Alpha模型的惯例,匿名期结束总要有人出来"牵牛回家"官宣认领。如果真是智谱GLM-5.x,正式版会不会保留同样激进的规格、国内会不会同步上线,才是真正影响钱包的信息。第二,8月的猜谜不止这一头:CodeArena上还有一款叫korrine的匿名模型,被猜是Kimi K3.1。36氪LMArena上也冒出了代号adamant-ananke的匿名灰测,预测市场里有88%的押注认为下一款K系模型会在9月底前发布。哔哩哔哩灰测一个接一个地冒,这波"马甲潮"短期不会停。

错过这次免费窗口也不用太可惜。匿名模型时代,免费窗口只会越来越多。真正值钱的能力,是看清跑分打架时信哪边、免费羊毛里哪些值得真接进工作流。

精选参考来源

1
神秘「牛来」大模型刷屏,限时免费
2
赛博茶馆这两天AI圈最魔幻的事,莫过于全网都在给一个"匿名大模型"做亲子鉴定。它叫Ox Alpha,8月20日突然以匿名身份出现在OpenRouter上,104.86万token上下文、单次13万token输出、支持文本图片视频多模态,专门瞄准代码、长周期Agent和复杂推理——规格激进得离谱。更离谱的是OpenCode直接宣布它在Go平台几乎不限量免费使用,有人甚至说每天100万亿token级别的服务容量。免费+匿名+超强规格,三重Buff叠满,开发者们立刻蜂拥而上给它出题。然后侦探游戏就开始了。网友从Tokenizer一路扒到API报错层。有人拿25组不同Prompt做对比测试,发现Ox Alpha和GLM-5.3的token计数呈现高度一致的固定偏移关系——多出来的那75个token,恰好能被一段隐藏System Prompt解释。视频编码方式也被扒出来和智谱的多模态方案高度相似。甚至API的报错信息格式,都有人找到了和智谱服务端的对应关系。整套"数字DNA鉴定"做下来,社区讨论度最高的嫌疑人就两个:智谱,或者谷歌。猜智谱的占绝大多数,毕竟Tokenizer指纹这种东西很难造假,它就像模型的基因序列一样底层。猜谷歌的则盯着DeepMind员工近期的暧昧发言,以及那个迟迟没有正式露面的Gemini 3.5 Pro。有意思的是,另一个声音也在流传:有人怀疑这是Cursor拿智谱开源模型自己训了一版,然后套了个牛头。毕竟Cursor作为当前最赚钱的AI编程工具,有动机也有能力做这件事。实测结果呢?非常分裂。有社区测试显示Ox Alpha在代码和Agent任务上击败了GPT-5.6 Sol和Fable 5,但Abacus.AI的CEO Bindu Reddy公开说他们测下来只达到较早一代模型水平,沃顿教授Ethan Mollick也说"惊艳程度一般"。这个分裂本身其实挺值得玩味的。我的判断是:不管Ox Alpha最终被证明是谁家的,它已经完成了三件事。第一,验证了一个新的模型发布范式。匿名发布+免费开放+社区自证,比任何营销都有效。短短三天,全网都在帮它做评测和传播,这个流量成本为零。第二,暴露了"开源模型边界"的模糊地带。如果它真的是基于GLM开源版本做后训练的产物,那智谱到底该高兴还是紧张?开源生态的繁荣意味着更多衍生品,但也意味着有人可能用你的基座做出比你更强的产品。第三,给所有模型厂商提了个醒——在模型能力趋同的今天,你的Tokenizer就是你的指纹,根本藏不住。技术壁垒越来越薄,真正的竞争力在别处。最有意思的是,按照OpenRouter最近几次Alpha模型的惯例,匿名期结束之后总得有人出来"牵牛回家"。到时候谜底揭晓,不管牛是谁家的,它都已经改变了社区对"匿名模型"这件事的认知。问题是:当一个匿名模型能在三天内引爆全网讨论,这到底是模型的胜利,还是营销的胜利?🤔#牛来大模型 #OxAlpha #AI大模型 #赛博茶馆
全部
来源
内容由AI生成

精选参考来源

1. 神秘「牛来」大模型刷屏,限时免费

2. 赛博茶馆这两天AI圈最魔幻的事,莫过于全网都在给一个"匿名大模型"做亲子鉴定。它叫Ox Alpha,8月20日突然以匿名身份出现在OpenRouter上,104.86万token上下文、单次13万token输出、支持文本图片视频多模态,专门瞄准代码、长周期Agent和复杂推理——规格激进得离谱。更离谱的是OpenCode直接宣布它在Go平台几乎不限量免费使用,有人甚至说每天100万亿token级别的服务容量。免费+匿名+超强规格,三重Buff叠满,开发者们立刻蜂拥而上给它出题。然后侦探游戏就开始了。网友从Tokenizer一路扒到API报错层。有人拿25组不同Prompt做对比测试,发现Ox Alpha和GLM-5.3的token计数呈现高度一致的固定偏移关系——多出来的那75个token,恰好能被一段隐藏System Prompt解释。视频编码方式也被扒出来和智谱的多模态方案高度相似。甚至API的报错信息格式,都有人找到了和智谱服务端的对应关系。整套"数字DNA鉴定"做下来,社区讨论度最高的嫌疑人就两个:智谱,或者谷歌。猜智谱的占绝大多数,毕竟Tokenizer指纹这种东西很难造假,它就像模型的基因序列一样底层。猜谷歌的则盯着DeepMind员工近期的暧昧发言,以及那个迟迟没有正式露面的Gemini 3.5 Pro。有意思的是,另一个声音也在流传:有人怀疑这是Cursor拿智谱开源模型自己训了一版,然后套了个牛头。毕竟Cursor作为当前最赚钱的AI编程工具,有动机也有能力做这件事。实测结果呢?非常分裂。有社区测试显示Ox Alpha在代码和Agent任务上击败了GPT-5.6 Sol和Fable 5,但Abacus.AI的CEO Bindu Reddy公开说他们测下来只达到较早一代模型水平,沃顿教授Ethan Mollick也说"惊艳程度一般"。这个分裂本身其实挺值得玩味的。我的判断是:不管Ox Alpha最终被证明是谁家的,它已经完成了三件事。第一,验证了一个新的模型发布范式。匿名发布+免费开放+社区自证,比任何营销都有效。短短三天,全网都在帮它做评测和传播,这个流量成本为零。第二,暴露了"开源模型边界"的模糊地带。如果它真的是基于GLM开源版本做后训练的产物,那智谱到底该高兴还是紧张?开源生态的繁荣意味着更多衍生品,但也意味着有人可能用你的基座做出比你更强的产品。第三,给所有模型厂商提了个醒——在模型能力趋同的今天,你的Tokenizer就是你的指纹,根本藏不住。技术壁垒越来越薄,真正的竞争力在别处。最有意思的是,按照OpenRouter最近几次Alpha模型的惯例,匿名期结束之后总得有人出来"牵牛回家"。到时候谜底揭晓,不管牛是谁家的,它都已经改变了社区对"匿名模型"这件事的认知。问题是:当一个匿名模型能在三天内引爆全网讨论,这到底是模型的胜利,还是营销的胜利?🤔#牛来大模型 #OxAlpha #AI大模型 #赛博茶馆

3. 【#思进摘要点评##牛来##OxAlpha# 神秘「牛来」掀翻硅谷!谷歌抢着认领被全网笑惨】(资讯来源 | 新智元)神秘「牛来」掀翻硅谷!匿名大模型引发全网"猜爹"大战8月20日,匿名大模型 Ox Alpha(网友戏称"牛来")空降 OpenRouter:104万 token 超长上下文、文本/图像/视频多模态输入、专攻代码与复杂推理,免费一周。上线48小时内,开发者们涌入测试。独立研究者在 DeepSWE 编码基准上跑出亮眼成绩,社区迅速开启"技术侦探"模式——通过 tokenizer、错误码、视频编码器指纹比对,99% 概率指向智谱 AI 的 GLM-5.x 系列。有趣的是,一位 DeepMind 研究员也曾暗示 Ox Alpha 可能是下一代 Gemini Pro,但社区证据链 overwhelmingly 指向智谱。这场"猜爹"游戏本身,就折射出全球 AI 竞争格局的深层嬗变。从 Pony Alpha 到 Ox Alpha,中国厂商的"匿名发布"已成标准出海动作:用免费换真实流量压测,用匿名换无偏评测,用揭晓换事件营销。当国产大模型用实打实的工程战力与性价比在国际舞台刷存在感,AI 应用与成本规则正在被加速重构。这头"无主牛模王"到底是谁家的?答案或许已经写在代码指纹里……详情请见原文:网页链接 #AI#

4. OpenCode 新上的 Ox Alpha Free 和 DeepSeek V4 Flash 多模态,值得试吗?

5. Kimi K3.1疑似现身LMArena!匿名灰测,88%押注9月底前发布

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章