当前位置:
AIGC文章详情

一周三个匿名模型潜入竞技场:它们是谁、谁值得等,证据我全整理好了

源自65位全网作者

16:26

关注竞技场(Chatbot Arena)的朋友,这周应该已经注意到不对劲了:平时新模型都是一个个来,这次是仨"没人认领"的代号模型,几乎同时出现在不同赛场上——一个在图像盲测区,一个在编程盲测区,还有一个直接在 OpenRouter 上限免开测。

对追榜党来说,这等于三个盲盒同时摆在面前。我把微博、知乎、小红书和几家科技媒体这几天的线索交叉对了一遍,逐个拆给你看:哪些证据硬、哪些是脑补、现在该干嘛。

盲盒一:luna-lisa-alpha,大概率是 OpenAI 新图像模型,但未必是旗舰

先说时间线。8 月 9 日,LMArena(就是大家熟悉的竞技场,今年官方已改名 ArenAI,不少媒体仍沿用旧称)的图像盲测区出现了一个叫 mona-lisa-1 的匿名模型。有人用 OpenAI 官方的图像检测工具去查,检出了 SynthID 水印——这是 OpenAI 系图像模型的数字签名。知乎海外测试者 @vladimircherner 的第一轮结论是:细节比 GPT Image 2 丰富,背景伪影几乎消失,还能生成密集的信息图表。

8 月 21 日,续作来了:luna-lisa-alpha。测试者 @chetaslua 直接判断"这是一个新的 GPT Image checkpoint,上一个版本叫 mona-lisa-1",知识截止时间更新,文字渲染很强。知乎社区测出的提升点集中在三处:一是角色一致性大幅跃升——同一角色连续多张图,外观服装风格都稳得住,这是 GPT Image 2 被吐槽最久的短板;二是颗粒感噪点明显减少;三是文字渲染进一步变强,手机界面、网页设计稿里的复杂 UI 文字都排得清晰可读。微博

为什么是现在?往前看一周就明白了:8 月 11 日前后,多位博主吐槽 GPT Image 2"降智"——出图发黄、细节变碎、“感觉回到上一代”。微博现役旗舰口碑滑坡,新版本 checkpoint 进场救火,动机完全对得上。

但反证也得说清楚。知乎有用户实测后泼了冷水:效果没有传的那么惊艳;而且 luna 这个前缀,更像是 OpenAI 的廉价版产品线(Luna 系列 8 月初刚大幅降价,比 DeepSeek 还便宜);更微妙的是,mona-lisa-1 能检出 SynthID,luna-lisa-alpha 反而检测不出来。知乎所以我的判断是:身份大概率是 OpenAI 下一代图像模型没跑,但它是旗舰"GPT Image 2.5"还是廉价版,官方没认领之前谁说了都不算。

盲盒二:OxAlpha,身份存疑,但它是现在唯一能白嫖的

8 月 20 日,AI 模型聚合平台 OpenRouter 上线匿名模型 OxAlpha,官方只描述为"面向编码、长时间智能体任务和实际生产环境的前沿模型",限免开放一周。微博参数很能打:约 104.8 万 token 上下文,最大输出 13.1 万 token,支持文本、图像、视频输入。36氪开源编程智能体 OpenCode 当天就宣布接入,还直接备好了每天 100 万亿 token 的容量招呼开发者来压测。微博

战绩方面,独立研究员 Ben Davis 用软件工程基准 DeepSWE 的 10 个子任务测试,OxAlpha 通过率约 80%,高于 Claude Fable 5 的 65%、GLM-5.3 和 Grok 4.6 的 62%、GPT-5.6 Sol 的 52%。注意,这是个人测试,DeepSWE 官方榜还没收录它,先别当成官方结论。微博

一周三个匿名模型潜入竞技场:它们是谁、谁值得等,证据我全整理好了

身份上目前两派。一派认为它来自智谱,社区比对发现它的一些技术特征与智谱之前的模型相似。微博另一派则猜是小米的 MiMo 3.0,理由是小米集团 CFO 8 月 18 日刚在财报会上透露新一代 MiMo"有望很快发布",而且小米之前也搞过匿名内测。36氪我的判断很实际:身份先别纠结,这是三个盲盒里唯一现在就能公开免费用的,限免一周,手慢无。

盲盒三:korrine,证据最弱,但它背后的正主可能最快官宣

8 月 22 日,小红书有科技账号称,匿名盲测竞技场 Code Arena 里冒出一个代号 korrine 的模型,"业内多方情报交叉比对"指向月之暗面正在暗测的 Kimi K3.1。小红书先说明:这只是单一来源,证据强度是三个盲盒里最弱的,将信将疑即可。

而且这不是 Kimi 第一次这么干。K2.5 和 K2.6 当年就是分别以 Kiwido、Kiwire 的匿名代号被社区认出来的,7 月中旬代号 Kivine 的匿名模型又在外网刷屏,开发者普遍把它认作 K3 测试版。36氪开发者用它一句话就能做出像素风射击场、沙漠商队模拟这样的完整网页应用,官方后来正式下场认领,确认这个匿名模型就是新一代 K3。微博所以 korrine 就算真是 K3.1,也只是同一套动作的重播。

一周三个匿名模型潜入竞技场:它们是谁、谁值得等,证据我全整理好了

但 Kimi K3.1 要来这件事本身,证据相当硬。7 月底到 8 月初,多条信源显示 Moonshot 研究员确认 K3.1 目标 8 月推出,定位是更快的推理、更低的延迟、更可靠的编码和自主 Agent 工作流、继续开放权重,目标是缩小与 Claude Fable 5 的差距。微博社区里讨论最热的一个问题是:如果 K3.1 真追上了旗舰,那百倍的价格差还撑得住吗?

所以这个盲盒的正确打开方式是:代号传闻听听就好,但"K3.1 近期发布"可以当真,窗口就在 8 月到 9 月。

老玩家的拆盒方法论:四个技巧,一盆冷水

先补个背景。竞技场这套玩法就是靠匿名盲测起家的——两个不报家门的模型回答同一个问题,真人投票定胜负,这套多模型同屏对比的盲测界面到今天仍是竞技场的主场。模型厂商在这里搞隐身测试早就不是新闻:Gemini 3 发布即登顶,Kimi K2.5 发布 24 小时登顶开源榜,都是走的这条路。

一周三个匿名模型潜入竞技场:它们是谁、谁值得等,证据我全整理好了

而今年"匿名投放"已经变成了常规营销动作。3 月份,OpenRouter 上出现过两个无人认领的匿名模型 Hunter Alpha 和 Healer Alpha,免费、匿名、性能炸裂,社区猜得最凶的是 DeepSeek——“先匿名发布、免费收集使用数据、跑通了再官宣”。微博现在回头看,这三个新盲盒是同一套打法。

猜身份有四个常用技巧:

  1. 看代号连续性。mona-lisa 到 luna-lisa,同一命名序列基本就是同一家,甚至同一个系列;

  2. 看技术指纹。SynthID 水印就是 OpenAI 图像的签名,一查一个准;

  3. 看能力偏向。主打长上下文和 Agent 的、主打图像写实的,对号入座各家主力方向;

  4. 看时间窗口。对照各家官宣节奏,暗测通常出现在正式发布前一到四周。

但冷水必须泼:隐身模型的盲测成绩是"预告片",不是"正片"。2025 年 Llama 4 被曝用不公开版本专门针对竞技场用户刷榜,直接引爆了对榜单可信度的大讨论。知乎厂商针对性优化盲测风格、暗测版本与正式版状态不一致,都是发生过的事。盲测分可以看热闹、看趋势,别拿它当你掏钱订阅的依据。

现在该怎么办

按人群说:

图像创作党——别死等 luna-lisa。GPT Image 2 正处"降智"抱怨期,新 checkpoint 未官宣、未认领,等它不如用现成的:Grok 的 Imagine2 据测已冲进图像竞技场前列。微博博主晒出的测试卷里,一组北京主题邮票样张连"BEIJING"字样都排得一丝不苟,国产的 Seedream 5.0 Pro 也是常用的对比基准。等 OpenAI 哪天正式认领了,再切换不迟。

一周三个匿名模型潜入竞技场:它们是谁、谁值得等,证据我全整理好了

编程和 Agent 党——OxAlpha 的限免是本周最大的羊毛。OpenRouter 上直接试,用 OpenCode 的当天就能接上。顺手用自己真实的工作流测几个任务,比看任何跑分都实在。

追榜党——盯三个信号就行:Kimi K3.1 官宣(8-9 月窗口);OxAlpha 上 DeepSWE 官方榜或被认领;luna-lisa-alpha 被 OpenAI 认领,或者换个代号继续潜伏。

最后说一句。竞技场正在变成新模型的"首映礼",而匿名盲测是普通用户唯一能免费、提前摸到前沿模型的公开渠道——这也是它在国内一直人气很高的原因。享受白嫖,但记住一条:预告片再好看,也别当成片买票。

内容由AI生成

精选参考来源

1. OpenAI 被曝偷偷测试 GPT Image 2.5,图片能力再次升级!

2. 最强生图模型要来了?OpenAI 被曝偷偷测试 GPT Image 2.5

3. 有没有发现最近 GPT image 出图奇差无比,几乎已经到了不能用的程度了

4. 如何看待 OpenAI 被曝测试 GPT Image 2.5?AI 图像生成能力将迎来哪些突破?

5. 神秘 Ox Alpha AI 模型限免上架:DeepSWE 跑分碾压 Claude Fable 5,线索指向智谱

6. 神秘新模型“Ox Alpha”突袭 OpenRouter,性能超过 Fable 5?全网盲猜智谱或小米

7. 神秘“牛来大模型”火爆外网,部分测试超过 Fable、GPT-5.6

8. 一款名叫ox alpha的中国模型正在匿名公测,性能十分强大

9. ⚡ Kimi暗测神秘代号,K3.1冲刺代码榜

10. 匿名模型Kivine外网刷屏,开发者们都在猜:这是Kimi-K3?

11. 全球首个2万亿级开源模型

12. Kimi K3.1即将到来——Mythos级别

13. 最近有两个神秘大模型出现在 OpenRouter 上

14. ChatbotArena融资一亿背后大模型评测的信任危机

15. 马斯克旗下的Grok发布了新一代的图片模型Imagine 2

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章