关注竞技场(Chatbot Arena)的朋友,这周应该已经注意到不对劲了:平时新模型都是一个个来,这次是仨"没人认领"的代号模型,几乎同时出现在不同赛场上——一个在图像盲测区,一个在编程盲测区,还有一个直接在 OpenRouter 上限免开测。
对追榜党来说,这等于三个盲盒同时摆在面前。我把微博、知乎、小红书和几家科技媒体这几天的线索交叉对了一遍,逐个拆给你看:哪些证据硬、哪些是脑补、现在该干嘛。
盲盒一:luna-lisa-alpha,大概率是 OpenAI 新图像模型,但未必是旗舰
先说时间线。8 月 9 日,LMArena(就是大家熟悉的竞技场,今年官方已改名 ArenAI,不少媒体仍沿用旧称)的图像盲测区出现了一个叫 mona-lisa-1 的匿名模型。有人用 OpenAI 官方的图像检测工具去查,检出了 SynthID 水印——这是 OpenAI 系图像模型的数字签名。知乎海外测试者 @vladimircherner 的第一轮结论是:细节比 GPT Image 2 丰富,背景伪影几乎消失,还能生成密集的信息图表。
8 月 21 日,续作来了:luna-lisa-alpha。测试者 @chetaslua 直接判断"这是一个新的 GPT Image checkpoint,上一个版本叫 mona-lisa-1",知识截止时间更新,文字渲染很强。知乎社区测出的提升点集中在三处:一是角色一致性大幅跃升——同一角色连续多张图,外观服装风格都稳得住,这是 GPT Image 2 被吐槽最久的短板;二是颗粒感噪点明显减少;三是文字渲染进一步变强,手机界面、网页设计稿里的复杂 UI 文字都排得清晰可读。微博
为什么是现在?往前看一周就明白了:8 月 11 日前后,多位博主吐槽 GPT Image 2"降智"——出图发黄、细节变碎、“感觉回到上一代”。微博现役旗舰口碑滑坡,新版本 checkpoint 进场救火,动机完全对得上。
但反证也得说清楚。知乎有用户实测后泼了冷水:效果没有传的那么惊艳;而且 luna 这个前缀,更像是 OpenAI 的廉价版产品线(Luna 系列 8 月初刚大幅降价,比 DeepSeek 还便宜);更微妙的是,mona-lisa-1 能检出 SynthID,luna-lisa-alpha 反而检测不出来。知乎所以我的判断是:身份大概率是 OpenAI 下一代图像模型没跑,但它是旗舰"GPT Image 2.5"还是廉价版,官方没认领之前谁说了都不算。
盲盒二:OxAlpha,身份存疑,但它是现在唯一能白嫖的
8 月 20 日,AI 模型聚合平台 OpenRouter 上线匿名模型 OxAlpha,官方只描述为"面向编码、长时间智能体任务和实际生产环境的前沿模型",限免开放一周。微博参数很能打:约 104.8 万 token 上下文,最大输出 13.1 万 token,支持文本、图像、视频输入。36氪开源编程智能体 OpenCode 当天就宣布接入,还直接备好了每天 100 万亿 token 的容量招呼开发者来压测。微博
战绩方面,独立研究员 Ben Davis 用软件工程基准 DeepSWE 的 10 个子任务测试,OxAlpha 通过率约 80%,高于 Claude Fable 5 的 65%、GLM-5.3 和 Grok 4.6 的 62%、GPT-5.6 Sol 的 52%。注意,这是个人测试,DeepSWE 官方榜还没收录它,先别当成官方结论。微博

身份上目前两派。一派认为它来自智谱,社区比对发现它的一些技术特征与智谱之前的模型相似。微博另一派则猜是小米的 MiMo 3.0,理由是小米集团 CFO 8 月 18 日刚在财报会上透露新一代 MiMo"有望很快发布",而且小米之前也搞过匿名内测。36氪我的判断很实际:身份先别纠结,这是三个盲盒里唯一现在就能公开免费用的,限免一周,手慢无。
盲盒三:korrine,证据最弱,但它背后的正主可能最快官宣
8 月 22 日,小红书有科技账号称,匿名盲测竞技场 Code Arena 里冒出一个代号 korrine 的模型,"业内多方情报交叉比对"指向月之暗面正在暗测的 Kimi K3.1。小红书先说明:这只是单一来源,证据强度是三个盲盒里最弱的,将信将疑即可。
而且这不是 Kimi 第一次这么干。K2.5 和 K2.6 当年就是分别以 Kiwido、Kiwire 的匿名代号被社区认出来的,7 月中旬代号 Kivine 的匿名模型又在外网刷屏,开发者普遍把它认作 K3 测试版。36氪开发者用它一句话就能做出像素风射击场、沙漠商队模拟这样的完整网页应用,官方后来正式下场认领,确认这个匿名模型就是新一代 K3。微博所以 korrine 就算真是 K3.1,也只是同一套动作的重播。

但 Kimi K3.1 要来这件事本身,证据相当硬。7 月底到 8 月初,多条信源显示 Moonshot 研究员确认 K3.1 目标 8 月推出,定位是更快的推理、更低的延迟、更可靠的编码和自主 Agent 工作流、继续开放权重,目标是缩小与 Claude Fable 5 的差距。微博社区里讨论最热的一个问题是:如果 K3.1 真追上了旗舰,那百倍的价格差还撑得住吗?
所以这个盲盒的正确打开方式是:代号传闻听听就好,但"K3.1 近期发布"可以当真,窗口就在 8 月到 9 月。
老玩家的拆盒方法论:四个技巧,一盆冷水
先补个背景。竞技场这套玩法就是靠匿名盲测起家的——两个不报家门的模型回答同一个问题,真人投票定胜负,这套多模型同屏对比的盲测界面到今天仍是竞技场的主场。模型厂商在这里搞隐身测试早就不是新闻:Gemini 3 发布即登顶,Kimi K2.5 发布 24 小时登顶开源榜,都是走的这条路。

而今年"匿名投放"已经变成了常规营销动作。3 月份,OpenRouter 上出现过两个无人认领的匿名模型 Hunter Alpha 和 Healer Alpha,免费、匿名、性能炸裂,社区猜得最凶的是 DeepSeek——“先匿名发布、免费收集使用数据、跑通了再官宣”。微博现在回头看,这三个新盲盒是同一套打法。
猜身份有四个常用技巧:
看代号连续性。mona-lisa 到 luna-lisa,同一命名序列基本就是同一家,甚至同一个系列;
看技术指纹。SynthID 水印就是 OpenAI 图像的签名,一查一个准;
看能力偏向。主打长上下文和 Agent 的、主打图像写实的,对号入座各家主力方向;
看时间窗口。对照各家官宣节奏,暗测通常出现在正式发布前一到四周。
但冷水必须泼:隐身模型的盲测成绩是"预告片",不是"正片"。2025 年 Llama 4 被曝用不公开版本专门针对竞技场用户刷榜,直接引爆了对榜单可信度的大讨论。知乎厂商针对性优化盲测风格、暗测版本与正式版状态不一致,都是发生过的事。盲测分可以看热闹、看趋势,别拿它当你掏钱订阅的依据。
现在该怎么办
按人群说:
图像创作党——别死等 luna-lisa。GPT Image 2 正处"降智"抱怨期,新 checkpoint 未官宣、未认领,等它不如用现成的:Grok 的 Imagine2 据测已冲进图像竞技场前列。微博博主晒出的测试卷里,一组北京主题邮票样张连"BEIJING"字样都排得一丝不苟,国产的 Seedream 5.0 Pro 也是常用的对比基准。等 OpenAI 哪天正式认领了,再切换不迟。

编程和 Agent 党——OxAlpha 的限免是本周最大的羊毛。OpenRouter 上直接试,用 OpenCode 的当天就能接上。顺手用自己真实的工作流测几个任务,比看任何跑分都实在。
追榜党——盯三个信号就行:Kimi K3.1 官宣(8-9 月窗口);OxAlpha 上 DeepSWE 官方榜或被认领;luna-lisa-alpha 被 OpenAI 认领,或者换个代号继续潜伏。
最后说一句。竞技场正在变成新模型的"首映礼",而匿名盲测是普通用户唯一能免费、提前摸到前沿模型的公开渠道——这也是它在国内一直人气很高的原因。享受白嫖,但记住一条:预告片再好看,也别当成片买票。