9. 中国神秘大模型登顶,超越Claude!
【网易新闻】8月20日,模型分发平台OpenRouter上悄悄冒出一个没有署名的AI模型,代号stealth/ox-alpha,提供为期一周的免费访问。它不挂任何公司招牌,却在编程测试里跑出了让不少人吃惊的成绩。独立研究人员Ben Davis在8月21日发布的测试报告里写下一句分量很重的判断,他"99%确定"这个匿名模型属于智谱尚未发布的GLM-5.x系列。
Davis的溯源从几个技术维度同时下手,其中视频编码器被认为是最硬的证据。
在四组受控视频测试中,ox-alpha与GLM-5V-Turbo的video token消耗完全一致,两者都呈现出帧率无关的帧采样方式、约每秒147 token的时长缩放比例以及逐帧分辨率缩放机制这三项相同特征。相比之下,被列为候选的小米MiMo v2.5、Qwen 3.8 Max和GLM-4.6V都表现出明显不同的视频编码特征。分词器测试同样指向同一个方向,对25个不同提示词测试后,ox-alpha的token计数与GLM-5.3完全吻合,只存在固定的+75 token隐藏封装差异,意味着两者很可能共享同一套词汇表。再加上ox-alpha拒绝音频输入的行为与GLM-5V一致,而主要竞争候选MiMo v2.5恰恰支持音频输入,这一条又把后者的可能性往下压了一截。连输出风格这种细节都没放过,ox-alpha每千字符约使用1.3个emoji,与GLM和Qwen系列接近,而Claude、GPT-5.6和Grok在相同环境下emoji使用率接近于零。
而能力数据是另一条线索。报告援引DeepSWE基准称,ox-alpha在10个确定性任务中通过8个,Pass Fable 5通过率65%,GLM-5.3和Grok 4.6均为62%,GPT-5.6-sol为52%。在meriyah-explicit-resource-declarations这个任务上,ox-alpha一次通过,而GLM-5.3、GPT-5.6-sol和Grok 4.6此前都是0/4。它还保持了51469项回归测试全部通过,并在一次包含69次工具调用的智能体任务里只出现一次错误、没有发生重试循环。不过要客观说一句,不同模型的测试次数并不完全一致,ox-alpha目前样本量也偏小,这些数字还需要更多独立测试来验证,不能直接当成定论。
此外,时间点也对得上,智谱8月14日刚发布纯文本版GLM-5.3,统一视觉旗舰一直是社区盯着的方向。更重要的是智谱有过先例,此前的Pony Alpha最终被确认与GLM-5有关,这种通过隐身渠道先放出来试水的做法并不陌生。规模上也说得通,报告称ox-alpha解码速度与GLM-5V-Turbo相差约6%,后者拥有744B总参数、40B激活参数,由此推测ox-alpha可能采用类似规模的MoE架构。报告还认为如果激活参数确实在40B左右,运营方声称的每日100万亿token服务能力在技术和成本层面才更具可行性。与此同时,DeepSeek因没有发布视频能力且分词器不同被排除,谷歌、Qwen、xAI、OpenAI和Anthropic也因分词器、输出风格或视频编码器不匹配而被逐一划掉。
需要反复强调的是,以上所有结论都建立在个人测试与技术推断之上,智谱至今没有作出官方回应。在正式认领之前,ox-alpha究竟来自何方还不能盖棺定论。免费窗口可能持续到8月27日,Davis也提到此前一些类似的隐身模型在免费测试结束后由相关中国AI实验室正式认领。如果这次最终证实是智谱的下一代多模态旗舰,那么这场OpenRouter上的匿名测试就成了一次正式发布前的公开预演。
总之,从中国AI产业的视角来看,无论它最终姓谁,能在编程和多模态推理上与国际头部模型正面较劲的国产力量又多了一个,这本身就是一个积极的信号。多项独立测试把线索指向同一个方向,接下来几天,答案大概率会自己浮出水面。