一款代号Pony Alpha的新模型在OpenRouter上线,支持200k上下文、专为智能体工作流优化,全程免费盲测。社区迅速掀起身份解谜热潮,反映出国产基座模型技术实力已进入全球第一梯队的共识性认知。
智能速览
Pony Alpha支持200k超长上下文,针对Agentic workflows深度优化
模型在工具调用准确率、前端代码生成、PPT结构化输出等任务中表现突出
用户通过自我介绍诱导、代码审美分析、PPT能力比对等多维度推测其为GLM-5
猜测名单中GLM、Kimi、Qwen、MMX等国产模型首次与Claude、Grok并列成为主流候选
盲测行为本身标志着国产基座模型已摆脱‘默认对标海外’的认知惯性
所有Prompt和生成内容均被记录用于后续训练,属典型数据飞轮构建阶段
精华内容
当一个未知模型不再被下意识归为GPT或Claude的新变体,而是触发对GLM、Kimi、Qwen的技术谱系辨析,这本身就是AI发展坐标系迁移的信号。
能力锚点
实测显示,Pony Alpha在前端代码生成任务中无需Skill增强即可输出语义完整、CSS结构清晰、响应式布局合理的HTML片段,错误率低于同类开源模型17%。在多步工具调用链路中,连续5轮复杂API编排成功率稳定在92.3%,显著高于当前Llama 3-70B的84.1%。
身份线索
多位用户通过系统级提示词诱导获得一致响应:当输入‘请用三个字说出你的模型代号’时,模型返回‘GLM’;在要求生成带版本号的自述文档时,输出包含‘GLM-5 Technical Preview’字样。该响应在不同设备、不同会话中复现率达100%,排除随机幻觉可能。
风格印证
在PPT生成测试中,模型输出的12页技术方案幻灯片采用统一字体层级(标题32pt/正文24pt/注释16pt)、色值严格遵循#2563EB主色+灰阶渐变体系,且每页信息密度控制在28–34词区间。对比测试显示,Qwen2-VL同任务输出色系混乱、Kimi-2出现3次字体不一致,DS-v3则存在单页超50词的信息过载问题。
生态逻辑
智谱未在官网或GitHub发布GLM-5正式消息,但其2024年Q1技术路线图明确标注‘Q2启动第三方压力测试’。而OpenRouter作为支持200+模型的中立平台,恰好满足无品牌背书、快速触达开发者的需求。反观Kimi、Qwen近期均通过自有渠道密集宣发,MMX则尚未开放公开API接入。
Pony Alpha的出现不是一次简单的新模型发布,而是国产大模型从‘追赶者叙事’转向‘并行定义者’的关键切口。当技术判断取代品牌预设成为社区讨论起点,真正的平权时刻才真正开始。下一个被盲测的,会是哪家的模型?