近日,大模型聚合平台 OpenRouter 上线了两款名为 Hunter Alpha 和 Healer Alpha 的匿名模型,引发了人工智能社区的广泛关注和讨论。其中,Hunter Alpha 凭借其页面上标注的“万亿(1T)参数”和“百万(1M)级别上下文”等惊人规格,迅速成为众人瞩目的焦点。由于这些参数与此前市场上传闻已久的 DeepSeek V4 高度吻合,许多人猜测这可能是 DeepSeek 公司在新模型正式发布前的一次灰度测试。
然而,随着社区用户的深入测试,最初的兴奋情绪逐渐被更为审慎的评估所取代。不少第一时间上手的用户反馈,Hunter Alpha 的实际表现与预期存在显著差距,甚至认为其不可能是备受期待的 DeepSeek V4。
有熟悉 DeepSeek 模型的资深用户在详细测试后指出,Hunter Alpha 的能力甚至不及 DeepSeek V4 的轻量版(V4 Lite)。该用户表示,尽管模型宣称拥有 1M 的超长上下文窗口,但在实际测试中,其有效注意力水平大约只有 256K,远未达到标称值。在处理包含大量输入内容的长任务时,模型出现了严重的“掉格式”和信息遗忘问题,对角色细节的刻画也显得机械化。此外,该模型表现出较高的幻觉率,例如在被问及其上下文长度时,多次错误地回答为 128K,这一数字恰好是 DeepSeek 早期模型的标志性参数,因此有用户推测 Hunter Alpha 可能使用了 DeepSeek 的公开语料进行了蒸馏训练。

另一位用户进行的“大海捞针”量化测试也佐证了上述观点。测试结果显示,Hunter Alpha 在长文本信息召回任务中的得分非常低,进一步印证了其长上下文处理能力并未如宣传般强大。这些来自社区的初步实测结果,使得“Hunter Alpha 即 DeepSeek V4”这一说法的可信度大打折扣。
在猜测和讨论中,也有观点认为,将匿名模型默认为特定厂商的未发布产品本身就存在不确定性。有分析指出,此前另一款名为 Pony Alpha 的匿名模型也曾引发广泛猜测,最终被证实为智谱 GLM 的新模型。这一先例说明,通过在 OpenRouter 这样的第三方平台进行匿名测试,已成为一些模型厂商收集真实世界反馈和进行预热的常见策略,因此 Hunter Alpha 也有可能来自其他研发团队。
一些更为冷静的分析则提出,与其纠结于 Hunter Alpha 的“真实身份”,不如关注其背后反映出的行业趋势。OpenRouter 在模型描述中反复强调的“智能体工作流(agentic workflows)”、“长程规划(long-horizon planning)”和“工具使用(tool use)”等关键词,标志着业界对模型能力的评价标准正在从传统的单轮问答、知识储备,转向更侧重于完成复杂、多步骤任务的实际执行能力。这种匿名测试的方式,正是为了在真实、多样的应用场景中检验模型在规划、工具调用、纠错和稳定性等方面的综合素养。同时,这也提醒了普通用户和开发者,模型页面上的参数固然引人注目,但其在真实工作流中的可用性和可靠性,才是衡量其价值的最终标准。

虽然匿名模型 Hunter Alpha 的出现因其与 DeepSeek V4 的传闻相符而引发热潮,但社区的实际测试反馈普遍认为其表现未达预期,不太可能是传闻中的强大模型。这一事件也反映出,在当前快速发展的人工智能领域,单纯的参数指标与实际应用性能之间可能存在差距,而行业对模型的评价重点正逐步转向更为务实的端到端任务完成能力。
值友8028827026
校验提示文案
值友8028827026
校验提示文案