疑似DeepSeek V4?Hunter Alpha实测翻车,百万上下文名不副实

源自26位全网作者

03-13 07:31

近日,大模型聚合平台 OpenRouter 上线了两款名为 Hunter Alpha 和 Healer Alpha 的匿名模型,引发了人工智能社区的广泛关注和讨论。其中,Hunter Alpha 凭借其页面上标注的“万亿(1T)参数”和“百万(1M)级别上下文”等惊人规格,迅速成为众人瞩目的焦点。由于这些参数与此前市场上传闻已久的 DeepSeek V4 高度吻合,许多人猜测这可能是 DeepSeek 公司在新模型正式发布前的一次灰度测试。

然而,随着社区用户的深入测试,最初的兴奋情绪逐渐被更为审慎的评估所取代。不少第一时间上手的用户反馈,Hunter Alpha 的实际表现与预期存在显著差距,甚至认为其不可能是备受期待的 DeepSeek V4。

有熟悉 DeepSeek 模型的资深用户在详细测试后指出,Hunter Alpha 的能力甚至不及 DeepSeek V4 的轻量版(V4 Lite)。该用户表示,尽管模型宣称拥有 1M 的超长上下文窗口,但在实际测试中,其有效注意力水平大约只有 256K,远未达到标称值。在处理包含大量输入内容的长任务时,模型出现了严重的“掉格式”和信息遗忘问题,对角色细节的刻画也显得机械化。此外,该模型表现出较高的幻觉率,例如在被问及其上下文长度时,多次错误地回答为 128K,这一数字恰好是 DeepSeek 早期模型的标志性参数,因此有用户推测 Hunter Alpha 可能使用了 DeepSeek 的公开语料进行了蒸馏训练。

疑似DeepSeek V4?Hunter Alpha实测翻车,百万上下文名不副实

另一位用户进行的“大海捞针”量化测试也佐证了上述观点。测试结果显示,Hunter Alpha 在长文本信息召回任务中的得分非常低,进一步印证了其长上下文处理能力并未如宣传般强大。这些来自社区的初步实测结果,使得“Hunter Alpha 即 DeepSeek V4”这一说法的可信度大打折扣。

在猜测和讨论中,也有观点认为,将匿名模型默认为特定厂商的未发布产品本身就存在不确定性。有分析指出,此前另一款名为 Pony Alpha 的匿名模型也曾引发广泛猜测,最终被证实为智谱 GLM 的新模型。这一先例说明,通过在 OpenRouter 这样的第三方平台进行匿名测试,已成为一些模型厂商收集真实世界反馈和进行预热的常见策略,因此 Hunter Alpha 也有可能来自其他研发团队。

一些更为冷静的分析则提出,与其纠结于 Hunter Alpha 的“真实身份”,不如关注其背后反映出的行业趋势。OpenRouter 在模型描述中反复强调的“智能体工作流(agentic workflows)”、“长程规划(long-horizon planning)”和“工具使用(tool use)”等关键词,标志着业界对模型能力的评价标准正在从传统的单轮问答、知识储备,转向更侧重于完成复杂、多步骤任务的实际执行能力。这种匿名测试的方式,正是为了在真实、多样的应用场景中检验模型在规划、工具调用、纠错和稳定性等方面的综合素养。同时,这也提醒了普通用户和开发者,模型页面上的参数固然引人注目,但其在真实工作流中的可用性和可靠性,才是衡量其价值的最终标准。

疑似DeepSeek V4?Hunter Alpha实测翻车,百万上下文名不副实

虽然匿名模型 Hunter Alpha 的出现因其与 DeepSeek V4 的传闻相符而引发热潮,但社区的实际测试反馈普遍认为其表现未达预期,不太可能是传闻中的强大模型。这一事件也反映出,在当前快速发展的人工智能领域,单纯的参数指标与实际应用性能之间可能存在差距,而行业对模型的评价重点正逐步转向更为务实的端到端任务完成能力。

内容由AI生成

精选参考来源

1. 如何评价openrouter上疑似deepseek V4的匿名模型 Hunter Alpha ?

如何评价openrouter上疑似deepseek V4的匿名模型 Hunter Alpha ? 我可以很确定的说不是V4。我就在某discord社区里面,V4L我们天天蹬,V4可能的八股我们都是一清

2. 匿名万亿模型突上线,会是Deepseek V4 吗?

匿名万亿模型突上线,会是Deepseek V4 吗? 匿名万亿模型突上线,会是Deepseek V4 吗?AI第一线1773287498 过去几个小时,OpenRouter 上线了两款“匿名/隐形(S

3. 【OpenRouter突现匿名万亿参数大模型,海外猜测是DeepSeek V4发布前测试】3月12日,全球知名大模型聚合...

【OpenRouter突现匿名万亿参数大模型,海外猜测是DeepSeek V4发布前测试】3月12日,全球知名大模型聚合... 【OpenRouter突现匿名万亿参数大模型,海外猜测是DeepSeek

4. Openrouter冒出来了两个匿名新模型Hunter Alpha、Healer Alpha,好像非常强的样子,Hunt...

Openrouter冒出来了两个匿名新模型Hunter Alpha、Healer Alpha,好像非常强的样子,Hunt... Openrouter冒出来了两个匿名新模型Hunter Alpha、He

5. 如何评价2 月 11 日上线的 DeepSeek 新模型?

如何评价2 月 11 日上线的 DeepSeek 新模型? 实测不及预期,能力低于GLM-4.7,低于K2.5,明显低于匿名模型pony alpha。 题目1:仿照Windows Vista做一个窗口

6. DeepSeekV4Lite 性能逼近美国顶流 AI,这意味着什么?

DeepSeekV4Lite 性能逼近美国顶流 AI,这意味着什么? 3.12更新hunter-alpha实在是太fvv了,8 needle跑了好多遍根本跑不通,所以只能降难度跑2 needle,但即

7. 刚刚,DeepSeek V4基准测试泄露!疑似明天发布,全场惊呼新王归来

刚刚,DeepSeek V4基准测试泄露!疑似明天发布,全场惊呼新王归来 刚刚,DeepSeek V4基准测试泄露!疑似明天发布,全场惊呼新王归来新智元1771234171 编辑:Aeneas kin

8. 刚刚,DeepSeek V4基准测试泄露!疑似明天发布,全场惊呼新王归来

刚刚,DeepSeek V4基准测试泄露!疑似明天发布,全场惊呼新王归来 编辑:Aeneas kingHZ就在刚刚,一张图在全网疯狂刷屏了!据说,DeepSeek V4的基准测试已经泄露,整个AI圈都

9. DeepSeekV4Lite 性能逼近美国顶流 AI,这意味着什么?

DeepSeekV4Lite 性能逼近美国顶流 AI,这意味着什么? 还是现实一点,在我这里,DeepSeek V4假如在本月发布,只要能够追平2025年4月发布的o4 mini就是合格的,假如能够比

10. OpenRouter 上又来了两个新模型! 是 DeepSeek-V4 吗?刚看到 OpenRouter 上又上新了两个...

OpenRouter 上又来了两个新模型! 是 DeepSeek-V4 吗?刚看到 OpenRouter 上又上新了两个... OpenRouter 上又来了两个新模型! 是 DeepSeek-V4

11. DeepSeek V4诞生前夜?梁文锋署名新论文发布

DeepSeek V4诞生前夜?梁文锋署名新论文发布 DeepSeek V4诞生前夜?梁文锋署名新论文发布华尔街见闻1768306664 这是一场关于AI“大脑皮层”的重构。长期以来,Transfor

12. DeepSeek V4下周登场,美股再次颤抖!「跳过」英伟达,便宜50倍

DeepSeek V4下周登场,美股再次颤抖!「跳过」英伟达,便宜50倍 编辑:犀牛【新智元导读】DeepSeek V4下周登场:原生多模态,绕过英伟达,针对国产芯片深度优化。华尔街最怕的那条逻辑可能

13. OpenRouter上又有两个新模型开始测试了。Hunter Alpha:一款拥有 1T 个参数和 1M 个上下文信息的...

OpenRouter上又有两个新模型开始测试了。Hunter Alpha:一款拥有 1T 个参数和 1M 个上下文信息的... OpenRouter上又有两个新模型开始测试了。Hunter Alpha

14. 神秘模型「Pony Alpha」引外网热议,它会是国产大模型中的谁?

神秘模型「Pony Alpha」引外网热议,它会是国产大模型中的谁? 这两天,外网都在好奇:全球模型服务平台 OpenRouter 上这个搜索第一的神秘模型是哪家的?这个匿名模型叫做「Pony Alp

15. 如何看待智谱 GLM-5 以「Pony Alpha」匿名代号在 OpenRouter 上先行亮相?

如何看待智谱 GLM-5 以「Pony Alpha」匿名代号在 OpenRouter 上先行亮相? 聪明人早就知道是个中国大模型了。比较搞笑的是,X上一大堆人猜测是OpenAI或者Claude的某个新

16. 爆料 Deepseek 下周发布 v4 多模态模型,有哪些功能亮点值得关注?

爆料 Deepseek 下周发布 v4 多模态模型,有哪些功能亮点值得关注? 继 HuggingFace 出现上传记录后,DeepSeek V4 核心规格表流出:1万亿参数、100万上下文、原生音频支

17. #DeepSeekV4要发布了吗# 根据目前泄露的基准测试数据和市场研报分析,DeepSeek V4的性能预期非常强劲,...

#DeepSeekV4要发布了吗# 根据目前泄露的基准测试数据和市场研报分析,DeepSeek V4的性能预期非常强劲,... 根据目前泄露的基准测试数据和市场研报分析,DeepSeek V4的性能

18. DeepSeek将于2月春节左右推出新一代大模型,说一下我们的判断:    1、V4基模型  2、部分用国产卡训练...

DeepSeek将于2月春节左右推出新一代大模型,说一下我们的判断:    1、V4基模型  2、部分用国产卡训练... DeepSeek将于2月春节左右推出新一代大模型,说一下我们的判断:    1

19. 梁文峰署名DeepSeek新论文刷屏了,万众期待的DeepSeek V4架构,其最大的特点,可以简单理解为给大模型装了个...

梁文峰署名DeepSeek新论文刷屏了,万众期待的DeepSeek V4架构,其最大的特点,可以简单理解为给大模型装了个... 梁文峰署名DeepSeek新论文刷屏了,万众期待的DeepSeek V4

20. GLM-5架构曝光,智谱两日涨60%:采用DeepSeek同款稀疏注意力

GLM-5架构曝光,智谱两日涨60%:采用DeepSeek同款稀疏注意力 GLM-5架构曝光,智谱两日涨60%:采用DeepSeek同款稀疏注意力36氪1770729939 不管Pony Alpha是

21. 【#DeepSeek新模型曝光#】 1月21日消息,据The Information爆料,国产AI企业DeepSeek计...

【#DeepSeek新模型曝光#】 1月21日消息,据The Information爆料,国产AI企业DeepSeek计... 【】 1月21日消息,据The Information爆料,国产AI企业

22. 神秘模型现身OpenRouter,引发热议!!!8个小时以前,宇宙知名的模型服务商OpenRouter,突然官宣上线了一...

神秘模型现身OpenRouter,引发热议!!!8个小时以前,宇宙知名的模型服务商OpenRouter,突然官宣上线了一... 神秘模型现身OpenRouter,引发热议!!!8个小时以前,宇宙知名的

23. #DeepSeek发布梁文锋署名论文#补充一点点:传统大模型全靠注意力机制“硬算”,遇到实体名、固定搭配这类静态知识时又...

#DeepSeek发布梁文锋署名论文#补充一点点:传统大模型全靠注意力机制“硬算”,遇到实体名、固定搭配这类静态知识时又... 补充一点点:传统大模型全靠注意力机制“硬算”,遇到实体名、固定搭配这类静

24. 架构彻底重构!DeepSeek新模型代码曝光,要来的V4让国内外都坐不住了?

架构彻底重构!DeepSeek新模型代码曝光,要来的V4让国内外都坐不住了? 架构彻底重构!DeepSeek新模型代码曝光,要来的V4让国内外都坐不住了?InfoQ1768973573 整理 | 华卫

25. 【#DeepSeek新模型曝光#】1 月 21 日,The Information 月初爆料称,DeepSeek 将在今...

【#DeepSeek新模型曝光#】1 月 21 日,The Information 月初爆料称,DeepSeek 将在今... 【】1 月 21 日,The Information 月初爆料称,Dee

26. 谷歌 Gemini 3 Deep Think 深度思考大模型升级,相比前代有哪些提升?

谷歌 Gemini 3 Deep Think 深度思考大模型升级,相比前代有哪些提升? 强的太可怕了,我实测了几个私有题,包含编程、架构题目,比opus4.6明显地强。目前所有模型唯一一个能够复现出来
0
扫一下,分享更方便,购买更轻松
1评论

  • 精彩
  • 最新
  • 之前openrouter忘记回传reasoning content了,大概有80%信息没放进上下文,导致模型效果只发挥了80%,openrouter 官方发帖澄清了,可以再试试

    校验提示文案

    提交
提示信息

取消
确认
评论举报

最新文章 热门文章