张大妈

#Deepseek被指变冷淡了#感觉DeepSeek越来越厉害了啊,现在有一股ChatGPT的味道了!希望国产越来越好 梦境沉睡森林木屋的微博视频

源自新浪微博:梦境沉睡森林木屋

02-13 02:17

DeepSeek 悄然完成了一次重要更新,其知识库与上下文处理能力得到显著增强。通过一系列实测,此次更新不仅验证了其百万级token的处理潜力,也揭示了当前模型在极限场景下的表现,为理解国产AI的最新进展提供了宝贵参考。

#Deepseek被指变冷淡了#感觉DeepSeek越来越厉害了啊,现在有一股ChatGPT的味道了!希望国产越来越好 梦境沉睡森林木屋的微博视频智能速览

  • 新模型训练数据截止日期更新至2025年5月。

  • 网页版与App版已支持最高100万token的超长上下文。

  • 实测显示,上下文接近百万时模型幻觉会显著增加。

  • 在30-40万token范围内,模型信息检索的准确率非常高。

  • 推测此次更新可能为小尺寸的Light模型,期待春节的完整版。

#Deepseek被指变冷淡了#感觉DeepSeek越来越厉害了啊,现在有一股ChatGPT的味道了!希望国产越来越好 梦境沉睡森林木屋的微博视频精华内容

面对一次悄无声息的模型更新,如何验证其真实能力?通过设计一系列严苛的测试,从知识边界到长文本处理,一步步揭开新版本DeepSeek的神秘面纱。

知识边界测试

新模型在未联网情况下,能正确回答OpenAI最新推荐模型为O3 mini,但其对2025年4月事件的回答出现了GPT 4.1等错误信息。这表明其知识库确实得到了更新,截止日期有所延伸,但在接近新边界时,存在事实性幻觉的风险。它能感知到4月15日发生的事件,但对更晚的日期则完全混淆,知识更新并不完美。

长文本理解力

在长文本理解上,新模型展现强大的推理能力。根据一张模糊的郑州街景图片和文本描述,它逻辑清晰地推断出拍摄者可能居住的区域,分析过程条理分明。为了测试其极限,上传了总计约77万字的《三体》三部曲文本,挑战其在海量数据中定位特定信息的能力。

百万Token表现

实测显示,当输入token量在30至40万时,模型能精准找到植入的全部信息。但当输入接近百万token上限时,模型的幻觉显著增强,准确率大幅下降。在多次测试中,面对植入的六条信息,它有时只能找到一条,有时甚至表示完全找不到。这种极限状态下的表现波动是当前大模型的普遍现象。

模型身份推测

综合来看,此次更新的模型在速度上有所提升,但攻击性语言生成和极限上下文处理上的表现尚有提升空间。结合DeepSeek以往在重大节点发布重磅模型的风格,推测此次更新更像是一个“开胃菜”——一个在算力或参数上有所精简的Light模型。其表现已相当出色,让人更加期待春节期间可能发布的完整版模型。

此次DeepSeek的悄然更新,无疑是国产AI大模型发展的一个缩影。它展示了巨大的进步,也诚实地暴露了当前技术面临的挑战。一个强大的Light模型已经足够令人惊喜,这不禁让人更加期待,那个在春节“放大招”的完整版本,将带来怎样的震撼。

#Deepseek被指变冷淡了#感觉DeepSeek越来越厉害了啊,现在有一股ChatGPT的味道了!希望国产越来越好 梦境沉睡森林木屋的微博视频关键评论

  • AI也逃不过“毕业即高冷”规律——刚入职时热情得像海底捞,现在进化成我领导:一句“在呢”后面永远跟着已读不回。

  • chatGPT情绪价值感觉给的挺好啊,干啥它都夸我,都先理解我。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章