DeepSeek V4的Agent能力虽强,但94%幻觉率让高风险场景用户慎用

源自74位全网作者

05-25 19:51

精选参考来源

1
盘点一周AI大事(4月26日)|OpenAI王炸两连 OpenAI上线下一代大模型「GPT-5.5」 OpenAI全量上线下一代图像模型「GPT-Image-2」 Kimi发布最强开源大模型「Kimi K2.6」 DeepSeek发布了「DeepSeek V4」 Office三件套(Word PPT Excel)全量上线Copilot智能体 Google发布最强深度研究「Deep Research Max」 研究员开源AI研究员「ASI-Evolve」 Google发布最强图像分割模型「Google Vision Banana」 LTX开源视频转HDR「LTX HDR LoRA」 ODYSSEY发布最强世界模型「Odyssey-2 Max」 字节开源最强3D模型「Seed3D 2.0」 工程师研发出最强乒乓球机器人 #前沿科技趋势发布月 #AI新星计划 #AIGC #AI #OpenAI
2
#DeepSeekV4发布# 这算是千呼万唤始出来,终于发布了。DeepSeek今天正式发布V4系列预览版并同步开源,分为V4-Pro和V4-Flash两个版本,主打100万(1M)超长上下文能力,官网、App及API均已同步更新。V4-Pro在Agent能力、世界知识、数学推理等多项评测中达到开源模型最佳水平,推理性能比肩顶尖闭源模型;V4-Flash则以更小的参数量提供更快速、更经济的API服务,适合轻量场景。技术层面,V4采用全新注意力机制,结合DSA稀疏注意力,在大幅压缩计算和显存需求的同时,实现百万级超长上下文。DeepSeek表示,1M上下文将成为旗下所有官方服务的标配。此外,V4针对多款主流Agent产品进行了专项适配优化。旧版API接口模型名deepseek-chat和deepseek-reasoner将于2026年7月24日正式停用,用户需提前切换至新模型名。#老张聊科技# deepseekv4发布
全部
来源
内容由AI生成

精选参考来源

1. 盘点一周AI大事(4月26日)|OpenAI王炸两连 OpenAI上线下一代大模型「GPT-5.5」 OpenAI全量上线下一代图像模型「GPT-Image-2」 Kimi发布最强开源大模型「Kimi K2.6」 DeepSeek发布了「DeepSeek V4」 Office三件套(Word PPT Excel)全量上线Copilot智能体 Google发布最强深度研究「Deep Research Max」 研究员开源AI研究员「ASI-Evolve」 Google发布最强图像分割模型「Google Vision Banana」 LTX开源视频转HDR「LTX HDR LoRA」 ODYSSEY发布最强世界模型「Odyssey-2 Max」 字节开源最强3D模型「Seed3D 2.0」 工程师研发出最强乒乓球机器人 #前沿科技趋势发布月 #AI新星计划 #AIGC #AI #OpenAI

2. #DeepSeekV4发布# 这算是千呼万唤始出来,终于发布了。DeepSeek今天正式发布V4系列预览版并同步开源,分为V4-Pro和V4-Flash两个版本,主打100万(1M)超长上下文能力,官网、App及API均已同步更新。V4-Pro在Agent能力、世界知识、数学推理等多项评测中达到开源模型最佳水平,推理性能比肩顶尖闭源模型;V4-Flash则以更小的参数量提供更快速、更经济的API服务,适合轻量场景。技术层面,V4采用全新注意力机制,结合DSA稀疏注意力,在大幅压缩计算和显存需求的同时,实现百万级超长上下文。DeepSeek表示,1M上下文将成为旗下所有官方服务的标配。此外,V4针对多款主流Agent产品进行了专项适配优化。旧版API接口模型名deepseek-chat和deepseek-reasoner将于2026年7月24日正式停用,用户需提前切换至新模型名。#老张聊科技# deepseekv4发布

3. DeepSeek-V4和GPT-5.5第一波实测对决,结果出人意料!

4. 一个全是 AI 幻觉的网站,却成了这届互联网最实诚的存在

5. 编程媲美闭源顶级模型!DeepSeek V4来了,价格便宜75倍!

6. -agent是模型能力扩展的一个里程碑,也是体现ai模型进入人类真实(虚拟/物理)世界的关键。没有agent能力,大模型将停留在(理论学习)阶段,就类似一个人不断学习,哪怕学习到博士,也只是知识积累,还没有转化为生产力。原来的agent是通过模型应用来实现,现在模型已经可以直接将agent数据集成到训练过程,增强了模型的通用性,其实难题还是不同agent环境的泛化和迁移并不是那么容易,因此最简单办法也只有不断增加不同agent环境的数据和针对不同环境的强化学习。

7. 实测DeepSeek V4,为国产化而生。

8. DeepSeek V4(预览版)在编程领域表现如何?

9. 难得一见:黄仁勋因为这件事,在访谈中跟主持人吵起来了,DeepseekV4可能带崩美国科技公司#黄仁勋 #英伟达 #DeepSeekV4 #芯片 #中美科技竞争

10. #deepseekv4和gpt5.5谁更强#DeepSeek V4与GPT-5.5同日登场,路线截然不同、各领风骚。GPT-5.5作为闭源旗舰,通用推理、跨工具Agent、办公工作流全面领先,综合基准屠榜、生态成熟,适合全球通用场景。DeepSeek V4主打开源+百万上下文,中文理解、长文档/代码库处理、低成本私有化部署优势突出,适配国产算力,性价比碾压闭源模型。论全能上限,GPT-5.5更强;论中文、长文本、自研落地,V4更实用。二者不是替代,而是互补,共同推动AI走向普惠与专业并行的新阶段。deepseekv4和gpt5.5谁更强

11. #DeepSeekV4#分为V4-Pro和V4-Flash两个版本,主打百万(1M)超长上下文能力V4-Pro在Agent能力、世界知识、数学推理等多项评测中达到开源模型最佳水平,推理性能比肩顶尖闭源模型;V4-Flash则以更小的参数量提供更快速、更经济的API服务,适合轻量场景。不过,受限于高端算力,目前Pro的服务吞吐十分有限,预计下半年昇腾950超节点批量上市后,Pro的价格会大幅下调。

12. 如何评价小米4月23日发布的MiMo-V2.5系列模型,有可能比DeepSeekV4更强吗?

13. DeepSeek-V4终于更新了!一百万超长上下文,Agent能力大幅增强,能力接近Opus 4.6

14. 如何看待DeepSeek V4 Pro模型价格于5月31日结束2.5折优惠,调整为原定价的1/4?

15. DeepSeek V4(预览版)在编程领域表现如何?

16. DeepSeek V4爆春节登场!四大杀招突袭全球编程王座,Claude危

17. #DeepSeekV4 价格屠夫##DeepSeekV4 价格屠夫#刚用上GPT-5.5,转身就得给DeepSeek-V4让路,不到半天。OpenAI加价,DeepSeek降价,双管齐下让人哭笑不得。2元/百万Token的输出价,让Pro版12元的价格都显得“昂贵”,相比之下GPT-5.5 Pro高达180美元。Flash速度经济,Pro性能比肩顶级闭源,百万上下文还标配。当友商还在纠结性价比,DeepSeek已经用1.55‰的价格把Agent大战拉入普惠元年。算力成本遮羞布,这次真被扯干净了。 #DeepSeekV4比海外模型便宜约60%##黄仁勋预言的灾难仅9天就成真##DeepSeek昇腾首发#请问老黄现在作何感想?

18. 最近AI大事件:DeepseekV4、GPTimage2、Mythos重磅发布

19. #DeepSeekV4比海外模型便宜约60%#【#DeepSeekV4深度适配华为芯片#】DeepSeek今天正式发布V4系列预览版并同步开源,分为V4-Pro和V4-Flash两个版本,主打100万(1M)超长上下文能力,官网、App及API均已同步更新。#DeepSeekV4深度适配国产芯片#据科技博主卡兹克实测,DeepSeekV4大概比海外模型平均便宜60%左右。DeepSeek V4的报告里,透露出非常多国产化的细节1. V4在后训练和推理体系里引入了MXFP4。虽然训练还是用的英伟达体系,但是在后训练和推理上用这个基本上就意味着,DeepSeek在往开放低精度格式和多硬件适配方向走,可以适配国产卡比如华为昇腾、寒武纪、壁仞等等。2. V4的底层内核不再完全靠CUDA写,用了一个叫TileLang的DSL。DeepSeek希望底层算子开发不要完全锁死在CUDA上,而是用更高一层的语言描述计算,再尽量编译到不同硬件上,这个非常牛逼,可以大大降低迁移成本。3. V4专门搞了一个叫MegaMoE的融合内核,设计目标是减少专家并行中的通信等待,目前已经在华为昇腾上跑通。卡兹克称:“这三条放一起,方向就非常清楚了,V4是完完全全的,为了国产卡而设计的模型。”(综合卡兹克)#DeepSeek v4 百万上下文#

20. #DeepSeekV4 尺度#DeepSeekV4的尺度把控算是国内大模型里很贴合实用场景的,既不刻意缩手缩脚也不盲目放开,找对了平衡感。它在专业内容输出上尺度够宽,不管是技术原理拆解、行业数据分析还是深度观点探讨,都能放开讲细节,不会因为过度限制变得语焉不详,满足职场和学习的实际需求,这一点比不少偏保守的模型更实用。而在敏感内容和风险信息上,尺度卡得又很准,不会出现不当输出,也不会把正常的交流需求误判成敏感问题,避免了矫枉过正的尴尬。这种尺度设定其实贴合了普通人的使用习惯,毕竟大家用大模型更多是解决问题,既需要足够的信息输出空间,也需要安全的使用环境,DeepSeekV4把这两点的边界划得清晰,不用用户在找信息和避风险之间反复试探,用起来更顺手,也能真正发挥大模型的实用价值,这也是它能在一众模型里站稳脚跟的关键。

21. 终于,全球 AI 圈等待了几个月的 DeepSeek V4,它终于来了!今天上午,DeepSeek API 文档上线.此次,DeepSeek V4 按大小会有两个版本,分别是 DeepSeek-V4-Flash 和 DeepSeek-V4-Pro。上下文长度是 100 万 tokens。同时,输出长度最大为 384K tokens。 #DeepSeekV4发布# #DeepSeekV4和GPT5.5谁更强#

22. #DeepSeekV4发布# 终于发了!模型按大小分为两个版本:DeepSeek-V4-Pro和DeepSeek-V4-Flash。DeepSeek-V4-Pro性能比肩顶级闭源模型,在 Agentic Coding 评测中,V4-Pro 已达到当前开源模型最佳水平,并在其他 Agent 相关评测中同样表现优异。在世界知识测评中,大幅领先其他开源模型,仅稍逊于顶尖闭源模型 Gemini-Pro-3.1。数学、STEM、竞赛型代码的测评中,DeepSeek-V4-Pro 超越当前所有已公开评测的开源模型。DeepSeek-V4-Flash由于模型参数和激活更小,相较之下 V4-Flash 能够提供更加快捷、经济的 API 服务。在 Agent 测评中,DeepSeek-V4-Flash 在简单任务上与 DeepSeek-V4-Pro 旗鼓相当,但在高难度任务上仍有差距。DeepSeek API已上线 V4-Pro 与 V4-Flash,支持 OpenAI ChatCompletions 接口与 Anthropic 接口。太强了!!

23. 【#DeepSeekV4Pro大幅领先其他开源模型#】4月24日, DeepSeek全新系列模型DeepSeek-V4 的预览版本正式上线并同步开源,据介绍DeepSeek-V4 拥有百万字超长上下文,在 Agent 能力、世界知识和推理性能上均实现国内与开源领域的领先。模型按大小分为两个版本deepseek-v4-pro 和deepseek-v4-flash,其中DeepSeek-V4-Pro在 Agentic Coding 评测中,已达到当前开源模型最佳水平,并在其他 Agent 相关评测中同样表现优异;在世界知识测评中,大幅领先其他开源模型,仅稍逊于顶尖闭源模型 Gemini-Pro-3.1;在数学、STEM、竞赛型代码的测评中,DeepSeek-V4-Pro 超越当前所有已公开评测的开源模型,取得了比肩世界顶级闭源模型的优异成绩。(密度新闻)#DeepSeekV4深度适配国产算力##DeepSeek v4 百万上下文#

24. ZPedia|一文读懂 DeepSeek V4:Agent 能力加冕开源新王,94%幻觉率是暗雷,价格优势不再

25. DeepSeek V4终于出场,为大模型国产算力时代做准备

26. DeepSeek V4最全解读

27. DeepSeek发布V4

28. DeepSeek-V4来了:百万上下文普惠时代,Claude和OpenAI该紧张了

29. 等待DeepSeek的145天

30. "幻覺率"AI的錯誤指標

31. DeepSeek V4刷屏了,但很少有人提出幻觉率大幅升高的问题

32. 深度拆解DeepSeek-V4:逻辑完美的“高智商谎言”,为何比胡说八道更危险?

33. DeepSeek V4实测:没想象中好,但看在便宜的份上能忍

34. 海外评测DeepSeek-V4:智能体任务排名开源第一 幻觉率上升、Token消耗大

35. DeepSeek有时候胡说八道怎么办_DeepSeek幻觉问题优化方法【修正】

36. 别急着All-in DeepSeek V4,先看看这10位从业者的真心话

37. DeepSeek V4 Pro全面测评

38. V4幻觉率94%,你该注意什么?

39. 用了三个月DeepseekV4大模型RPA,Agent智能指令到底靠不靠谱?

40. DeepSeek V4的Agent能力是开源第一——但还有一件事,悄悄变差了

41. AI提效决策分析5-我用同一道题考了DeepSeek V4的两个版本,差距在这里

42. DeepSeek V4 Pro 与 GPT 5.5 对比

43. DeepSeek V4 + Claude Code 一手实测!夯爆了还是拉完了?

44. DeepSeek V4戳破的两个幻觉:算力霸权与数据堆叠

45. 幻觉发生率世界范围AI大模型排名,Deepseek排第几?

46. DeepSeek V4预览版发布!但最狠的不是性能

47. 主动“认输”的DeepSeek,这次到底行不行?

48. Hermes切换DeepSeek V4,AI智能体能力跃升

49. DeepSeek-V4幻觉率94%:长文本能力与可靠性的技术权衡是什么

50. DeepSeek-v4识图模式实测,10个场景翻车过半

51. DeepSeek v4 的“完美谎言”:一本正经的逻辑陷阱

52. GPT‑5.5 vs DeepSeek V4:2026年4月大模型实战对比

53. DeepSeekV4预览版本正式发布

54. 用我的多Agent协同Skill实测DeepSeek V4

55. DeepSeek-V4正式预览上线,技术迭代落地提速,百亿级融资仍处传闻博弈期

56. DeepSeek V4的Agent能力怎么训出来的

57. DeepSeek V4 vs GPT-5.5:程序员的终极选择 - 哔哩哔哩

58. 理性看待DeepSeek-V4和GPT-5.5测评

59. DeepSeek V3.2 正式版发布,V4 还没来,但已经是开源模型里 Agent 能力最强了

60. DeepSeekV4预览版发布:开源大模型新标杆,三大能力领跑行业

61. Deepseek v4最新报告

62. 为什么你感觉不到DeepSeek V4的厉害?

63. DeepSeekV4终于发布,简单总结来了

64. DeepSeek-V4和GPT-5.5第一波实测对决,结果出人意料!

65. GPT5.5 和 DeepSeek V4,哪个更好?

66. 美国发布DeepSeekV4评估报告

67. 什么是AI“幻觉”?会引发哪些潜在风险?

68. Agent Plan、Coding Plan上新:新增DeepSeek V4

69. DeepSeekV4实测翻车!高端乱杀,小事卡壳太离谱

70. DeepSeek-V4和GPT-5.5第一波实测对决!

71. 实测DeepSeek最新“专家模式”有哪些能力?

72. Deepseek-V4的<think>幻觉问题及Agent Skill生成评估基准

73. DeepSeek V4性能、编程测试汇总:15个月等待能换来全球AI冠军吗

74. cc+deepseekv4pro重度使用感受

4
扫一下,分享更方便,购买更轻松
4评论

  • 精彩
  • 最新
  • 造谣一张嘴

    校验提示文案

    提交
  • 数据有出处吗?不过v4幻觉确实很严重

    校验提示文案

    提交
  • 有这么高么?

    校验提示文案

    提交
  • AI总结AI,垃圾信息多得离谱

    校验提示文案

    提交
提示信息

取消
确认
评论举报

最新文章 热门文章