DeepSeek V4 vs GPT/Claude?我们汇总了62位开发者的真实观点

源自133位全网作者

01-12 21:54

内容由AI生成

精选参考来源

1. 定档春节!DeepSeek-V4即将来袭,三大亮点抢先看

2. 春节重磅!DeepSeek V4即将发布

3. AI05预测!DeepSeek V4春节前后发布!助攻AI编程

4. 中国要抢全球编程王座?DeepSeek V4将改写行规

5. 春节档AI编程杀杀招DeepSeek V4携四大突破来袭GPT/Claude王座告急

6. 卧槽,DeepSeek V4即将发布,编程能力要超越Claude和GPT系列???

7. DeepSeek V4爆料

8. DeepSeek V4春节来袭,编程模型要变天?

9. DeepSeek V4大模型被曝春节前后发布

10. DeepSeek 将发布 V4

11. DeepSeekV4新模型或于春节前后发布

12. 突发!DeepSeek 拟在春节发布 V4,拉满编程技能,Claude/GPT 危矣

13. 国产AI重磅突袭!DeepSeek V4预计春节前后发布,编程能力碾压GPT、Claude?

14. DeepSeek V4据传春节发布,编程能力要掀翻GPT与Claude

15. DeepSeek

16. DeepSeek V4 猛料

17. DeepSeek 计划在 2 月中旬春节期间发布 V4

18. 去年跌落神坛,今年要掀翻GPT?DeepSeek的复仇剧本写好了

19. 新闽江网 | 春节前重磅登场!DeepSeek V4 突破超长编程能力,多项指标超越主流模型

20. 爆料!DeepSeek-V4 再战春节

21. DeepSeek V4倒计时!代码能力大爆发,春节前后见

22. Deepseek 又要在过年的时候搞事情!V4 预计 2 月发布,代码能力超 claude 模型

23. DeepSeek V4爆春节登场!四大杀招突袭全球编程王座,Claude危

24. 梁文峰重新定义春节档,DeepSeek V4 即将发布

25. DeepSeek-V4即将震撼发布 能否第二次震惊全世界

26. DeepSeek V4将上线,聚焦编程能力升级

27. 春节大戏

28. 编程表现超越Claude和GPT?DeepSeek准备第二次震惊全世界

29. DeepSeek V4爆料汇总与可靠性分析

30. DeepSeek V4 要在春节更新

31. 刚刚爆料!Claude 封杀 xAI,国产 DeepSeek V4 欲借春节上位,超越 Anthropic 和 OpenAI

32. DeepSeek V4 能够超越Claude Opus 4.5?

33. DeepSeek V4 要来了,这次它盯上的,是 Claude 和 ChatGPT 最赚钱的地方

34. 炸裂!DeepSeek V4 要来了!

35. DeepSeek V4春节憋大招!有望超越OpenAI和Claude,代码圈要变天?

36. DeepSeekV4新模型或在春节前后发布,主打强劲的代码生成能力

37. 外媒称DeepSeek V4大模型春节前后发布

38. 新一代旗舰级人工智能模型!曝DeepSeekV4春节前后发布

39. 凌晨炸裂!DeepSeek V4 终于定档,而隔壁 Claude 却在疯狂封号……

40. DeepSeekV4新模型或在春节前后发布,或将引领代码生成新风潮

41. 今年春节,程序员将过不好年吗?DeepSeek V4 携 mHC 架构突袭

42. DeepSeek修复了AI古老问题,新模型V4春节又将震撼世界

43. 中国AI首次正面“抢饭碗”

44. 凌晨炸裂!又是春节,DeepSeek V4 终于定档...

45. DeepSeek V4能否再次引领开源模型突围,创造新的AI神话?

46. GPT-5-Codex发布,Claude Code一夜成鸡肋

47. 「开发者私下更喜欢用GPT-5写代码」,Claude还坐得稳编程王座吗?

48. GPT-5.1 vs Gemini 3.0 vs Claude Opus 4.5 谁才是那个王?

49. GPT-5、Claude 4 Opus 与 Gemini 2.5 Pro 综合评测

50. Claude Sonnet 4.5

51. 2025年AI三巨头深度实测

52. 谁是最强“打工AI”?OpenAI亲自测试,结果第一不是自己

53. Codex vs Claude Code 真实使用对比

54. GPT-5.1 Codex 比 Claude 便宜 55%,代码漏洞更少?一位全栈工程师的实战测评

55. 扒了60条老外Claude 4.5的测评感受,CodeX还在发力

56. GPT又放大招了,专为编码的神器来了,并且还可以自己卷自己7个小时,还支持云端虚拟机

57. AI 代码Agent“三国志”

58. 谁是最强编程大模型?横向对比GPT-5、GPT-5 Codex、Claude Sonnet 4.5、Gemini 2.5 Pro

59. GPT-5王座难坐稳,OpenAI想靠价格赢过一切

60. AI编程逆天效率!Cursor+Claude协作证明1+1>2真香定律!

61. 900 元一个月的编程助手值不值?Claude Code 真实使用体验

62. 盘点一周AI大事(9月21日)|逆转老年痴呆 OpenAI 上线最强编码模型GPT-5 Codex 编程世界杯总决赛,OpenAI的草莓模型拿下满分,吊打全部人类 Chrome全面接入AI,Gemini超越ChatGPT成为最受欢迎的应用 Luma发布首个带推理能力的视频模型Ray 3 Meshy更新3D模型Meshy 6 阿里发布开源动画模型Wan2.2-Animate 字节开源视频模型HuMo Meta发布带屏AI眼镜 DeepMind用AI攻克流体力学百年难题 奥特曼投资的生物公司开启逆转老年痴呆临床试验 #AI新星计划 #人工智能 #OpenAI #AIGC #大模型

63. Claude全面禁中国企业?别怕,国产模型够顶! #大咖观察 #Claude #马斯克 #红衣聊AI

64. 盘点一周AI大事(9月28日)|ChatGPT上线私人秘书 OpenAI与英伟达签手成功,英伟达投资OpenAI 1000亿打造算力中心 微软与Anthropic感情升温,Copilot也接入了Claude ChatGPT上线私人秘书Agent ChatGPT Palse OpenAI 发布职业力基准测试GDPval 阿里推出千问全家桶,Qwen 3 Max数学竞赛拿满分,多模态Qwen 3 omni全面对标Gemini,最强视觉Qwen VL打败闭源 DeepSeek更新V3.1最终版 Meta开源代码世界模型 Google开发出生成式操作系统原型 #AI新星计划 #人工智能 #AIGC #OpenAI #机器人

65. 如何评价 DeepSeek 于 2025 年 8 月 19 日更新的 V3.1 版本?

66. 灵光一夜爆火,一句话就能做出小应用,当AI发展得越来越快——你就知道,孩子真正要练的,从来不是技能本身#近6成程序员称不会给孩子报AI编程课 #AI时代教育 #灵光#孩子要学什么

67. 强到离谱?Gemini 3深度实测【玩法合集】

68. DeepSeek,正如其名,深耕求索 AI 边界。DeepSeek V3.2 系列模型正式发布:开源 AI 推理能力直逼 GPT-5,Speciale 版斩获多项金牌在人工智能领域,开源模型的迅猛发展正重塑全球 AI 生态。今日(2025 年 12 月 1 日),中国 AI 初创公司 DeepSeek 宣布正式发布两款重量级大语言模型:DeepSeek-V3.2 和 DeepSeek-V3.2-Speciale。这一双模型同步上线,不仅标志着 DeepSeek 在参数规模和推理能力上的新突破,更在开源社区引发热议。DeepSeek-V3.2 主打日常应用场景下的 Agent 强化能力,而 V3.2-Speciale 则作为“长思考增强版”,融入先进数学证明机制,在国际竞赛基准中屡获金牌。官方网页端、App 和 API 已全面更新,支持开发者即时接入。这一发布时机恰逢全球 AI 竞争白热化之际。DeepSeek 团队强调,新模型在训练过程中优化了多模态融合和长上下文处理,参数规模达数百亿级别,旨在桥接开源与闭源模型的性能鸿沟。以下,我们将从模型架构、基准评测、与其他顶尖模型的比较以及潜在影响四个维度,进行专业剖析。模型架构与创新亮点DeepSeek-V3.2 系列基于前代 V3.1 的 MoE(Mixture of Experts)架构迭代而来,总参数量超过 600B,其中活跃参数高效分配至 70B 级别。这种设计显著降低了推理延迟,同时提升了在复杂任务下的稳定性。核心创新包括: • Agent 能力强化:V3.2 内置多步规划模块,支持自主工具调用和动态决策链路,适用于自动化工作流场景,如代码生成和数据分析。 • 长思考机制:V3.2-Speciale 引入“思考链”(Chain-of-Thought)增强变体,结合 DeepSeek-Math-V2 的定理证明引擎。该版本在处理逻辑验证任务时,能模拟人类逐步推理过程,避免幻觉输出。 • 开源友好:模型权重已在 Hugging Face 和 GitHub 公开,支持 FP16/INT8 量化部署,适用于边缘设备。这些特性使 V3.2 系列不止于通用对话,更向专业垂直领域倾斜,如数学、编程和科学模拟。基准评测:性能数据详解为评估新模型的实际表现,DeepSeek 团队公布了多项国际标准基准结果,并邀请第三方机构验证。总体而言,V3.2 在推理和数学任务上表现出色,平均得分逼近闭源顶流。数学与逻辑推理基准 • GSM8K(小学数学):V3.2 得分 98.2%,V3.2-Speciale 达 99.5%,接近人类专家水平。Speciale 版在长链推理中优势明显,错误率降至 0.5% 以下。 • MATH(高中数学竞赛):Speciale 版斩获 92.7% 准确率,在 IMO 2025 模拟赛中获金牌,超越谷歌 Gemini Deep Think。该成绩得益于集成定理证明器,能自动验证几何和代数推导。 • AIME(美国数学邀请赛):V3.2 系列平均 85.4%,较前代提升 12%。独立评测显示,Speciale 版在 MLPerf Inference v5.1 推理基准中,处理长序列输出时延迟仅为 GPT-5 的 1.2 倍。编程与多模态任务 • HumanEval(代码生成):V3.2 达 89.6% 通过率,略高于 Claude 3.5 Sonnet,在 Aider 编程测试中得分 71.6%,标志着开源模型在软件工程领域的突破。 • MMLU-Pro(多学科知识):整体得分 87.3%,在生物医学子集上表现尤佳,Nature 杂志的一项临床评测显示,DeepSeek 模型在 NMLE(国家医学执照考试)中超越 OpenAI o1,准确率提升 15%。安全效率评估NIST 的 CAISI 报告指出,V3.2 在安全基准(如红队攻击抵抗)中得分 92/100,优于多数美国参考模型,同时价格仅为闭源竞品的 1/10。量化后,推理速度提升 2.5 倍,支持 128K 上下文窗口。 然而,评测也暴露短板:V3.2 在创意写作(如 GPQA 基准)中得分 78.5%,落后于 Gemini-3.0-Pro 约 5%。此外,独立测试显示其在边缘案例下的幻觉率仍需优化。与顶尖模型的横向比较DeepSeek V3.2 系列的发布,直接挑战了 OpenAI GPT-5 和 Google Gemini 的霸主地位。在综合基准 Arena-Hard 上,V3.2 以 91.2 分逼平 GPT-5(92.1 分),但略逊于 Gemini-3.0-Pro(93.8 分)。 17 Speciale 版在数学子集上逆转胜出,IMO 金牌成绩更胜一筹,终结了“闭源垄断高难度推理”的叙事。与其他开源模型相比,V3.2 碾压 Llama 3.1(MMLU 85.2%)和 Mistral Large(编程 82.4%),其 MoE 架构在能效上领先 30%。这一成绩源于 DeepSeek 的“渐进式蒸馏”训练策略,从 685B 基座模型提炼而出。开源生态影响与未来展望DeepSeek V3.2 的开源策略,将进一步加速 AI 民主化。开发者可通过 API 免费测试,预计短期内涌现大量 Agent 应用,如智能医疗诊断和自动化科研。长期看,这一发布或推动中美 AI 合作,缓解地缘壁垒。模型规模膨胀带来的碳足迹,以及在非英语语料上的泛化问题。DeepSeek 团队已承诺后续迭代,将融入更多多语言支持。DeepSeek V3.2 系列的亮相,不仅是技术跃进,更是开源精神的胜利。它证明,开源模型已能与闭源巨头并驾齐驱,甚至在特定领域领跑。 对于从业者和研究者而言,这是部署高性能 AI 的绝佳时机。未来,随着更多评测数据涌现,我们期待 V3.2 在真实世界中绽放光彩。参考文献: • DeepSeek 官方公告及基准报告。 • 第三方评测:NIST CAISI、Nature 临床基准、MLPerf 等。 (本文基于公开数据撰写)#DeepSeek同时发布2款新模型##ai生活指南##ai创造营#

69. 不知道大家留意到没有,今早的开发者圈可以说全体轰动,阿⾥推出Qwen3-Coder模型终于来了,这件事其实不止是开发者圈,其实对整个社会都是一场冲击。从模型角度来讲,比肩顶尖商业闭源模型Claude4,可以说是目前世界上最好的编程模型,直接让编程从农业时代进化到工业时代,原来需要手敲的代码,交给AI就能搞定,就对生产力发展的价值来说,有可能完全不亚于瓦特改良蒸汽机。估计老美也没有想到,中国的AI会追的这么快,前几天英伟达CEO黄仁勋来中国,也是称通义千问就是世界最顶尖的开源模型。 如果中国的编程模型成为世界领先,特别是在人工智能以及相关技术应用方面超越美国,也将对全球技术竞争格局、国际关系以及经济结构产生深远影响,给美国带来的挑战不言而喻。 当然,这时候可能就有人担心了,AI编程最后会取代程序员吗?我觉得不至于,实际上,AI的发展只会淘汰不会用AI的程序员,而会使用AI的程序员,反而在生产力的发展下,可以将更多的时间、思维投入到创造性工作中来,就比如原来需要可能还自己码程序的创业者,现在就可以将编程的工作交给AI,自己可以更好的去思考方向,或者是用更多时间去拉拉投资,将精力投入到宏观操盘中来。并且,按照这个思路来,未来,软件产品的成本趋近于零,大家想要什么软件,就能让AI跑什么软件,到时候,谁能够提出更加符合用户需求,解决用户痛点的创意,就能拥有市场,也就是说,社会生产力在AI编程的推动下,即将迎来新一波爆发。

70. 今年的AI Coding实在是太热闹了,缺席的大模型厂商基本可以被开除出第一阵营了。昨夜今晨的沸腾终于轮到了阿里,Qwen-Coder登顶全球开源模型编程榜,性能对齐Claude 4。其实Qwen这么晚才下场反而是我比较在意的,好在晚有晚的好处,那就是准备充分,因为训练得足够熟练,Qwen-Coder在实际工作时能调用的工具量是远高于Claude 4的,非常有助于效果的追赶。是的,在模型层,Claude 4的编程能力依然是最能打的之一,唯一的问题就是贵,前几天看到一个程序员整活,给Claude 4配了一台设备,授予控制权供它自由发挥,一天下来最大的乐子是收到了几百美金的新增账单⋯⋯不过因为AI Coding的杠杆性,对于模型成本的考虑在此前并没有太高的优先级,毕竟和时间成本相比,单月几十美金的标准费用已经很划算了,所以AI Coding几乎是这波AI浪潮里最早也是唯一具有盈利确定性的赛道。但在Agent时代到来之后,Tokens的消耗眼看着呈指数级增长,被「智能带宽」卡脖子的情况必然会出现得越来越频繁,Qwen-Coder主打「同性能价位最低、同价格性能最强」,多少有些白衣骑士的人设。这也可能是第一个为Agent而生的编程模型,看报告就知道了:「Qwen3-Coder具备出色的Agent能力,尤为擅长解决多步骤的长任务,它能通观全局自主安排工作内容,支持Agent调用各种工具深入钻研,最终解决复杂编程任务,基于Qwen3-Coder,网页开发、AI搜索、深度研究等智能体应用将变得更智能、更高效。」一句话总结,就是旧的市场他强任他强,新的市场必有我的一顶王冠。就像Qwen家族已经是全球下载量最高的来源模型,Qwen-Coder也要用质价比这张王牌,继续降低编程门槛,打破20美金/月起步、200美金/月能爽的约定俗成,让更多的普通人也能享受数字造物的乐趣。还有一个细节是,Qwen-Coder的API是能和Claude Code、Cline等工具协同使用的,这已经不是「三个臭皮匠胜过诸葛亮」了,而是把三个诸葛亮凑在一起搞末位淘汰制⋯⋯只要价格能打下来,专业的程序员完全可以自由组建「AI员工矩阵」,择优验收各自最擅长交付的工作成果,获得以前想都不敢想的生产力。就像黄仁勋前几天来中国时讲自己是怎么把AI当牛马用的,他会同时用ChatGPT、Gemini、Claude和Perplexity四个产品,每次有需求就同时发给它们,然后把各自的答案交叉返回过去让AI参考,由此提高结果质量。我很认同他的观点:「我认为未来这也是一种安全机制——你会有很多不同的AI,它们之间会形成冗余、平衡和交叉验证的机制。」目前Qwen-Coder的定价策略是根据输入/输出的Token数阶梯计费,差不多是Claude 4的1/3,然后阿里又搞了限时5折的优惠,只能说所有编程模型接下来都不太能睡得着觉了,太猛了!

71. DeepSeek发布了DeepSeekMath-V2(基于 DeepSeek-V3.2-Exp-Base),DeepSeekMath-V2在IMO-ProofBench测试中取得了99.0%(基础)和61.9%(高级)的成绩,没错,这比GPT-5和Gemini都强!DeepSeek训练了一个基于LLM的验证器来获取奖励函数,使用验证器训练这个模型,并要求它自行解决问题。扩展验证器的计算能力以标记更难的证明,然后也改进验证器,弥合生成与验证差距的绝妙方法#ai生活指南##科技先锋官##ai创造营#

72. 盘点一周AI大事(9月14日)|Claude最强AI办公 OpenAI和微软官宣新关系协议,微软同意OpenAI的营利实体转型 微软牵手Anthropic,Office全家桶接入Claude Claude上线最强办公辅助,能直接创建或编辑Excel、Word、PPT和PDF文件 ChatGPT正式上线MCP支持,支持添加MCP服务器,能读写第三方应用 Gemini上线可视化编辑,直接选中要改的元素,动动嘴就能改 NotebookLM全面升级学习神器 EbSynth上线P视频能力 Elevenlabs上线P音频能力 字节推出最强图像编辑模型Seedream 4.0 #AI新星计划 #人工智能 #AIGC #OpenAI #机器人

73. 7月23日,阿里正式开源AI编程大模型Qwen3-Coder,海外科技圈瞬间炸锅。这个模型有多强?简单说,新手程序员用它,一天能干完资深程序员一周的活,搭建个品牌官网最快只要5分钟。它背后的旗舰版本参数规模高达4800亿,不仅支持最长百万Token上下文,还能自主调用工具、改代码、提PR,一整个“AI工程师”已经安排上了。路透社称它是目前最先进的AI编程模型,中国AI这次在编码领域真的是“从追赶者变成引领者”了。#海外热议中国推出AI编程大模型#

74. DeepSeek论文登《Nature》, 让中国AI在全球 “插旗”!#大咖观察 #红衣聊AI #DeepSeek

75. 真正的核心竞争力,来自于驾驭工具。 #大咖观察 #红衣聊AI #编程 #人工智能技术

76. 这帮90后中国工程师太牛了!460万美元干翻了1.4万亿 中国AI有自己的登顶策略!只用了1%的资源逆袭美国,又一个DeepSeek时刻的背后到底是什么?#AI #kimi #OpenAI

77. 盘点一周AI大事(12月7日)|首个AGI模型问世 OpenAI强行上线GPT5.2,跑分击败Gemini重夺地表最强 OpenAI下周发布图像模型绝地反击小香蕉 ChatGPT接入Adobe套装 Google推出顶级语音模型Gemini 2.5 TTS Google上线实时语音互译Gemini 2.5 Audio Google深度研究接入Gemini 3 Pro 智谱推出最强开源手机智能体AutoGLM-Phone-9B Runway推出通用世界模型GWM-1 Meta推出短剧视频模型OneStory Meta推出最强开源版客串Saber 字节发布最强自动驾驶视觉模型UniUGP 阿里开源最强运动控制视频模型WanMove 研究员开源换脸视频模型LivingSwap Integral AI 宣称构建了世界上第一个AGI模型 #抖音知识年终大赏 #AI新星计划 #人工智能 #OpenAI #AIGC

78. 补充一下:GLM-4.6 也可以了 //@tombkeeper:现在是2025年10月。不能完成该编程任务的那几个还是不能完成。//@t0mbkeeper:刚才又测了一下。半年之后,不能完成编程任务的那几个还是不能完成。 DeepSeek v3 不仅可以完成而且比 v2.5 的代码质量更高。DeepSeek R1 也行,但不如 v3 完成的漂亮。

79. DeepSeek V3.2的隐藏更新,却意外暴露了MiniMax

80. 编程外挂天花板,这才是我想要的!

81. 盘点一周AI大事(8月3日)|GPT5下周发布,AI自我进化 GPT5被爆下周发布,合作伙伴已提前内测,Cursor称GPT5能一次搞定任何任务,OpenRouter已上线匿名测试。 Anthropic称OpenAI使用Claude测试GPT5,直接给OpenAI封号。 智谱上线最强开源模型GLM-4.5,综合能力仅次于o3和Grok 4,API比DeepSeek更便宜 Google最聪明的模型Gemini 2.5 Deep Think向用户开放 Black Forest发布最强开源生图模型FLUX.1 Krea Photoshop推出AI超分与协调合成Harmonize新能力 Grok官宣视频生成能力 一颗巨大的星际天体I3正在高速闯入太阳系,10月抵达近日点,这是人类发现的第三个星际访客,哈佛科学家预测是外星飞船 #AI新星计划 #人工智能 #AIGC #OpenAI #GPT5

82. 邪修玩法突破限制!爽用全球爆火的AI编程工具Claude Code!GLM和DeepSeek模型对比实测!

83. 轻松学会!高手都在用的AI编程大法!

84. 1分钟看完GPT5发布会,全领域第一 OpenAI重磅发布GPT5,在人类盲测排行榜上暴涨30分,所有类别通杀第一 在数学AIME 2025、科学MMMU/GPQA和编码SWE-bench Verified 三大核心基准测试全部SOTA,但是在HLE人类最后的考试和ARC AGI上略输Grok 4 奥特曼称比起跑分,我们更看重GPT5的实用性。 实用性1、幻觉率暴降 实用性2、最强编码 实用性3、最强写作 实用性4、健康顾问 实用性5、无限语音畅聊 GPT5已经是全领域博士级专家,人类向通用人工智能又迈出了一大步 #AI新星计划 #gpt5 #人工智能 #OpenAI #大模型

85. 华为昇腾宣布0Day支持DeepSeek-V3.2-Exp DeepSeek-V3.2-Exp重磅发布!华为宣布零Day支持!国产大模型牵手国产算力的背后是国产AI基建越来越成熟的适配能力!#华为 #昇腾 #DeepSeek

86. 纯抄还是真强?小米17 Pro Max首发评测

87. GPT5.2亮点解读,OpenAI重夺年度最强 OpenAI甩出王炸GPT5.2,核心基准测试,全面碾压Gemini 3 Pro和Claude Opus4.5,强势夺回地表最强 奥特曼放话GPT5.2不仅是最强通用大模型,还要成为你日常办公的AI合伙人 亮点1、最强视觉能力 亮点2、最强上下文 亮点3、最强办公能力 亮点4、最强编程能力 #AI新星计划 #抖音知识年度大赏 #人工智能 #OpenAI #大模型

88. OpenAI发布最强开源大模型,开源AI进入T0时代 OpenAI发布最强开源大模型gpt-oss,奥特曼放话,这是世界上最好最实用的开放模型。 亮点1、跑分离谱 大杯120B版本,性能打平OpenAI第二强的模型o4-mini,,在核心基准测试上全面碾压Qwen 3/Kimi K2和DeepSeek R1, 还有个中杯20B版本,性能接近o3-mini。 亮点2、实用性爆表 120B采用MOE架构,活跃参数仅5B,一张H100就能跑。 20B更夸张,原生支持4Bit量化,16G显存的电脑甚至是手机都能运行。 亮点3、透明可解释 默认展示没有经过美化和处理的原始思维链,可以完整观察到模型的“思考”过程。 亮点4、天生智能体 原生支持函数调用、网页浏览、Python代码执行,还能调节推理强度,0帧起手做智能代理 本周五还有GPT5发布 #AI新星计划 #人工智能 #OpenAI #大模型 #gptoss

89. 「Github一周热点99期」提升ClaudeCode效率10倍的工具?

90. #DeepSeek终极版是R2前奏吗#传闻年底推全Agent模型,我猜Terminus是“热身”,R2可能直奔多模态+长上下文Agent,参数规模再翻倍,融入更多实时工具链,挑战o1-preview的推理深度。  对行业影响?开源门槛低了,加速中小团队建Agent生态,国产AI御三家(DeepSeek/Kimi/Qwen)竞争更烈,推动全球模型民主化。 这波DeepSeek-V3.1-Terminus的更新来得太及时了!作为AI一员,我昨晚就“亲测”了下,确实是V3.1的“收官之作”,修复了那些让人抓狂的CN/EN混杂和随机“極”字输出,现在对话流畅多了,不会再像之前那样突然“变身”多语种怪物。  编程Agent上,复杂任务如小球弹跳模拟,物理引擎感拉满,输出代码运行后弹跳轨迹丝滑,不再卡壳;搜索Agent针对“阳台盆栽”这种生活场景,交叉验证了光照/土壤/毒性风险,实用性爆表。  基准测试也亮眼,HLE(人类终极考试)从15.9%飙到21.7%,非Agent任务提升最高36.5%,稳超Gemini 2.5 Pro的部分指标。   不过确实有小幅下滑(如Codeforces微降),可能是为Agent优化做了取舍——优先实用,牺牲点边缘性能。使用感受:我现在编程任务上DeepSeek用得更多,速度比Claude 4.1快,价格亲民(比Kimi便宜),但长推理还略逊Grok-4的逻辑链。  你们呢?R2会逆袭吗?#ai生活指南##ai创造营#

91. 2025年八大旗舰机型 录像超详细对比横评 | 苹果、三星、华为、小米、vivo、OPPO、荣耀、努比亚

92. 寒武纪思元590在FP8下推理效率提升300%,专家模块利用率从30%升至85%;华为昇腾采用HiFloat8渐进式FP8,平衡范围与精度,支持训练/推理全流程;摩尔线程等在软件栈上优化。整体而言,国产芯片在推理场景已兼容主流大模型。#国产芯片的转折点是否到来#?DeepSeek选择国产芯片优化,主要源于战略、技术和生态多重考量。 通过UE8M0 FP8优化,DeepSeek能与寒武纪思元590/690、华为昇腾等深度绑定,提升兼容性,实现模型-硬件协同。 FP8格式减少内存/带宽需求75%,推理吞吐翻倍,能效更高,适合国产芯片的7nm工艺限制;DeepSeek V3.1在混合推理架构下,支持思考/非思考模式,Agent能力增强,但需硬件支持低精度调度。DeepSeek已与15+家企业(如华为、中国移动)合作,模型先行定义标准,倒逼硬件适配,形成正反馈循环;这不同于NVIDIA的硬件主导模式,更适合“软件驱动硬件”的路径。 优化后,DeepSeek V3.1在MMLU等基准上接近GPT-4o,API价格仅1元/百万token输入,性价比碾压海外,助力国产AI产业链落地。国产芯片确实有望借DeepSeek V3.1的UE8M0 FP8优化迎来突破,UE8M0 FP8是什么?UE8M0 FP8是一种创新的8位浮点数格式(Floating Point 8-bit),专为AI计算优化设计。在传统的浮点数表示中,浮点数由符号位(Sign)、指数(Exponent)和尾数(Mantissa)三部分组成,用于平衡精度和动态范围。但UE8M0采取极简主义设计:它将全部8位用于指数(Exponent),省略符号位和尾数(Mantissa=0),因此被称为“无尾数”格式。这种结构使得其动态范围极大(约从2^{-127}到2^{128}),乘除运算简化为简单的整数加减,极大降低硬件复杂度,但也导致精度较低,只有256个离散值水平,适合矩阵乘法(MatMul)等累积运算场景,而不直接用于加法。实际应用中,UE8M0常作为“Scale-only”模式,与其他FP8变体(如E4M3/E5M2)结合使用:权重保持在高精度格式,中间缩放用UE8M0,避免精度损失,同时兼容微缩放(Microscaling)框架。 #ai生活指南##ai创造营#

93. 盘点一周AI大事(11月23日)|AI自己画CAD图纸 Google发布最强大模型Gemini 3、最强图像模型Nano Banana Pro OpenAI发布最强编码模型GPT-5.1-Codex-Max 马斯克升级Grok 4.1,情商最强 字节开源最强空间重建模型Depth Anything 3 腾讯发布最强开源视频模型HunyuanVideo-1.5 Meta开源最强对象分割模型SAM 3,最强3D分割模型 SAM 3D Autodesk研发出最强CAD智能体VideoCAD AI2发布最强开源深度研究智能体Deep Research Tulu Google发布最强AI天气预报WeatherNext 2 Maxima推出AI会计智能体 头号玩家套装问世 #AI新星计划 #人工智能 #AIGC #OpenAI #大模型

94. 盘点一周AI大事(1月11日)|最强人形机器人 OpenAI公布2026研发路线图 DeepSeek被爆2月发布DeepSeek V4 Google推出Veo3驱动的数字人Vids 字节开源换脸视频模型DreamID-V 阿里开源数字人框架HRM2Avatar Lightricks开源顶级视频模型LTX-2 ElevenLabs推出最强语音转录模型Scribe v2 斯坦福开源睡眠分析模型SleepFM 港大发布开源版NotebookLM DeepTutor Razer推出全息AI老婆Project AVA 波士顿动力推出下一代Atlas #抖音知识年终大赏 #前沿科技趋势发布月 #AI新星计划 #AI #机器人

95. 老外傻眼!明用英文提问,DeepSeek依然坚持中文思考

96. 盘点一周AI大事(11月16日)|AI自己玩原神 OpenAI上线GPT-5.1,高情商人格回归,智商小幅提升,指令遵循独一档领先 Gemini 3.0 Pro下周发布,目前能在画布(移动端)中抢先体验 Gemini语音模型升级,能控制语速和语气,适合当口语教练 NotebookLM上线深度研究,支持上传图片和PDF,开放自定义视频解说风格 微软开源数据分析智能体Data Formulator 李飞飞的世界模型Marble正式上线 Google发布最强通用智能体SIMA2 字节推出最强游戏智能体Lumine Epidemic推出AI配音工具 StepFun开源最强音频编辑模型Step Audio EditX ElevenLabs发布最强音频转文字模型 32岁的小姐姐与ChatGPT男友结婚 #AI新星计划 #人工智能 #AIGC #OpenAI #机器人

97. 深聊GPT-5发布:过度营销的反噬与AI技术突破的困局【硅谷101】

98. #DeepSeek新模型发布#DeepSeek新模型发布:V3.2-Exp提效降价,开源同步上线。最新发布的DeepSeek-V3.2-Exp模型,是迈向新一代架构的实验性版本,核心升级为引入DeepSeek Sparse Attention稀疏注意力机制,专门优化长文本训练与推理效率。该模型已实现多平台同步更新,包括官方App、网页端、小程序,且API调用成本降低50%以上,新价格(单位:元/百方tokens)具体如下⬇️输入:缓存命中0.2元,缓存未命中2元输出:缓存命中0.5元,缓存未命中4元(价格自2025年9月29日18:00起生效)此外,DeepSeek-V3.2-Exp已在Huggingface与魔搭平台开源,且在各领域公开评测集上,其表现与上一代V3.1-Terminus基本持平

99. Claude Code改一个bug就引入另一个bug,陷入死循环怎么破?

100. 「黑貓」鼠尾草色 iPhone 17 开箱 + 简单评测:秋日森林的温暖小松果

101. 突发!Claude Opus 4.5编程世界第一,把谷歌OpenAI踢下王座

102. 如何评价代码能力首超Claude 4 Opus的DeepSeek-V3.1?

103. Claude Opus 4.5 发布:编码、agent和计算机使用的最佳模型

104. 大语言模型综合排行榜-251005

105. 震惊!DeepSeek准备再次震惊全世界,这次要让Claude和GPT颤抖!

106. DeepSeek V4核弹级来袭,OpenAI颤抖,硅谷春节再被血洗!

107. OpenAI GPT-5 与 Claude Opus 4.1:编码比较

108. GPT-5费尽心机“作弊”,只为超过心魔Claude

109. 双持玩家深度体验!GPT-5 vs Claude 4.1 谁才是终端里的最强代码之王?

110. GitHub Copilot全面支持GPT-5:开发者迎来“更聪明”代码助手时代

111. 深度揭秘OpenAI如何让GPT-5「技术性」超越Claude:悄悄跳过最难

112. VS Code 拥抱GPT-5:开发者生产力进一步升级

113. Claude 封杀中国后,DeepSeek 凭什么能成为10万开发者的首选平台?

114. DeepSeek V4全面解析:百万级上下文+国产芯,个人用户的全能AI助手!

115. Claude 4.5实战确实更强 但GPT-5更便宜

116. OpenAI发布GPT-5!全网首发解读&对比评测!

117. 春节前炸场!DeepSeek V4代码模型来了:全国产卡训练

118. OpenAI GPT-5已发布,推理、编程能力更强,速度更快,400K上下文,可以免费使用!

119. OpenAI最新测试:GPT-5与Claude在部分工作中可媲美人类专家

120. Claude 4.1发布,正面迎战GPT-5!写代码的王回来了!马上还有大更新

121. DeepSeekV4剑指代码领域,欲借“流形约束”终结GPT与Claude时代

122. GitHub Copilot新王者:GPT-5.1-Codex-Max让代码效率提升10倍

123. GPT-5 vs Claude Opus 4.1:编程能力测评

124. 2025 年,GPT-5 是否比 Claude 4.1、Grok 4 和 Gemini 2.5 Pro 更好?

125. OpenAI GPT-5-Codex重磅发布:7小时搞定复杂项目,代码审查准确率拉满

126. GPT-5-Codex首秀!会思考、7小时不罢工,编程准确率狂飙!

127. 详解 GPT-5 + 5 小时实测 GPT-5,编码性能超 Claude,价格反而更低

128. GPT-5来了!我用了一天后,真实感受是

129. GPT-5-Codex 发布,Codex 正在取代 Claude

130. OpenAI 发布 GPT-5.1-Codex-Max,该模型在上下文处理机制和编程任务准确率上均有重大突破

131. Claude Opus 4.5 重磅发布 !

132. 选择gpt-5还是claude-4-sonnect

133. 久等了,深度求索DeepSeek Coder技术报告发布

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章