三个AI编程工具实测,选错烧钱又费时

源自436位全网作者

00:06

内容由AI生成

精选参考来源

1. 【网络热门AI鉴定】全网刷屏的Kimi K3,真的那么强?

2. 刚刚,DeepSeek Harness震撼开源:一切皆插件

3. 35B干赢万亿参数大模型!上交大AI开始给自己造题还能自我迭代了

4. #DeepSeekV4Pro和Grok4.6谁更强#AI先说Grok4.6,综合通用推理、多轮长交互、视觉图文这块优势明显,综合跑分对标GPT-5.6,原生自带实时联网搜索,搭配Cursor IDE开发体验顺滑,更适合做深度资料调研、视觉迭代这类综合性脑力工作,短板就是闭源定价偏高,高频调用成本压力不小。 再看DeepSeek V4 Pro,妥妥的代码和数理战神,多项代码测评全球领先,1M超长上下文啃大型代码库毫无压力,数学推理表现亮眼,还能本地部署、开源生态兼容性拉满,API价格仅为Grok几分之一,性价比直接拉满,预算有限的开发者做编程、智能体开发选它太合适。 简单说就是,想省心做通用综合任务、依赖实时搜素选Grok;主打代码开发、数理运算、追求低成本灵活部署就选DeepSeek。两者各有擅长的场景,没必要强行分高低。 现在国内模型在专业垂直领域持续突围,海外模型守住通用综合优势,这种差异化竞争反而能让整个行业进步更快,大家日常用模型更看重综合能力还是性价比呢?

5. #DeepSeek发布V4Pro正式版#DeepSeek V4 Pro正式版悄悄上线API,不用改调用接口直接升级。拥有100万上下文,最大输出384K token,处理长文档、大段代码很顺手,Agent智能体能力提升巨大。支持思考模式、工具调用,跑分已经摸到海外顶尖模型水平,价格相比海外竞品优势明显。适合做复杂分析、代码开发,就是并发上限不高,适合重度AI需求的开发者。能看得出来国内AI软件层面正在全力追赶海外,DeepSeek的进步确实很有冲击力

6. DeepSeek V4 Pro、Grok 4.6都来了:老金的观点说给你听

7. 实测完DeepSeek V4 Pro正式版,我发现下一条「斩杀线」可能藏在它的Agent里

8. #DeepSeekHarness发布#终于等到 DeepSeek 首款智能体产品 DeepSeek Harness 正式亮相了。前几日行业里就传出消息,团队新开了官方公众号,不少从业者都还在观望上线时间,没想到节奏紧凑,短短数日就正式推出,这个效率着实让人意外。纵观当下行业态势,2026 年算得上 Harness 工具框架助推 VibeCoding 走向商业化落地的关键年份。目前市场认可度最高的两款标杆产品,就是 OpenAI 的 Codex 以及 Anthropic 的 Claude Code,凭借成熟的代码编写、任务统筹能力,长期稳居 AI 代码智能体第一梯队,也是很多海外开发者日常编程的主力工具。不过在我个人看来,闭源产品终究有着难以规避的局限,适配国内开发环境总会存在隔阂。DeepSeek 此次推出的 v0.1 版本仅仅只是开端,官方并未追求一蹴而就做到完美,核心主打开源开放、模块化可复用的底层架构。愿意把基础设施敞开,邀请全球开发者共同打磨优化,一起挖掘 AI 编程的潜力。和海外封闭生态对比,开源模式更贴合国内开发者的使用习惯,方便大家结合本土开发场景调整优化。不再只局限于大模型参数比拼,转而深耕工程化工作流搭建,这样的发展思路,也会让 AI 代码赛道迎来更多新鲜变数。#热点跨界共创# #deepseekharness发布#

9. #DeepSeekV4Pro和Grok4.6谁更强#两款旗舰几乎同期更新,最近圈内全在拿它们横向对比。DeepSeek V4 Pro强项落在智能体、终端运维和工程代码,复杂落地任务很稳,性价比优势很突出。反观Grok4.6通识知识面更广,闲聊、发散创作手感更好。其实很难简单分出绝对强弱,要看你的使用场景。侧重开发干活优先选前者,日常泛场景体验后者会顺手一些。大模型赛道内卷越来越激烈,后续实测表现还得再多观望一阵子。 AI

10. #DeepSeek发布V4Pro正式版# 深夜悄无声息上线的DeepSeek V4Pro正式版,直接在AI圈炸锅,这次真不是小修小补,属于全方位质变升级!不用改一行代码,沿用原有API名称就能切换新版本,开发者迁移零成本,太省心。硬件规格直接拉满,100万超长上下文,一次性塞完整代码库、长篇合同毫无压力,最高还能输出384K内容,写完整项目方案、长篇文稿不用分段反复对话。最亮眼的是Agent代码能力暴涨近4倍,各类专业跑分直追海外顶尖闭源模型,推理、数学、全栈开发全部站稳第一梯队,还支持双模式切换,复杂难题开深度思考,简单需求快速响应。关键现阶段还是涨价前原价,缓存复用后调用成本极低,对比海外同级模型性价比直接碾压,不管是个人创作者还是开发团队都很友好。唯一小短板是并发上限偏低,大规模高频调用更适合搭配Flash版本混用。国产高端大模型又往前冲了一大步,这次能真正撼动海外头部模型的市场份额吗?

11. DeepSeek Harness 入选项目疑似曝光,不选万星「花瓶」,死磕 Agent 基建

12. DeepSeek V4 Pro和Grok 4.6同一天上线,这场“中美顶级模型正面碰撞”确实有点意思。如果只看单项能力,我觉得很难说谁碾压谁。DeepSeek V4 Pro更值得关注的,是推理、代码以及复杂任务上的综合能力;Grok 4.6则在通用能力、实时信息和生态体验上有自己的优势。所以我更倾向于认为:这不是谁“绝对更强”,而是谁在不同场景下更好用。真正值得看的,其实是DeepSeek和Grok背后的两条路线,接下来谁能把模型能力真正变成产品和用户体验,才是下半场的关键。#DeepSeekV4Pro和Grok4.6谁更强#AI

13. #DeepSeekV4Pro和Grok4.6谁更强#AI就差0.1分。DeepSeek V4 Pro在Terminal Bench 2.1拿87.9,第一的Claude Fable 5是88.0——测的是AI能不能真在电脑里干活,不是做题。8月12日深夜梁文锋把V4 Pro切正式版,同刻马斯克Grok 4.6也发了,前后脚盯同一件事:让AI在长任务稳定干活。Grok知识Elo榜1753登顶,写代码却输GPT-5.6;DeepSeek另一头DeepSWE从12.8飙到62.7,各擅一场。价格才是真刀:DeepSeek输出6元/百万token,Grok 2进6出,都加量不加价。谁更强没法一句答。但国内开发者DeepSeek更实在——双API兼容、人民币计价,代码几乎不改就能切。被夹的是OpenAI和Anthropic。你押谁?

14. #DeepSeek发布V4Pro正式版#深夜,DeepSeek 悄无声息地扔出了一枚重磅炸弹。昨晚,DeepSeek 官网 API 文档悄然上线了 V4 Pro 正式版(版本号 0813)。没有发布会,没有预告,就这么直接“转正”了。性能上,它真的在向国际顶尖闭源模型靠拢。 根据官方流出的评测对比,V4 Pro 正式版在多项测试中已接近 Anthropic Fable 5 的水平。更夸张的是 Agent 能力的跃升——Terminal Bench 2.1 跑到 87.9 分,Cybergym 83.3 分,DeepSWE 62.7 分,相比预览版简直是代际提升。1M 超长上下文加上 384K 的最大输出,处理整部小说或整个代码仓库都不在话下。价格方面,Pro 版是 Flash 的三倍——输入 3 元/百万 tokens,输出 6 元。但缓存命中后输入仅需 0.025 元,性价比依然惊人。作为对比,Claude Opus 4.8 跑一次任务的成本是 DeepSeek V4 Pro 的 44 倍。把接近 Fable 5 的性能,卖成白菜价。 这或许才是 DeepSeek 真正的“大招”。#DeepSeek发布V4Pro正式版##DeepSeek发布V4Pro正式版

15. AI斩杀线更新!DeepSeek V4 Pro正式版发布,马斯克成最大受害者

16. #DeepSeekHarness发布#刚看到DeepSeek Harness正式上线,简单说它不是新大模型,而是一套智能体编排框架 。公式Model+Harness=Agent算是把思路摆明白了,专门负责调度工具、管理长任务流程,补齐模型落地实操的短板。对开发人员格外友好,多智能体编排、项目运维全都能覆盖,打通了从生成代码到完整交付的闭环 。看得出DeepSeek不再只埋头做大模型,开始深耕上层智能生态了,很期待后续开发者社区能跑出有意思的应用。

17. #DeepSeekHarness发布#DeepSeek的Agent产品Harness终于来了,代号“黑鲸”。内部公式很直接:Model+Harness=Agent。模型负责思考推理,Harness包办模型外的所有工程脏活——工具调用、任务规划、执行调度。说白了,大模型是脑子,Harness是手和脚。脑子再好使,手脚不利索也白搭。Harness就死磕代码智能体这条赛道,直接对标OpenAI的Codex和Anthropic的Claude Code。更狠的是,Harness开发者预览版已经开源(MIT协议),还开放了npm插件生态。“一切皆插件”的设计,摆明了不想做第二个Codex,要做就做自己的玩法。模型能力决定上限,Harness决定这能力最终能兑现多少。DeepSeek这步棋,抢的是模型之外的工程入口。Codex和Claude Code的好日子,可能没那么安稳了。

18. #DeepSeek发布V4Pro正式版# 深夜放大招!DeepSeek V4 Pro 正式版(DeepSeek-V4-Pro-0813)今日上线,API和Chat端已同步更新,调用模型名不变。相比4月的预览版,这次正式版堪称「脱胎换骨」:· Agent 能力暴涨:DeepSWE 得分从12.8直接跳到62.7,翻了将近5倍;TerminalBench 2.1 冲到87.9,逼近 Fable 5· 超长上下文标配:1M Token 上下文 + 384K 最大输出,大型代码库、长文档处理一次搞定· 工具链更完善:支持 Responses API、Codex 接入,兼容 OpenAI / Anthropic 双格式· 价格仍是地板级:缓存命中输入0.025元/百万Token,同级模型里几乎找不到对手当然,Pro 版并发限制500(Flash 是2500),更适合复杂高价值任务。另外官方已预告近期会整体上调 API 定价,现在算是窗口期。国产大模型这波 Agent 赛道,你站 DeepSeek 还是 Fable 5?#DeepSeek##AI大模型##微博AI创作季#

19. #DeepSeek发布V4Pro正式版#DeepSeek又放大招了。8月12日晚,官网模型列表新增DeepSeek-V4-Pro-0813,支持思考与非思考模式、Tool Calls、Responses API,还能直接导入Codex使用。更关键的是,上下文窗口达到100万Token,最大输出38.4万Token,性能接近Anthropic Fable5,但价格仅为V4 Flash的3倍。AI模型的竞争,已经从“有没有”进入拼性能、拼生态、拼价格的阶段了。

20. Grok 4.6正式发布,多项基准测试逼近顶尖模型8月12日,SpaceXAI正式发布Grok 4.6。官方表示,新模型在Grok 4.5基础上进行了进一步升级,重点强化长时间运行的Agent任务,以及更复杂的交互式和视觉类工作。相比上一代,Grok 4.6更加注重处理需要多步骤持续执行的复杂任务,包括信息研究、数据分析、代码库开发,以及从一个产品创意直接构建出可运行的应用或工作成果。SpaceXAI表示,在较长任务链中,Grok 4.6还展现出更强的自我测试和验证能力,会在继续执行前主动检查工作结果。在性能方面,Grok 4.6在多项Agent编程和知识工作基准测试中达到前沿水平。其中,Artificial Analysis Intelligence Index综合九项基准测试,Grok 4.6获得61分,与GPT-5.6 Sol持平;在GDPVal-AA v2、CursorBench v3.2、DeepSWE v1.1、FrontierCode v1.1等测试中,也展现出较强竞争力。不过,在部分编码测试中,Grok 4.6仍落后于GPT-5.6 Sol或其他顶尖模型。训练方面,Grok 4.6进行了比Grok 4.5更长的补充训练,加入模型生成的推理和高级技术数据、高质量工程数据,并改进优化器和训练方案。随后,SpaceXAI利用Grok 4.5重新生成不同推理强度、Agent框架以及STEM、软件工程和知识工作领域的SFT训练轨迹,并进一步进行筛选和强化学习训练。值得关注的是,Grok 4.6此次明显强化了“从想法到产品”的能力。SpaceXAI表示,用户给出一个较为宽泛的产品创意后,模型可以自行研究陌生领域、规划应用结构、实现核心交互,并根据反馈持续迭代。对于视觉和交互式项目,其首轮生成效果也较Grok 4.5明显提升。目前,Grok 4.6已经登陆Cursor、Grok Build,同时开放API,并支持OpenRouter、Vercel和Cloudflare等合作平台。API价格从每百万输入Token 2美元、每百万输出Token 6美元起,快速版本价格为其两倍。SpaceXAI还宣布,Grok Build和Cursor首周提供两倍的包含用量。从此次升级来看,Grok 4.6并非单纯追求聊天和推理能力,而是进一步把重点放在“长任务Agent”和“直接完成工作”上。随着AI竞争从模型能力逐渐转向实际执行能力,Grok 4.6能否凭借更强的持续工作能力,在Agent赛道进一步追赶OpenAI、Anthropic等竞争对手,值得持续关注。

21. 首发体验 | DeepSeek Harness 来了,它不想做下一个Codex

22. #DeepSeekHarness发布#DeepSeek正式推出自家首款Agent产品Harness,看得出来这次不想简单复刻Codex那套路子。 它不只是单纯写代码的工具,项目管理、长任务处理、多个Agent协同编排都支持,还能联网搜索、加载各类Skill。比较有意思是Agent预设这套设计,可以根据任务切换不同工作模式,简单任务用极简模式,复杂开发就切代码、创造模式,甚至允许我们自己定制专属Agent。 最大亮点是深度插件化,不局限于加小功能,界面、记忆、策略逻辑都可以靠插件改动,自由度很高。同时还兼容市面上几十家大模型,不一定非要绑定自家模型来用。 当然也要客观看待,Agent产品现在都处在早期阶段。功能看着很丰满,但实际长任务稳定性、插件生态能不能发展起来,还得看后续实测表现。现在很多Agent工具,纸面参数很强,真跑复杂任务很容易跑偏。 对开发者来说这是个好信号,不再局限模型本身内卷,开始往上层Agent工作台发力。不过普通用户短期内感知不会太强,更多还是面向开发人群。 大家觉得,这类Agent工作台,接下来会真正落地解决实际工作痛点,还是又停留在概念热闹阶段?#让DeepSeek给小说取架空国名##DeepSeek调价方案#

23. 【速报】「Codex 秘技」导致 Claude 解约者激增,简直太危险了!!网页链接通过「Codex 秘技」,将 DeepSeek V4-Flash 等廉价模型作为 Codex 的子代理,以爆炸性速度运行,大幅削减成本・只需安装设置工具『codex-router』,即可完成「3分钟」超简单设置 ・通过主/子模型切换或多重并行使用,将 AI 开发费用最小化 ・无需高额订阅!立即构建低成本&高性能环境网页链接

24. #DeepSeek发布V4Pro正式版#这次V4Pro正式版升级真的诚意满满,重点强化Agent智能体能力,原生适配Responses API和Codex,写代码、自动调用工具完成复杂任务表现远超不少开源模型。数学推导、全栈开发、长文档分析全场景无短板,极限推理模式下逻辑严谨度比肩顶级闭源大模型

25. DeepSeek首款Agent产品,正式亮相!今天DeepSeek发布了DeepSeek Harness。通俗理解,像给大模型配了一个"全能助理"——AI负责思考推理,Harness负责所有工程化落地,比如工具调用、任务规划、执行调度、联网搜索、多Agent协作等。这次Harness重点聚焦"代码智能体"赛道,直接对标OpenAI Codex和Anthropic Claude Code,能帮开发者自动完成代码编写、项目管理、长任务协作等复杂工作。Harness,让AI不仅会想,更能真正"动手"干活。#DeepSeekHarness发布#

26. DeepSeek V4 Pro正式版来了,跑分上很厉害,但是远不如V4 Flash 正式版影响力大。DeepSeek的自带Agent工作台应该在内测了,结合自家模型,如果能达到甚至超过Codex和Claude的体验,这才是新的DeepSeek时刻。

27. #DeepSeek发布V4Pro正式版#昨晚 V4 Pro 正式版上线,跑分直接贴脸 Anthropic Fable5。 以前用模型总得纠结:选便宜的怕它笨,选贵的怕它慢?现在 DeepSeek 直接把“思考模式”做成了开关。写日常邮件关掉思考秒回,搞代码调试开启思考慢慢磨。这种双模式切换,太懂打工人的痛点了。 而且这次价格依然没飘,只是 Flash 版的 3 倍,缓存命中时更是低到忽略不计。在国产模型集体爆发的当下,我们不再需要仰视海外闭源巨头。它们不仅在性能上互有胜负,更在用极致的性价比和开源生态,把 AI 从“奢侈品”变成人人可用的“水电煤”。这才是真正的技术自信:不靠营销吹牛,只靠实力说话。🇨🇳 你平时用 AI 更多是处理简单任务,还是复杂推理?

28. 2026年7月中文大模型基准测评结果发布!Qwen3.8、Kimi-K3并列第一,DeepSeek轻量版并列第二

29. 【#开发者实测DeepSeekV4Pro和Grok4.6#】#开发者晒DeepSeekV4Pro真实评价# “梁圣”梁文锋和马斯克,盯上了同一座高地。数小时前,AI行业上演极具戏剧性的一幕:DeepSeek悄然发布V4 Pro正式版,几乎同一窗口,SpaceXAI火速放出Grok 4.6旗舰模型。没有提前串通,分属中美两大阵营的两款顶级模型,不约而同完成重磅迭代。有开发者在同一代码项目上同时调用两款模型:DeepSeek V4 Pro成本低廉,但耗时实在太久,闷头跑二三十分钟命令,完全不知是否卡住了以及还需多久。相比之下,Grok4.6速度很快,输出结果稳定性更好,但单次任务成本更高。(@搜狐科技 )#DeepSeekV4Pro价格暂未上调# 梁文锋、马斯克同日双发:当顶级模型性能价格双杀,谁先被推进斩杀区

30. #DeepSeek发布V4Pro正式版#DeepSeek-V4-Pro正式版现已上线,可通过API接入使用。费用- 百万tokens输入(缓存命中):0.025元- 百万tokens输入(缓存未命中):3元- 百万tokens输出:6元-增强了Agent能力-支持Responses API和Codex接入-1.6万亿总参数-上下文窗口达到100万Token-最大输出38.4万Token

31. DeepSeek-V4-Pro 正式上线,APP、网页端和 API 已经同步更新。这次重点明显放在 Agent 和编程上:1M 上下文,原生支持 Responses API,可以直接适配 Codex,思考强度也增加 low、high、max 三档。更有意思的是,8 月 17 日起 API 开始搞“峰谷电价”,闲时直接半价。以后跑 AI Agent,兄弟们半夜定闹钟吧 #DeepSeek调价方案#

32. 今天,DeepSeek 正式发布了旗下第一款 Agent 产品,名字叫 DeepSeek Harness。这件事其实早有预兆。七月底 V4 Flash 发布正式版时,更新日志里就写过一句不太起眼的话,说公开的代码智能体基准测试,用的是某个即将发布的框架,那个框架正是 Harness 的极简模式。半个月不到,它就正式亮相了,代码在 GitHub 开源,装好 Node.js 后跑一条 npx @deepseek-ai/dsh web,就能在本地浏览器里打开它的界面。圈子里习惯叫它 dsh。按 DeepSeek 自己的说法,Harness 要承担的,是模型以外所有工程化的活儿。这句话值得拆开看。大模型负责的是思考和推理,它知道代码该怎么改、任务该怎么排,可这些想法要变成真实的结果,中间还隔着文件系统、终端、网页、代码工具这些真实环境。Harness 干的,就是把模型接进这些环境,再把工具调用、任务规划、执行调度、上下文管理这些杂活一件件接过来。DeepSeek 内部有一个很简明的公式:Model 加 Harness 等于 Agent。大模型负责想,剩下的交给 Harness 干。从能力清单看,Harness 覆盖得相当完整。项目管理、长任务协作、多 Agent 编排、上下文管理、联网搜索,还有 Skill 机制,一个能长期干活儿的 Agent 该有的,基本都齐了。所谓多 Agent 编排,就是一个主 Agent 把任务拆给好几个子 Agent,比如让一个去搜项目和资料,一个去改代码,一个去跑测试,最后由主 Agent 汇总结果、决定下一步。配套的还有计划、目标、待办事项和后台任务这些机制,目的就是让 Agent 跳出问一句答一句的模式,能连续完成一整串彼此关联的操作。设计上最有意思的一点,是“一切皆插件”。Harness 把文件系统、终端、子进程、网页访问、技能、子智能体、工作流、会话持久化这些能力各自打包,再用一份 cordis.yml 配置文件把它们组装起来。同一套代码,既能组装成只有两三个工具的极简 Agent,也能变成能编排子 Agent 的标准模式,甚至进一步改装成能自己改自己的创造模式。这种框架思维背后是一个很清醒的判断:Harness 想做的,是一个能让不同部署方自己动手的底座,换模型、换存储、换安全策略、加工具,甚至换掉整个智能体循环,都留给你决定。产品定位上,Harness 从一开始就压准了代码智能体这条赛道,直接对标 OpenAI 的 Codex 和 Anthropic 的 Claude Code。这个选择并不难理解。软件研发是目前 AI 场景里刚需最强、标准化程度最高、落地效果也最直观的一块,海外 Claude Code 和 Codex 已经验证了这条路走得通,而国内一直缺一个成熟稳定的生产级代码智能体底座。DeepSeek 手里恰好有 V4 系列模型这张牌,模型负责推理,Harness 负责执行,两下一凑,就成了一整套完整的闭环。背景信息也很有意思。DeepSeek 五月份就在内部组建了专门的 Harness 团队,负责人崔添翼曾在量化机构 Jane Street 工作九年,是做高频交易系统出身。把这种系统工程背景的人放到智能体项目上,已经说明 DeepSeek 的判断:Agent 要真正落地,系统工程能力才是关键,把模型稳稳当当接进真实环境、让异常有兜底、让过程可追溯,这些才是硬功夫。同一天,DeepSeek 还发布了 V4 Pro 正式版,Agent 能力大幅跃升,DeepSWE 从 12.8 跳到 62.7,API 同时兼容 OpenAI 和 Anthropic 两套格式。原本跑在 Claude Code 或 Codex 上的工作流,改一下 base_url 和 api_key 就能直接接进来测试,而这份亮眼的基准成绩,正是用 Harness 极简模式跑出来的。落到更大的层面看,Harness 的发布,标志着 DeepSeek 开始从单纯卖模型,往提供一整套能干活的工作流方向走。Model 加 Harness 等于 Agent,这个公式正在成为行业的共识,当模型能力的差距被逐渐抹平,决定一个 Agent 上限的,往往就是它背后那套工程系统。Harness 能不能撑起国内第一款工业化代码智能体底座,接下来的快速迭代会给出答案。#DeepSeekHarness发布##科技先锋官##How I AI#

33. #DeepSeek发布V4Pro正式版#还得是DeepSeek 官网的“API文档”的“模型&价格”页面上线V4‑Pro‑0813正式版本,它的最大亮点就是可以自由切换思考、非思考两种模式。简单问答、内容摘要直接关掉思考模式,追求低延迟快速出结果;做代码调试、复杂逻辑推演的时候,再开启思考模式提升推理准确率。对于做Agent、复杂文档处理的开发者来说,这个切换能力非常实用,不用换模型就能适配不同业务场景。

34. 单从性能方面来看的话:Pro是1.6万亿参数旗舰,100万超大上下文,最多一口气输出38.4万token,跑分直接对标海外顶流Anthropic Fable5,属于第一梯队硬核模型。Flash主打性价比快响应,Pro专攻超长文档、复杂智能体、大型代码仓库开发。简单说:写短文案、日常批量任务选Flash;做项目开发、整份财报/代码库分析,可以上Pro。#DeepSeek发布V4Pro正式版#

35. 【#中美大模型价差正在收窄#】#DeepSeekV4Pro与Grok4.6对比#8月12日,DeepSeek与马斯克旗下SpaceXAI同日发布新模型DeepSeek-V4-Pro和Grok 4.6,新一轮大模型竞争再次升温。从最新评测来看,两款模型均进一步逼近全球头部水平。其中,DeepSeek-V4-Pro在多项智能体相关测试中超过Anthropic的Claude Opus 4.8;Grok 4.6则在Artificial Analysis智能指数中追平OpenAI旗舰模型GPT-5.6 Sol。能力差距缩小的同时,中美大模型之间悬殊的价格差距也在发生变化。摩根士丹利最新研报显示,中国大模型API平均价格过去一年明显上涨,而美国闭源模型价格近期持续下降,中美大模型价格差距正在收窄。摩根士丹利指出,中国大模型市场的竞争重点正在从“价格战”转向“智力战”。(每经)

36. #DeepSeekHarness发布#这次DeepSeek Harness的上线,标志品牌不再只专注大模型研发,正式布局智能体工程基础设施。产品采用“一切皆插件”设计思路,内测阶段开发者就产出数百款自定义插件,支持多Agent协同编排、联网检索、自定义Skill拓展,适配编程开发、项目管理等复杂长周期任务,本地工作台模式兼顾隐私与灵活拓展能力,对比同类Codex类产品拥有更强自定义空间。

37. #DeepSeekV4Pro正式版# DeepSeek 悄悄将 V4-Pro 预览版升级为 DeepSeek-V4-Pro-0813,这次没有提前预热,也没有正式发布会,直接上线新版本继续支持 100 万 Token 上下文,最高输出 38.4 万 Token,同时重点强化了 Agent、编程和复杂任务能力。部分测试成绩已经逼近顶级闭源模型目前来看,这次更像是一次“静默升级”,但实际提升幅度并不小。DeepSeek V4 Pro 正式版,终于来了

38. 【#零态洞察百态##DeepSeek发布V4Pro正式版#】今天(12 日)晚间,DeepSeek 官网“API 文档”上的“模型 & 价格”页面中,模型版本新增了DeepSeek-V4-Pro-0813。其支持非思考与思考模式、Tool Calls、Responses API,并可直接导入Codex使用;上下文窗口高达100万token,最大输出长度达38.4万token。性能表现优异,跑分接近Anthropic Fable5,价格仅为V4 Flash的3倍。(IT之家) #DeepSeekV4Pro正式版上线#

39. #DeepSeek发布V4Pro正式版#DeepSeek V4Pro正式版悄悄发布,开发者现已可以通过API接入使用。百万级上下文窗口、最高38.4万token输出,重点强化Agent相关能力,同时兼容多家主流接口,对开发者迁移适配很友好。不少硬核评测榜单上它表现抢眼,部分项目超越竞品站上开源模型首位,复杂编程任务的能力也有不小提升,综合水平向顶尖闭源模型靠拢。但成本相比Flash高出三倍,并发额度也做了压缩,主打重度推理场景。跑分数据看着很亮眼,不过高价与有限并发,并不适合普通轻量调用。真实业务场景下稳不稳定,还得靠开发者实际测试才能见分晓。#热点跨界共创# #DeepSeek发布V4Pro正式版#

40. #DeepSeek发布V4Pro正式版#深夜上线的V4 Pro正式版真的有点惊喜,这次重点强化Agent智能体能力,多项硬核评测直接冲到第一梯队水平。 百万级超大上下文,搭配超高输出上限,处理整本文档、大型代码库这类复杂任务更加顺手,思考模式可自由切换,开发者友好度拉满。 对比Flash版本,Pro版主打深度复杂任务,不是追求极致速度,而是拼推理、工具调用的落地实力。国产大模型卷到这个程度,能明显感受到硬核能力的实实在在进步,已经很好奇实际上手体验了。

41. 【#DeepSeek官宣V4Pro正式版上线#】今天,我们发布 DeepSeek V4 Pro 正式版。当前,DeepSeek V4 Pro 正式版已同步在 APP、网页端和 API 更新上线。用户可以通过 APP 或网页端选择“专家模式”使用全新的 V4 Pro 正式版模型, API 模型名不变,其他更新细节详见 DeepSeek API 官方接口文档。 API 支持原生支持 Responses APIDeepSeek API 现已原生支持 OpenAI Responses API 格式,并针对性适配 Codex。用户可以参考官方 API 文档:快速开始-接入 Agent 工具-Codex,通过一键配置脚本完成 Codex 的配置。更灵活的思考强度控制V4-Pro 和 V4-Flash 思考模式现支持 low / high / max 三档思考强度,用户在实际使用中可以根据任务复杂度灵活选择:简单任务使用 low,日常 Agent 任务使用 high,高度复杂的任务场景使用 max。设置方法请参考官方 API 文档:API 指南-思考模式。API 定价调整随着 DeepSeek V4 全系列模型正式版上线,我们将对 API 价格进行更新调整。为了更加合理地调配资源,我们将采用峰谷定价,闲时价格为高峰时段价格的一半,鼓励用户根据实际使用情况调整任务时间。新价格将于北京时间 2026 年 8 月 17 日 0 时开始生效。

42. 评论区有人问:Codex 用的是什么模型?还有人说换了 DeepSeek 感觉更亮。还有人直接 让它总结视频内容。 今天直接给你做一个对比,三个工具,三种场景。 Codex,底层是 GPT 系列。优势是代码能力强,能直接在沙箱里运行和调试。缺点是 5.6 版本确实有点"倔",你不把约束写清楚,它会按自己的理解硬来。适合有明确目标、需要写代码做项目的场景。 DeepSeek,推理能力不错,价格便宜。但评论区有个吐槽很准:它有时候会"妄自揣度你的想法,然后擅自修改",错了先道歉,再把错误路径重来一遍。适合需要长文本分析、逻辑推演的场景,不太适合需要严格遵循指令的编程任务。 豆包,对中文语境理解最好,响应速度快。但如果你让它做复杂的代码工程,它可能会给你看起来对但实际跑不通的方案。适合快速问答、内容总结、中文创作。 我的建议:编程选 Codex,分析选 DeepSeek,日常中文交互选豆包。 没有最好的模型,只有最对的场景。

43. 国产AI大模型实测横屏,DeepSeek、豆包、Kimi谁最强

44. Kimi K3 定价是 Qwen3.8-Max 的近 3 倍!三款国产大模型实测对比,谁才是真「性价比之王」?

45. 国产卷王来了!DeepSeek V4 Pro+Flash vs 御三家真实横评|代码/推理/成本全维度

46. 国产 AI 编程工具到底怎么选?Codex、Kimi Code、GLM 横评,公司采购踩坑实录

47. DeepSeek V4接入Codex,0.24元跑完3个真实任务!从0到1开发AI数据分析系统,国产大模型开启Agent编程新时代,完整实战流程公开

48. 手把手把 OpenAI Codex 接上 DeepSeek,成本几乎归零(保姆级教程)

49. Codex 保姆级教程DeepSeek+视觉Skill+实战

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章