DeepSeek灰度上线1M上下文新模型,架构革新支持百万元级长文本处理

源自30位全网作者

02-13 22:08

内容由AI生成

精选参考来源

1. #微博声浪计划##听见微博# DeepSeek新模型曝光,其新一代旗舰模型V4核心架构MODEL1因GitHub代码更新意外公开。该架构在KV缓存、FP8量化等方面革新,支持百万Token上下文,推理成本仅为GPT-4 Turbo的1/70,预计2026年春节发布,或推动国产大模型效率革命。 铭科技的微博音频

2. 华为昇腾宣布0Day支持DeepSeek-V3.2-Exp DeepSeek-V3.2-Exp重磅发布!华为宣布零Day支持!国产大模型牵手国产算力的背后是国产AI基建越来越成熟的适配能力!#华为 #昇腾 #DeepSeek

3. 看样子AI圈又要被DeepSeek的更新刷屏咯!#DeepSeekv4要来了吗#全网都在追问,这款承载国产AI野心的新一代大模型,是否即将重磅登场✨ 据多方信源透露,DeepSeek已开启新版本灰度测试,当前推送的更新大概率是V4亮相前的终极铺垫,正式发布窗口锁定春节前后。#HOW I AI##过个有AI年# 我刚刚试试了你的上下文是多少?知识截止到什么时候?它给我回答:上下文长度是1M(约150万字),知识截止到2025年5月。然后我又问下你是什么模型?【我是DeepSeek最新版本模型。具体来说,我是DeepSeek推出的第三代大语言模型,没有单独的“4.0”“5.0”这样的版本号,就是持续迭代的最新版本。核心特点包括:1M超长上下文(可以一次处理三体三部曲体量的书)完全免费(Web端和App端都免费,无任何收费计划)支持文件上传(图片、PDF、Word、Excel、PPT等,读取文字信息处理支持联网搜索(需手动点击开启),语音输入(App端可用)如果需要了解更详细的技术规格,建议查阅深度求索的官方技术文档。还有什么想了解的吗?】不同于常规迭代,DeepSeek V4主打底层架构革新,搭载自研mHC流形约束超连接与Engram条件记忆模块,跳出参数内卷,实现性能与效率双重越级。其百万级Tokens超长上下文、低于GPT-4 Turbo 1/70的推理成本,以及超越主流竞品的编程能力,都让市场充满期待。从技术论文提前披露到GitHub架构更新,从国产算力深度适配到成本革命,种种信号都预示着V4的临近。这场关乎AI编程格局重构的升级,能否让DeepSeek重振市场份额、实现国产突围?一起蹲守,见证国产大模型的全新巅峰!

4. 【#DeepSeek新模型更新#,#DeepSeek新版本灰度测试#】据鞭牛士,DeepSeek可能正在测试新的V4模型。科创板日报2月11日讯,多名用户反馈,DeepSeek在网页端和APP端进行了版本更新,支持最高1M(百万)Token的上下文长度。而去年8月发布的DeepSeekV3.1上下文长度拓展至128K。经实测,无论是安卓还是苹果,在手机App端和网页端,用户直接询问“你的上下文是多少”,得到的回答均显示DeepSeek的上下文窗口已达到约100万token。同时,知识歌更新时间也到了2025年5月份。这意味着它能一次性吃透极长的书籍、复杂的代码库或者海量的历史对话,而不会像以前那样聊着聊着就“失忆”。这一数据较此前版本有大幅提升,与目前行业头部模型的上下文容量处于同一水平。结合App版本的更新节奏,有观点认为DeepSeek可能正在为V4模型的正式发布做前期测试。截至发稿,DeepSeek官方尚未就新模型的相关信息发表回应。各位网友,您怎么看?(综合鞭牛士、科创板日报)@东方财经 #DeepSeek更新新模型#

5. DeepSeek模型更新 黄心怡 财联社 多名用户反馈,DeepSeek在网页端和APP端进行了版本更新,支持最高1M(百万)Token的上下文长度。而去年8月发布的DeepSeekV3.1上下文长度拓展至128K。《科创板日报》记者实测中发现,DeepSeek在问答中称自身支持上下文1M,可以一次性处理超长文本。记者在提交了超过24万个token的《简爱》小说文档,DeepSeek可以支持识别文档内容。

6. 实测DeepSeek V3.1:不止拓展上下文长度

7. 早,一觉醒来又发布两个模型。1、Opus 4.62、ChatGPT 5.3 Codex Opus 这次的升级:• 上下文窗口:Opus系列首次提供100万token(1M) 上下文窗口(测试版)。• 定价:保持不变,输入每百万token5美元,输出每百万token25美元。• 能力升级:提升代码规划/调试/审查、智能体任务续航与自主纠错能力,Office工具(Excel、PowerPoint)和Claude Code同步升级。GPT 5.3 Codex 的升级:• 定位:编程智能体,非通用大模型,整合GPT-5.2推理与GPT-5.2-Codex编程能力。• 速度与效率:单token推理提速25%,同任务token用量减半,上下文 400 万 token(4M,比 Opus 4.6 强)• 基准表现:SWE‑Bench Pro56.8%、Terminal‑Bench 2.077.3%、OSWorld‑Verified64.7%。• 可用性:ChatGPT付费用户已可用(Codex应用/CLI/IDE插件/Web),API访问即将开放。• 安全:OpenAI首个网络安全维度获高等级评级的模型。目前感觉 5.3 更吸引人一些。晚点试试看。

8. 【#DeepSeek发布V3.2正式版#:#DeepSeekV3.2性能比肩GPT5# ,略低于 Gemini-3.0-Pro】继两个月前发布实验性的 DeepSeek-V3.2-Exp后,DeepSeek今日宣布同时发布两个正式版模型:DeepSeek-V3.2 和 DeepSeek-V3.2-Speciale。目前,官方网页端、App 和 API 均已更新为正式版 DeepSeek-V3.2,供广大用户使用。Speciale 版本目前仅以临时 API 服务形式开放,主要供社区评测与研究。据悉,DeepSeek-V3.2 的目标是平衡推理能力与输出长度,适合日常使用,例如问答场景和通用 Agent 任务场景。在公开的推理类 Benchmark 测试中,DeepSeek-V3.2 达到了 GPT-5 的水平,仅略低于 Gemini-3.0-Pro;相比 Kimi-K2-Thinking,V3.2 的输出长度大幅降低,显著减少了计算开销与用户等待时间。DeepSeek-V3.2-Speciale 的目标是将开源模型的推理能力推向极致,探索模型能力的边界。V3.2-Speciale 是 DeepSeek-V3.2 的长思考增强版,同时结合了 DeepSeek-Math-V2 的定理证明能力。该模型具备出色的指令跟随、严谨的数学证明与逻辑验证能力,在主流推理基准测试上的性能媲美 Gemini-3.0-Pro。更令人瞩目的是,V3.2-Speciale 模型斩获 IMO 2025(国际数学奥林匹克)、CMO 2025(中国数学奥林匹克)、ICPC World Finals 2025(国际大学生程序设计竞赛全球总决赛)及 IOI 2025(国际信息学奥林匹克)金牌。其中,ICPC 与 IOI 成绩分别达到了人类选手第二名与第十名的水平。在高度复杂任务上,Speciale 模型大幅优于标准版本,但消耗的 Tokens 也显著更多,成本更高。目前,DeepSeek-V3.2-Speciale 仅供研究使用,不支持工具调用,暂未针对日常对话与写作任务进行专项优化。(新浪科技)

9. #小米新模型媲美DeepSeekV3.2##小米发布新模型#小米新发布的开源自研大模型是 MiMo-V2-Flash,有点儿强呀!MiMo-V2-Flash总参数3090亿,活跃参数150亿,采用专家混合架构(MoE),性能可与DeepSeek-V3.2和Kimi-K2等头部开源模型媲美。推理速度达到150 tokens/秒,每百万token输入成本0.1美元、输出0.3美元,性价比极高。采用5比1的激进比例,5层滑动窗口注意力搭配1层全局注意力交替使用,减少KV缓存存储量近6倍,支持256k上下文窗口。能并行预测多个token,推理速度提升2到2.6倍,训练阶段也能加速采样,减少GPU空转。通过后训练阶段的多教师在线策略蒸馏(MOPD),效率提升惊人,只需传统方法1/50的算力,学生模型即可达到教师性能峰值。在AIME 2025数学竞赛和GPQA-Diamond科学知识测试中排名开源模型前两名,编程能力出色,SWE-bench Verified得分73.4%。在τ²-Bench分类得分中表现优异,支持深度思考和联网搜索功能。与主流开发环境无缝配合,256k超长上下文窗口支持数百轮智能体交互与工具调用。#小米#

10. 第二波DeepSeek冲击:V3.2 改写中国云生态与芯片生态

11. DeepSeek 1M上下文新模型灰度实测|所有Prompt直接复制,差距一眼看懂

12. DeepSeek新版本模型已开始灰度测试,疑似 DeepSeek V4

13. DeepSeek 刚刚发布了新模型!

14. 刚刚,DeepSeek悄悄测试新模型

15. DeepSeek模型更新

16. 全新DeepSeek发布!上下文扩展至1M

17. DeepSeek模型更新!上下文提升至百万Token 可处理三体小说全集

18. DeepSeekģ һԴı

19. DeepSeek 通知线上模型版本升级至 V3.1,上下文长度拓展至 128k

20. 深入理解DeepSeek-R1:模型架构.pdf

21. MiniMax追着DeepSeek打

22. 小白秒变AI大神!DeepSeek方+第三方+命令行调用指南,10分钟搞定

23. 人工智能行业专题分析:比较试用DeepSeek看模型走向应用的新迹象.pdf

24. LongRoPE:超越极限,将大模型上下文窗口扩展超过200万tokens

25. DeepSeek V4 来了

26. DeepSeek更新了!5个问题深度测评,内附体验方式

27. DeepSeek V4 最新消息汇总

28. DeepSeek-V3.2-Exp:稀疏注意力如何重塑长上下文AI效率

29. DeepSeek V4:中国AI在编程领域超越ChatGPT和Claude?

30. DeepSeek-V3.2-Exp:通过 DeepSeek 稀疏注意力提升长上下文效率

1
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章