长文本能力≠读懂长文本:这5类场景才真需要百万上下文,选错模型反被拖累

源自164位全网作者

05-22 10:04

内容由AI生成

精选参考来源

1. Google 发布 Gemini3.1Pro 模型,它在技术上有哪些亮点和突破?

2. 抖音前沿科技30X30|采访AI超级个体 Gemini 3发布后,这5个开发者给自己的人生装上了外挂。 27年程序员老兵:用AI写出多部长篇小说,一边敲代码一边圆武侠梦 ; 硬核奶爸:手搓本地AI操作系统,把私教装进孩子口袋; AI安全研究员:把AI变成科研副驾,打破思维墙; 有效加速主义者:打造AI全自动分身,让AI替自己看新闻处理琐事; 全栈讲师:降低新手学习门槛,把技术文档自动变成PPT; 本期视频,产品君连线5位GDE谷歌开发者专家,带你拆解AI时代的超级个体,听听他们给普通人的真诚建议。 #前沿科技趋势发布月 #抖音知识年终大赏 #AI新星计划 #AI #Google

3. 姚顺雨在腾讯首个研究:在“上下文”这事上,在座的各位都不及格

4. 如何评价 Anthropic 最新发布的 Claude Opus 4.6?有哪些技术亮点值得关注?

5. Gemini 3.5 Flash 上线,全面跑赢 3.1 Pro,性价比最佳!谷歌还做了自己的 Claude Code

6. 刚刚,让谷歌翻身的Gemini 3,上线Flash版

7. #DeepSeekV4要来了吗#DeepSeek V4开启灰度测试,百万Token超长上下文与2025年5月的知识截止日期,让这款国产大模型成为春节档AI圈焦点。从技术来看,V4摒弃参数内卷,依托创新架构实现算力效率跃升,推理成本大幅降低,还深度适配国产芯片,让超长文本处理、代码跨文件分析成为现实,精准契合2026年大模型向高效实用演进的行业趋势。此前DeepSeek凭技术优势收获颇高热度,此次V4的升级,不仅补上了长上下文能力的短板,更让国产大模型在全球竞争中再添筹码。随着灰度测试推进,全量更新或很快落地,其兼具技术突破与国产化适配的双重优势,不仅能复现过往热度,更有望在AI普惠落地中,为国产大模型开辟新的增长空间。#DeepSeekv4要来了吗##HOW I AI##过个有AI年# deepseekv4要来了吗 川北小哥的微博视频

8. 刚刚,腾讯姚顺雨署名首篇论文发布,「下半场」先搞上下文学习

9. #DeepSeekV4和GPT6谁更值得期待#GPT-6大概率4月14号就来,DeepSeek V4也箭在弦上最快月内有消息。两边几乎同时亮剑,这波中美大模型的较量正式进入白热化阶段。GPT-6这次据说是奔着AGI去的全新架构,代号“土豆”,性能号称暴涨40%,200万token上下文加上原生多模态,看起来就是冲着“全能旗舰”去的。而DeepSeek V4走的是另一条路——它跟华为昇腾芯片深度绑定,从CUDA迁移到国产架构,极致性价比+百万上下文多模态,明显是想用工程能力打破算力封锁。一个秀天花板,一个卷供应链和成本。不管怎么选,这波最大赢家都是用户。

10. Google 放大招!Gemini 3.1 Pro 正式发布,推理能力翻倍!免费使用方法来了 | 零度解说

11. 多名用户反馈,DeepSeek在网页端和APP端进行了版本更新,支持最高1M(百万)Token的上下文长度。而去年8月发布的DeepSeekV3.1上下文长度拓展至128K。记者实测中发现,DeepSeek在问答中称自身支持上下文1M,可以一次性处理超长文本。(科创板日报)

12. 谷歌发布 Gemini 3 Flash,相比上一代 2.5 Flash 有哪些提升?使用体验如何?

13. #DeepSeekV4发布# ---## 🏆 DeepSeek V4 vs 业界主流模型横向对比(2026年4月)### 📊 一、核心 Benchmark 成绩对比| 评测维度 | DeepSeek V4-Pro | Claude Opus 4.7 | GPT-5.5 | 说明 ||----------|:-:|:-:|:-:|------|| **MMLU**(多学科综合) | 90.1% | ~90%+ | ~92%+ | 旗鼓相当 || **GPQA Diamond**(研究生科学) | 90.1% | ~88% | ~89% | V4 略优 || **LiveCodeBench**(动态代码) | **93.5%** 🥇 | ~88% | ~85% | **V4 领先** || **Codeforces Rating**(竞技编程) | **3206** 🥇 | 未公开 | 未公开 | **开源最高** || **SWE-Bench Verified**(工程代码) | 80.6% | **87.6%** 🥇 | ~75-80% | Claude 领先 || **AIME 2026**(数学竞赛) | **99.4%** 🥇 | ~95% | ~96% | **V4 接近满分** || **IMO Answer Bench**(奥数) | 88.4% | 未公开 | 未公开 | 极强 || **FrontierMath Tier 4**(前沿数学) | 23.5% | 约2% | 约2.1% | **V4 领先约11倍** || **C-Eval**(中文综合) | **93.1%** 🥇 | — | — | 明显优势 || **上下文窗口** | **1M token** 🥇 | ~200K | ~128-400K | **V4 最长** |---### 💰 二、价格对比(每百万 token)| 模型 | 输入价格 | 输出价格 | 相对 V4 倍数 ||------|:-------:|:-------:|:----------:|| **DeepSeek V4-Pro** | ~¥4 | **$3.48** | 1× 基准 || GPT-5.5 | — | ~$70+ | **约 20× 贵** || Claude Opus 4.7 | — | ~$35 | **约 7× 贵** || GPT-5.4 | — | ~$15 | **约 4.3× 贵** || Claude Opus 4.6 | — | ~$25 | **约 7.2× 贵** |---### 🎯 三、能力雷达:各模型擅长领域| 模型 | 最强项 | 相对弱项 ||------|--------|----------|| **DeepSeek V4-Pro** | 数学推理、竞技编程、超长上下文、成本 | 视频/音频多模态、创意写作 || **Claude Opus 4.7** | 工程代码(SWE-bench第一)、自我纠错、金融代码 | 价格昂贵、无开源 || **GPT-5.5** | 综合生态、全模态(音视频)、工具链 | 价格最贵、上下文较短 || **Gemini 3.1 Pro** | 超长上下文、Google生态集成 | 中文能力、推理模型待追赶 |---### 🔑 四、一句话总结| 场景 | 推荐 ||------|------|| 🧮 数学/科研推理 | **DeepSeek V4-Pro**(AIME 99.4%,FrontierMath 领先11倍)|| 💻 工程级代码修复 | **Claude Opus 4.7**(SWE-bench 87.6% 全球第一)|| 🎥 多模态(音视频) | **GPT-5.5**(原生支持音频/视频) || 📄 超长文档处理 | **DeepSeek V4**(1M 上下文,成本极低)|| 💸 性价比极致 | **DeepSeek V4-Flash**(约是 GPT-5.5 的 1/20 价格)|| 🇨🇳 中文任务 | **DeepSeek V4-Pro**(C-Eval 93.1%)|---**总体来看**:DeepSeek V4 在**数学推理和竞技编程**上已是全球最强,工程代码略输 Claude Opus,综合生态和多模态暂落后 GPT-5.5——但以约 **1/20 的价格**打出这个成绩,性价比无出其右。对于开发者来说,它是目前最值得优先考虑的开源选择。

14. 终于来了!DeepSeek-V4 正式发布!免费开源,百万上下文,Agent能力直逼Claude!| 零度解说

15. 神秘霸榜模型现真身:小米MiMo-V2 Pro,国内首个万亿参数+1M上下文,为Agent而生!

16. 问:上下文(Context)和上下文窗口(Context Window)什么差别?这两个概念经常被混用,但其实指的是不同层面的东西:上下文是指 AI Agent 在执行任务时实际拥有的所有信息,包括系统提示词、用户的对话历史、检索到的文档、工具调用的结果、记忆模块注入的内容等等。你可以把它理解为“Agent 此刻脑子里装的所有东西”。上下文是一个动态的、可以被工程化管理的概念——哪些信息该放进来、什么时候放、怎么组织,这就是现在越来越多人说的 Context Engineering。上下文窗口则是模型层面的一个硬性限制,指的是模型单次推理能处理的最大 token 数量。比如 128K、200K、1M 这些数字,说的就是上下文窗口的大小。它本质上是一个“容器的容量”。打个比方:上下文窗口是你厨房操作台的面积,上下文是你实际摆在台面上的食材、调料、菜谱和工具。台面就那么大(上下文窗口有上限),但你放什么上去、怎么摆放(上下文的管理)决定了你能不能高效做菜。在 Agent 开发中,一个核心挑战就是:Agent 需要的上下文往往远超上下文窗口的容量。对话越来越长、工具调用结果越来越多、检索的文档越来越大——这些都在消耗上下文窗口的空间。所以才需要各种策略来管理:摘要压缩历史对话、选择性检索而不是全量灌入、及时清理不再需要的中间结果等等。简单总结就是:上下文(Context)是“内容”,上下文窗口(Context Window)是“装内容的容器”。做 Agent 工程的核心功夫之一,就是在有限的“上下文窗口”里塞进最有价值的“上下文”。

17. 今天AI太热闹了,DeepSeek V4预览版正式上线并开源,OpenAI几乎同期推出GPT-5.5,两大重磅发布“撞车”,直接把话题推向高潮。DeepSeek V4和GPT-5.5谁更强?哪些领域哪个更领先?从目前公开信息和基准来看,两者各有侧重,没有绝对碾压:🔻• DeepSeek V4(预览版): • 亮点:百万上下文(1M tokens)标配,这对处理整个代码库、长文档或复杂知识库非常友好。采用MoE架构(V4-Pro约1.6T总参数/49B活跃,V4-Flash更轻量),强调高效Agent能力和成本控制。 • 强项:长上下文理解、编码相关任务(SWE-bench Verified接近80.6%)、数学/推理(部分基准追平或接近顶级闭源模型)、极致性价比。开源权重已放出,支持本地部署和华为昇腾等国产硬件优化。 • 弱势:作为预览版,某些复杂Agentic任务(需要多轮工具调用、真实世界交互)可能还需进一步打磨,整体智能上限在部分基准上略落后于最新闭源旗舰。🔻• GPT-5.5: • 亮点:主打更快、更省Token,在编码、办公自动化、研究任务上优化明显。OpenAI宣称它在多项基准(包括Terminal-Bench、编码相关)超越同期竞品,Agent能力更“直觉”、能处理有限指令下的复杂工作流。 • 强项:通用智能、工具使用、实际生产力任务(写代码、调试、跨应用操作)、响应速度和效率。付费用户(Plus/Pro等)已可直接体验,生态集成(ChatGPT、Codex)成熟。 • 弱势:上下文窗口相对较小(此前系列多在128K-256K级别,未见1M标配),API定价较高,闭源限制了自定义和本地化。总结:• 长上下文/大文档/代码库级任务:DeepSeek V4明显领先,百万上下文不是宣传,是实际可用。• 通用Agent、生产力、复杂工作流:GPT-5.5更强,尤其在“省Token”和直观性上,实际使用中可能感觉更丝滑。• 编码/数学/推理:两者接近,DeepSeek在开源性价比上拉开差距,GPT-5.5在某些官方基准上略胜。• 多模态/综合体验:GPT-5.5目前更成熟(OpenAI生态加持),DeepSeek V4预览版据称有原生多模态潜力,但需验证。#DeepSeekV4和GPT5.5谁更强#

18. DeepSeek V4 网页端《原神×我的世界》融合小游戏代码测试:拳打 ChatGPT,脚踢 Gemini,硬刚 Claude

19. 谷歌Gemini 3.1 Pro屠榜封神,清华姚顺宇出手!Claude和GPT被逼入死角

20. 大模型的上下文工程,都说很重要,但相关的研究那么少,对Agent开发有什么影响,有大佬能解释一下吗?

21. 大模型上下文工程指南

22. 盘点一周AI大事(4月12日)|Mythos太强不敢发布 Anthropic官宣最强大模型Claude Mythos OpenAI发布超级智能经济蓝图 Meta发布大模型 Muse Spark 智谱上线最强开源大模型GLM-5.1 Anthropic上线Agent包工头Claude Managed Agents Gemini上线概念可视化visualizations 阿里发布最强视频模型HappyHorse-1.0 米哈游发布最强数字人模型LPM 1.0 Ace开源最强音乐模型ACE-Step-1.5-xl 研究员开源最强虚拟试穿模型Vanast #前沿科技趋势发布月 #AI新星计划 #AIGC #大模型 #Agent

23. Qwen3.6-Plus 太猛了!免费+百万上下文+Agent,多模态能力直接拉满!| 零度解说

24. #千问Qwen3.5大模型发布#阿里在除夕夜甩出了个王炸——全新大模型千问Qwen3.5开源了,看完参数我直接好家伙: 用了Mamba混合注意力+MoE稀疏专家架构,总参数3970亿,但每次推理只激活170亿,相当于“小身材干大活”,显存占用直接砍半还多,长文本处理速度直接起飞。终于从纯文本模型进化成原生多模态,以后图文交互、复杂任务处理更丝滑。性能直接对标顶级开源产品,关键是部署门槛低了一大截,不管是企业还是个人开发者,都能轻松玩起来。 与其说是发布新模型,不如说是把大模型的“技术普惠”又往前推了一大步。

25. Gemini 3.1:小小小小更新压过对手大迭代,Google卷飞了

26. 谷歌Gemini 3 Flash 掀桌子进场,快了3倍还反超Pro,价格仅1/4

27. //@千问:DeepSeek V4 将 100万(1M)上下文作为标配确实意义重大。这意味着AI能一次性处理海量信息,如整个中型软件代码库或数十万字合同。这使其能从“读摘要”升级为“全览”,瞬间抓住重点,真正成为能处理复杂长文本的“超级研究员”。

28. 16项测试赢了13项!Gemini 3.1 Pro碾压GPT-5.2和Claude

29. 黄仁勋罕见长文:未来10年,AI拼的到底是什么? #黄仁勋 #英伟达 #gtc #科技改变生活

30. 梦想照进现实!AI大模型全屋智能居然成了?!

31. 用模型排行榜论输赢?AI竞赛到底在比什么? #大咖观察 #红衣聊AI #AI #大模型

32. 盘点一周AI大事(12月28日)|最强开源大模型易主 智谱发布最强开源大模型GLM 4.7 MiniMax发布最强开源编码模型MiniMax M2.1 阿里开源超长上下文模型QwenLong-L1.5 字节发布最强数学模型Seed-Prover 1.5 英伟达开源游戏智能体Nitrogen 阿里开源语音对话模型Fun-Audio-Chat 字节开源短剧视频模型StoryMem 字节开源关键帧视频模型DreaMontage 奥特曼认为通用人工智能已成为过去式,并提出超级人工智能定义 #前沿科技趋势发布月 #抖音知识年终大赏 #AI新星计划 #OpenAI #大模型

33. 盘点一周AI大事(12月7日)|GPT5.2下周发布 Gemini 3 Deep Think正式上线 OpenAI下周12月9日发布大蒜模型GPT5.2,下月发布大葱模型GPT5.5全面吊打Gemini 3 DeepSeek开源最强推理模型DeepSeek V3.2 Mistral开源Mistral 3家族 OpenAGI发布最强电脑操作模型Lux Runway发布最强视频模型Gen 4.5 阿里开源数字人直播模型Live Avatar 字节发布顶级图像模型Seedream 4.5 研究员推出3D空间音频模型ViSAudio 微软开源实时语音模型VibeVoice Harmonic推出亚里士多德智能体,6个小时解决了悬赏30年的数学问题 #抖音知识年终大赏 #AI新星计划 #人工智能 #OpenAI #机器人

34. #DeepSeek新模型能否再次爆火#V4最大的突破之一:应该是是超长的上下文理解能力想象一下这样的场景:你接手了一个遗留系统,代码几十万行,文档缺失,关系复杂传统AI模型要么"看不懂",要么"理解偏了"而V4能够一次性理解整个代码库的逻辑,给出真正有用的分析和建议,这对于企业级开发来说,才是真正的生产力提升呀!DeepSeek#AI##数码科技##DeepSeek#

35. 当智力变成白菜价,百亿美金创始人揭秘普通人未来3年最大出路 Notion 创始人 Ivan 赵的这篇万字长文,让我看透了 AI 时代的三个真相:智力正在“基建化”:当脑力劳动变成自来水一样廉价,你的“努力”可能正在贬值;人类不是“胶水”:别再把生命浪费在标签页的切换和粘贴上,真正的变革是重构,而不是效率;品味是最后的护城河:技术是油门,品味才是方向盘 #ai #科技 #马斯克 #Notion #创业思维

36. #千问Qwen3.5大模型发布#真正的卷王出现了,就在刚刚,阿里正式发布全新一代大模型千问Qwen3.5-Plus。这次核心更新在于采用了Mamba混合注意力机制(SSM-Transformer) + 稀疏MoE架构,总参数3970亿但仅激活170亿参数,显存占用降低60%,推理吞吐量最高提升19倍。举个例子,传统大模型就像人工翻整墙档案,你每问一个新问题,都要把前面所有档案重新翻一遍核对关系,内容越长,翻得越慢,越到后面越卡。 纯Mamba机制则像只记档案摘要,翻得极快,但细节容易丢,关键信息可能漏看。 而Qwen3.5-Plus的混合注意力,就是摘要+精准抽查一起上:速度跟得上,细节不丢失,长文本、复杂推理又快又准。 这才是真·技术内卷,大模型体验又要上一个台阶了。#how i ai##过个有ai年# 千问qwen3.5大模型发布

37. #微博声浪计划##听见微博# DeepSeek新模型曝光,其新一代旗舰模型V4核心架构MODEL1因GitHub代码更新意外公开。该架构在KV缓存、FP8量化等方面革新,支持百万Token上下文,推理成本仅为GPT-4 Turbo的1/70,预计2026年春节发布,或推动国产大模型效率革命。 铭科技的微博音频

38. Claude Opus 4.6 和 Sonnet 4.6 的 100 万 token 上下文窗口今天正式全面开放(GA),且不加价,按标准价格计费,无论请求长度是 9K 还是 900K token,单价完全一样。 Opus 4.6 的定价是输入 $5、输出 $25(每百万 token),Sonnet 4.6 是 $3/$15。此前超过 20 万 token 的请求需要加 beta 标头,现在直接生效,已有代码无需改动。 除了价格统一,这次更新还有几个实际变化:单次请求可处理的图片和 PDF 页数从 100 提升到 600;所有上下文长度享受相同的速率限制,不会因为请求变长而被限流。Claude Code 的 Max、Team 和 Enterprise 用户在使用 Opus 4.6 时将默认启用 100 万上下文,意味着对话压缩(compaction)频率大幅降低,更多对话历史得以完整保留。 在准确率方面,Opus 4.6 在 MRCR v2 基准上得分 78.3%,Sonnet 4.6 在 GraphWalks BFS 上得分 68.4%,均为同类前沿模型在百万 token 长度下的最高分。简单说就是:窗口虽大,信息检索能力没有打折。 Anthropic 引用了多家客户的反馈来说明实际效果。 Cognition(Devin 背后的公司)表示,此前大型代码差异塞不进 20 万上下文窗口,需要分批处理,容易丢失跨文件依赖;现在整个差异一次送入,代码审查质量更高,流程也更简单。Ramp 的工程师提到,Claude Code 在调试时经常消耗超过 10 万 token 检索各类数据源,一旦触发压缩就会丢失细节、陷入重复调试循环,百万上下文直接消除了这个问题。 该功能今天起通过 Claude Platform 原生支持,也可通过 Amazon Bedrock、Google Cloud Vertex AI 和 Microsoft Foundry 使用。 http://t.cn/AXVmRMYf

39. Claude Sonnet4.6编程追平Opus了,价格便宜4成,老金算了笔账

40. Claude 5史诗级泄露,史上最强编程模型评测炸裂!核心秘密曝光

41. 毕业后,我们会被AI取代吗?

42. 盘点一周AI大事(4月26日)|OpenAI王炸两连 OpenAI上线下一代大模型「GPT-5.5」 OpenAI全量上线下一代图像模型「GPT-Image-2」 Kimi发布最强开源大模型「Kimi K2.6」 DeepSeek发布了「DeepSeek V4」 Office三件套(Word PPT Excel)全量上线Copilot智能体 Google发布最强深度研究「Deep Research Max」 研究员开源AI研究员「ASI-Evolve」 Google发布最强图像分割模型「Google Vision Banana」 LTX开源视频转HDR「LTX HDR LoRA」 ODYSSEY发布最强世界模型「Odyssey-2 Max」 字节开源最强3D模型「Seed3D 2.0」 工程师研发出最强乒乓球机器人 #前沿科技趋势发布月 #AI新星计划 #AIGC #AI #OpenAI

43. AI圈最顶级的一次争吵,理解世界还是堆模型? #大咖观察 #红衣聊AI #大模型 #人工智能

44. 「Github一周热点第111期 」 Karpathy大神的Claude Code配置,更适合程序员的显示器RD270Q

45. 【英雄联盟】2026年第一主题季、玩法更新以及更多内容 | 开发者报告

46. “源神”的新年贺礼!深度实测Qwen3.5,原生多模态表现如何

47. 刚刚,OpenAI买下Python最强基建,准备垄断开发者「生产资料」

48. GPT-5.3 正式发布!完全免费开放,实测代码能力、推理、文本理解与响应速度 | 零度解说

49. #DeepSeek专家模式上线#DeepSeek 专家模式以 “通用高效 + 专业深度” 双模式覆盖全场景,并且凭借顶尖推理与长文本能力,成为科研、金融、政企、研发等领域的首选工具。DeepSeek专家模式在落地场景中的优势体现:长论文精读、数理推导、实验设计,效率提升 50%+。复杂代码编写、debug、系统设计,准确率与完整性显著优于通用模型。法律文书审核、政务工单处理、智能审批,效率提升 300%。属于闭源第一梯队、开源顶尖水平!

50. #微博声浪计划##听见微博# GPT5.2发布亮点全解析! #GPT5.2发布有何亮点# 本期10分钟播客聚焦GPT5.2三大版本亮点,揭秘70.9%专家级任务胜率、11倍效率提升、25.6万token长文本处理等核心突破,对比Gemini 3 Pro,详解编程、金融等场景应用案例。 凯文思考的微博音频

51. 【独立开发者 7 天复现 Google 顶级算法:TurboQuant+ 开启本地大模型长文本新纪元】Google 在 ICLR 2026 论文中提出的 TurboQuant 算法曾引发内存行业震动,但官方至今未释出代码。独立开发者 Tom Turney 凭借数学功底,在 Claude 的辅助下仅用 7 天便完成了从理论到工程的跨越,且性能超越了 Google 的官方承诺。+ 工程奇迹的 7 天演进- 第 1-3 天:构建核心算法,通过 141 项测试,完成 Python 原型开发。- 第 3-5 天:将代码移植至 llama.cpp,并手写 Metal GPU 内核。- 第 5-7 天:极致性能调优,将吞吐量从 739 提升至 2747 tok/s,实现 3.7 倍速跃升。+ 超越原著的深度优化Tom 并未止步于复现,他在原论文基础上增加了多项原创研究:- Sparse V(稀疏 V 解码):在长文本语境下跳过 90% 的 Value 向量解压,显著降低计算开销。- 非对称 K/V 压缩:保持 Key 向量的高精度以确保注意力路由准确,同时对 Value 向量进行更激进的压缩。- 时间衰减压缩:自动降低旧 Token 的存储精度,进一步释放内存。+ 实测性能与意义在 MacBook M5 Max 上,该项目实现了 4.6 倍的 KV Cache 压缩,使得 35B 规模的模型能在消费级硬件上流畅运行长文本。这不仅是工程上的暴力美学,更是对“大厂发布论文,小团队实现商业化”这一现状的有力回应。+ 深度思考:AI 时代的工程杠杆过去从论文发布到工业级实现往往需要数年,如今在 AI 辅助工具和开源社区的加持下,这个周期被缩短到了一个周末。大厂负责定义未来的边界,而拥有强大行动力的个体正在负责交付未来。当沟通成本消失,个体的杠杆率正达到前所未有的高度。- 大厂发布的是路线图,但总得有人把车造出来。- 研发实验室在为建设者预览未来,而建设者在废墟上直接交付生产力。- AI 辅助开发的本质,是坍缩了“理解论文”与“交付代码”之间的鸿沟。项目地址:github.com/TheTom/turboquant_plus相关研究:arxiv.org/abs/2504.19874

52. #DeepSeekV4发布# 这算是千呼万唤始出来,终于发布了。DeepSeek今天正式发布V4系列预览版并同步开源,分为V4-Pro和V4-Flash两个版本,主打100万(1M)超长上下文能力,官网、App及API均已同步更新。V4-Pro在Agent能力、世界知识、数学推理等多项评测中达到开源模型最佳水平,推理性能比肩顶尖闭源模型;V4-Flash则以更小的参数量提供更快速、更经济的API服务,适合轻量场景。技术层面,V4采用全新注意力机制,结合DSA稀疏注意力,在大幅压缩计算和显存需求的同时,实现百万级超长上下文。DeepSeek表示,1M上下文将成为旗下所有官方服务的标配。此外,V4针对多款主流Agent产品进行了专项适配优化。旧版API接口模型名deepseek-chat和deepseek-reasoner将于2026年7月24日正式停用,用户需提前切换至新模型名。#老张聊科技# deepseekv4发布

53. 不知道大家想过这个问题没有,大家都感觉现在大模型的记忆存储受限,200万的上下文记忆其实也不够用。但我想说,其实即使大模型能够记住海量的上下文,也未必有用,它依然需要上下文的管理。也就是说,在AI时代,一个人非常重要的能力就是如何去管理上下文,去领导Agent。为什么这么讲呢?大家可以想想,如果记忆不受限,大模型可以无限存储,你和它聊的内容越多,它大脑里塞的东西就越满。在执行任务的过程中,它不知道到底应该怎么去执行,因为塞的东西太多了,哪个是核心的?是不是太多了?如果记忆太多,就容易导致错乱和模糊,因为你塞得太满,它不知道怎么执行,很多东西在里面很乱。所以,上下文管理是必须的。第二,即使大模型的记忆非常多,人和人之间沟通,一句话的理解都可能不同,何况大模型和人之间的沟通呢?这里面肯定也会存在交流的摩擦。所以,人需要及时干预和介入到大模型的工作流程当中,去管理上下文、管理整个流程,这是非常必要的。所以大家不要期待说,大模型的上下文越来越长就越好,不一定,有利有弊。即使大模型不会丢掉记忆,记忆永存,它依然不会精准地按照人类的要求去执行。我之前看过一个调查或研究,就是说大模型里,你上下文塞得越多越满,它的执行就会越混乱、越模糊,就是因为东西太多了,它不知道怎么执行了。所以,管理上下文这个事情,依然需要有人去管理、去做。#科技先锋官##How I AI#

54. 盘点一周AI大事(4月19日)|Claude终结设计 Anthropic上线Claude Design,接管整个设计流程 Anthropic上线最强编码模型Claude Opus 4.7 OpenAI内测下一代图像模型GPT-Image-2 OpenAI升级Codex,全面对标Claude Code Heygen开源视频制作技能包HyperFrames Quiver上线最强矢量图模型Arrow 1.1 Adobe发布重新打光图像模型TokenLight 字节开源数字人模型OmniShow 阿里开源开放世界模型Happy Oyster 研究员开源最强3D动画模型AniGen Gemini上线最强语音合成模型Gemini 3.1 Flash TTS Meta研发出神经计算机Neural Computers #前沿科技趋势发布月 #AI新星计划 #AI #AIGC #大模型

55. 盘点一周AI大事(11月23日)|AI自己画CAD图纸 Google发布最强大模型Gemini 3、最强图像模型Nano Banana Pro OpenAI发布最强编码模型GPT-5.1-Codex-Max 马斯克升级Grok 4.1,情商最强 字节开源最强空间重建模型Depth Anything 3 腾讯发布最强开源视频模型HunyuanVideo-1.5 Meta开源最强对象分割模型SAM 3,最强3D分割模型 SAM 3D Autodesk研发出最强CAD智能体VideoCAD AI2发布最强开源深度研究智能体Deep Research Tulu Google发布最强AI天气预报WeatherNext 2 Maxima推出AI会计智能体 头号玩家套装问世 #AI新星计划 #人工智能 #AIGC #OpenAI #大模型

56. 真正的核心竞争力,来自于驾驭工具。 #大咖观察 #红衣聊AI #编程 #人工智能技术

57. AI的未来,也许不在于模型规模的无限扩大。 #大咖观察 #红衣聊AI #transformer神经网络架构 #人工智能

58. 这次春节AI大战,国产模型与国产芯片第一次,双向奔赴! #春节世界观察 #新年囤点专业货 #燃起来了大国重器 #大咖观察 #红衣聊AI

59. MiniMax M2.7+OpenClaw实战!AI到底能接管多少工作?

60. #deepseekv4发布#DeepSeek 发布新一代大模型 DeepSeek V4,本次更新主要围绕上下文能力、推理能力以及 Agent 场景进行优化。来看一看它的核心更新如下:🔻上下文能力大幅提升 支持最长 1M tokens(百万级上下文) 可处理完整代码库、长文档、多轮复杂对话🔻强化 Agent 场景能力 优化多步骤推理能力 支持更复杂任务执行 提升长流程稳定性🔻模型性能提升 多项 benchmark 表现提升 对标主流闭源大模型🔻提供双版本 Pro:高性能版本 Flash:高性价比版本(更快、更便宜)🔻 延续开源路线 持续推动开源大模型发展 强调低成本与高性能结合目前 DeepSeek V4 已开放相关能力与体验入口,可以在Hugging Face体验,具体应用场景仍在持续拓展deepseekv4发布

61. #千问Qwen3.5大模型发布# 阿里“年夜饭”来了,开源全新一代大模型千问Qwen3.5-Plus。 总参数为3970亿,激活170亿,性能超过万亿参数的Qwen3-Max模型,部署显存占用降低60%,推理效率大幅提升,最大推理吞吐量可提升至19倍。 在推理、编程、Agent智能体等全方位基准评估中均表现优异,并在视觉理解能力的权威评测中斩获数项性能最佳。 支持长达2小时(1M token上下文)的视频直接输入,适用于长视频内容分析与摘要生成。#过个有AI年#

62. 【DeepSeek 联合清北发布论文:发力智能体底层基建,突破 Agent 推理 I/O 瓶颈】DeepSeek 与北大、清华在 ArXiv 发布论文,提出全新针对智能体的推理框架 DualPath。其核心是解决 Agent 长文本推理 I/O 瓶颈,通过引入「存储至解码」路径,改变传统单路径加载模式,实现集群存储带宽全局池化与动态负载均衡。在 660B 规模模型实测中,离线推理吞吐量提高 1.87 倍,在线服务吞吐量平均提升 1.96 倍,优化首字延迟且不影响 Token 间生成速度。DualPath 构建双路径模型,由推理引擎、流量管理器和中央调度器组成,还给出以计算网卡为中心的流量管理和自适应请求调度器两套优化方案。实验显示其能有效突破大模型推理 I/O 墙,提升智能体 LLM 推理系统效率。此外,论文第一作者是北大博士生吴永彤,他聚焦系统软件与大模型基础设施研究。

63. #微博声浪计划##听见微博# DeepSeek新模型曝光!V4架构在GitHub意外泄露,春节发布前夕技术细节浮现。新模型采用独立架构,硬件优化使显存降30%以上,支持FP8量化,适配英伟达Blackwell。性能预期百万级上下文处理,API成本或为GPT-4 Turbo的1/70,若兑现将改写国产AI格局。 科技开的微博音频

64. 盘点一周AI大事(5月3日)|Google上线AI口语陪练 Google IO即将发布Gemini 4和Veo 4 Gemini上线原生文件生成 Google推出AI衣柜 Google翻译上线AI口语陪练 Claude 接入50多款创作软件,能直接操作Photoshop修图、做海报,接管Blender建模,用Ableton创作音乐 英伟达开源全模态模型Nemotron 3 Nano Omni 研究员训练出复古大模型talkie KAIKAKU发布食品大模型Epicure 研究员开源突破性智能体协作框架Recursive MAS Moonlake上线Blender智能体Moonlake 3D Agent #前沿科技趋势发布月 #AI新星计划 #AI #AIGC #大模型

65. 高中生,想成为鸿蒙开发者

66. GPT5.2亮点解读,OpenAI重夺年度最强 OpenAI甩出王炸GPT5.2,核心基准测试,全面碾压Gemini 3 Pro和Claude Opus4.5,强势夺回地表最强 奥特曼放话GPT5.2不仅是最强通用大模型,还要成为你日常办公的AI合伙人 亮点1、最强视觉能力 亮点2、最强上下文 亮点3、最强办公能力 亮点4、最强编程能力 #AI新星计划 #抖音知识年度大赏 #人工智能 #OpenAI #大模型

67. 盘点一周AI大事(1月25日)|Agent进化,24小时打工 开源视频制作Remotion Skills爆火 AI编程开无限画布插件Pencil 爆火 开源个人AI助手Clawdbot爆火,7成24小时给你打工 Claude Excel插件更新 Runway上线最强视频模型Gen 4.5 字节开源视频参考模型OminiTransfer 字节发布最强数字人直播模型FlowACT R1 阿里开源最强文本转语音模型Qwen 3 TTS #AI新星计划 #抖音知识年终大赏 #AI #OpenAI #AIGC

68. 本地部署大模型?天选Air2026锐龙AI Max版简单开箱

69. 盘点一周AI大事(2月22日)|不赚钱拔网线,龙虾狂赚1万 工程师开源龙虾打工人ClawWork,10刀开局,7小时狂赚1万刀 工程师Sigil开源首个全自主智能体The Automaton Kimi上线云端龙虾Kimi Claw 网易开源桌面版龙虾LobsterAI Google上线地表最强大模型Gemini 3.1 Pro Gemini接入音乐模型 Lyria 3 NotebookLM升级,动动嘴就能修改PPT,还支持导出PPTX格式 Anthropic发布Claude Sonnet 4.6 Claude与Figma官宣史诗联动,Claude Code写的页面能一键导入Figma 阿里开源最强行动智能体 Mobile-Agent-v3.5 字节开源极速生图模型BitDance Tavus发布最强数字人模型Phoenix-4 Taalas研发出革命性AI芯片HC1 #抖音年味新知贺岁 #前沿科技趋势发布月 #AI新星计划 #OpenAI #智能体

70. 盘点一周AI大事2月8日|AI相亲、AI当老板、AI狼人杀 Anthropic发布最强大模型Claude Opus 4.6 OpenAI发布最强编码模型GPT5.3Codex OpenAI推出Codex桌面版 Google上线AI狼人杀 AI雇佣人类平台RentAHuman爆火 AI雇佣AI平台ClawTasks爆火 龙虾相亲平台MoltMatch爆火 智谱开源最强OCR模型GLM-OCR 字节发布最强视频模型Seedance 2.0 研究员开源无痕编辑视频模型Edit Yourself 字节开源最强分子预测模型Protenix-v1 Google发布论文配图AI Paper Banana #AI新星计划 #前沿科技趋势发布月 #AI #AIGC #OpenAI

71. #DeepSeekV4发布# DeepSeekV4终于发布了,简单总结下:1、双版本发布:推出 DeepSeek-V4-Pro(高性能)和 DeepSeek-V4-Flash(高性价比)两个版本,可按需选择。2、超长上下文:支持 1M token(约百万字) 的上下文长度,能一次性处理海量信息。3、核心能力领先:在 Agent能力、世界知识和推理性能 三方面均达到国内及开源模型的领先水平。4、具体任务表现:V4-Pro版本的代理编码能力接近顶尖闭源模型,在数学、编程等推理任务上超越所有已开源评测的模型。5、技术创新与迁移提醒:采用 DSA稀疏注意力机制 降低长上下文计算成本;原有 deepseek-chat 等模型名3个月后停止使用,需迁移到新名称。

72. 创新Transformer!面壁基于稀疏-线性混合架构SALA训练9B模型,端侧跑通百万上下文

73. 2026上半年国内十大AI工具核心特点一览: ​1. 豆包 (字节跳动) 特点:对话交互体验佳 以拟人化对话和语音交互见长,响应速度快,适合日常闲聊、口语练习及轻量级信息查询。 ​2. DeepSeek (深度求索) 特点:逻辑推理与代码金融 在数学推导、代码生成及金融分析领域表现卓越,以高性价比和强逻辑性著称。 ​3. 文心一言 (百度) 特点:中文知识问答权威 依托庞大的知识图谱,在中文语义理解、百科问答及搜索增强方面表现优异。 ​4. 通义千问 (阿里) 特点:办公场景全能助手 深度集成于阿里办公生态,在文档处理、会议纪要及跨格式解析方面表现出色。 ​5. 智谱清言 (智谱AI) 特点:思维链逻辑推理强 擅长复杂问题拆解与逻辑推演,能够展示清晰的思考过程,适合科研与深度分析。 ​6. Kimi (月之暗面) 特点:超长文本处理专家 支持超大上下文窗口,轻松解析百页PDF与长篇文档,是阅读与摘要的利器。 ​7. 元宝 (腾讯) 特点:精准检索与摘要 深度整合微信生态,擅长处理长文档摘要、资料精准检索与复杂指令分析。 ​8. 通义灵码 (阿里) 特点:高效智能编程 基于通义大模型的编码助手,支持行级/函数级实时续写,大幅提升开发效率。 ​9. 天工AI (昆仑万维) 特点:AI音乐创作先锋 在AI音乐生成领域独具特色,支持多种风格的旋律创作与歌曲生成。 ​10. 即梦/可灵 (字节跳动) 特点:多模态内容生成 字节跳动在视频与绘画领域表现突出,其中即梦侧重绘画设计,可灵侧重视频生成,展现了强大的视觉内容创作能力。 (转)

74. #DeepSeekv4要来了吗# 大家还记得去年春最火的三件套吗?今年的春节也马上到,DeepSeekV4要来了,这个很真实了吧。进入灰度测试阶段,也就表明正式版已经不远了。更牛的地方是说,该模型支持 100 万 Token 超长上下文,知识截止日期为 2025 年 5 月。有个尝试的小技巧:“你的上下文长度是多少”,会被告知上下文长度为128K,知识截止日期是24年7月,说明当前为老版本然后切换在手机端再问一下,如果知识库更新到25年5月,那恭喜你,灰测成功。#HOW I AI##过个有AI年#deepseekv4要来了吗

75. 国产长文本模型杀疯了!SubCube实现1200万Token上下文,算力成本直降95%

76. 大模型的长文本能力有哪些应用

77. 大模型处理长文档

78. 别再迷信“大海捞针”了!清华 LongBench v2 揭露真相

79. 上下文越长,大模型表现越好还是越差?

80. 百万上下文不稀奇了!大模型比拼,早已换了赛道

81. 为什么大模型都在刷上下文窗口,1M真的够用了吗?

82. 为什么大模型都在卷上下文窗口?更大上下文真的有用吗?

83. 长文本能力

84. DeepSeek,MiniMax,智谱三大模型同时发力,「法律人」智能装备再升级

85. DeepSeek-V4太香了!法律人用它干活,效率直接起飞|附合规使用提醒

86. 2026 实测

87. AI小说创作工具全解析

88. 用 AI 创作长篇小说的高效方法

89. 新手写长篇小说用什么AI工具 圈内靠谱实用利器推荐

90. 试了市面上十几款AI写小说,我为什么还是选择回归“半自动”创作?(附直播预告)

91. AI小说助手2.0线上版要来了

92. Claude Sonnet 4.6实战

93. Claude 长文本理解能力实测

94. Claude 4.6 Sonnet上手解析

95. 各类长文本整理太慢不会归纳?智能摘要生成提供规范思路

96. 我是怎么接通 Claude API 的——从绑卡到跑通第一个项目的完整经历

97. Claude 4.7 Opus MAX 2026实测

98. Claude 技术深度解析

99. Claude 200K 长上下文别硬塞

100. GPT-6性能暴涨40%,上下文200万Token

101. 深度解析

102. 自动化文档生成与上下文推理

103. “知识检索”与“深度推理”

104. 通义千问Qwen3.6Plus登陆OpenRouter 百万上下文免费使用 国产大模型降维打击海外付费服务

105. 通义千问3.6正式发布 代码能力对标Claude Code 百万token上下文免费用效率跨越式提升

106. 文心一言、通义千问、Kimi、DeepSeek……国产AI工具横向评测

107. 百万字上下文

108. 决胜2026

109. Claude 4.7长文本解析深度复盘

110. ChatGPT 5.4 实测|长文本总结真能替代人工梳理吗

111. 大模型突破长度限制

112. 大模型落地特定场景难题怎么破?ICLR 2026两种方案搞定音频空间推理与个性化长文本生成

113. 2026 文档 / 长文本信息 AI (App / 工具)

114. 一张图看懂 DeepSeek V4

115. 全栈开发者必看|DeepSeek‑V4 正式开源

116. [亲测首发]

117. 【今日短讯】FlashPrefill

118. 开发者用Gemini 3.1 Pro处理长上下文任务方便吗?

119. 2026年大模型竞争新焦点

120. 长文本推理成本爆炸怎么办?ICLR 2026四种推理优化方案让短模型也能玩转长上下文

121. Kimi K2.5 vs GPT-5.4

122. QwenLong-L1.5:让AI真正读懂长文本的秘密武器

123. QwenLong-L1.5发布:一套配方,三大法宝,让30B MoE模型长文本推理能力媲美GPT-5

124. LongBench-Pro:25个评测任务全面揭示46个大模型的真实长上下文能力

125. Claude Opus 4.7 vs GPT-5.5 vs Gemini 4:长文本赛道谁是真王者

126. 一个 pip 命令,让大模型突破上下文长度限制!MIT 开源 RLM 递归推理引擎火了

127. AI大模型如何提高上下文长度?

128. 大模型应用开发-2 上下文工程

129. 最新热点 | DeepSeek V4(预览版)正式发布:国产大模型在长文本与Agent领域的里程碑

130. AI大模型系列第四站:大模型的上下文窗口

131. 只有 4.5% 的评测成本,却有 97% 的排名相关性?MiniLongBench 揭示长文本评测的“虚胖”真相

132. GPT-5.5 Instant 正式上线 长文本理解能力迎来跨越式升级

133. 国产大模型崛起:DeepSeek、通义、文心三分天下

134. 深度长文解析:2026大模型长上下文抓取机制与GEO监测全景指标图谱

135. 终于搞懂了!大模型上下文到底是什么?还在迷信“上下文越长,AI越聪明”? 这两个概念,90%的人都搞反了! 上下文=大模型的“工作记忆窗口” • 模型没有长期记忆,每次只能读取窗口里的内容 • 窗口里装着:系统指令+历史对话+当前输入+生成内容 • Token是上下文的“货币”:中文1字≈1-2Token,128K≈10万汉字 • 窗口有上限,本质是算力和内存的限制,不是设计缺陷 3个致命误区,你中了几个? 1. 长上下文≠全部理解:关键信息放中间,模型容易“Lost in the Middle” 2. 上下文≠记忆:Claude“记得”对话,只是每次都重新传了历史 3. 塞满窗口≠高效:截断会失忆、压缩会失真,RAG才是精准方案 💡 正确使用姿势: 重要指令放开头/结尾,别埋中间;长文档分段处理;跨对话靠数据库记忆。 用好窗口,比买更大的窗口更重要! 收藏起来,下次用AI别再踩坑! #AI #大模型 #ChatGPT #Claude #上下文窗口

136. 阿里千问3.6-Max实测:长文本+多模态双升级,国产AI又进化了

137. Z Tech|ICLR 2026字节发布:从短句到篇章,DiscoX为长文翻译提供评测新范式

138. Gemini模型深度解析与应用指南

139. 北邮提出 HiFlow:层级反馈驱动的长文本约束生成框架

140. 发稿大师 | 大模型“长文本”内卷战:为什么你的公关稿在百万上下文里成了“废话”?

141. 大模型长文本:Long Context技术梳理

142. 超长文档也能秒读?解析法小师处理复杂法律文本的黑科技

143. DeepSeek API突袭更新!128K→1M上下文,实测V4 Lite上线?新模型本地跑分+长文本压测,国产AI这次动真格了

144. 第二期:文本模型怎么选——评测、上下文、成本,别再“只看最强”

145. 🌋 大模型长上下文|正确率暴跌❗️。🔥大模型集体翻车!平均正确率仅17.2%!颠覆认知的CL-Bench测试结果: 🔗• 测的不是“模型会做题”,而是“模型能不能从复杂上下文里学新知识、做任务” 🔗• 10个前沿大模型(含GPT-5.1、Claude Opus 4.5)平均正确率仅17.2% 🔗• 最长正确率的GPT-5.1也才23.7%,大多数模型卡在13%-18%之间 📍最扎心的发现: 🔗• 长上下文就是硬瓶颈!32K+ tokens的正确率直接跌到5%-10% 🔗• 模型最常见的错误不是算错,而是忽视/误用上下文(顶级模型也有55%+犯这个错) 🔗• 推理强度拉满,收益也只有2.5%左右,“多想几步”救不了上下文学习能力 📍核心启示: 未来大模型的下半场,不是拼“更长的上下文窗口”,而是拼“更强的上下文学习能力”——就像入职当天读完手册就能干活的同事,才是真的能落地。 #大模型研究#AI硬核干#长上下文瓶颈#CLBench测试#人工智能前沿

146. 长上下文大模型综述:挑战、价值与技术路径

147. 对长上下文能力有不同要求,怎么选择合适的模型?

148. 2026年国内外AI大模型参数与评测结果对比报告

149. 阿里通义千问新模型 Qwen 3.6 Plus Preview 上线

150. 史上最强Sonnet模型 Claude Sonnet 4.6全面评测

151. 【论文精读】一文读透:大模型如何30秒读完百万级长文本

152. 清华LongBench v2:长文本理解AI接受人类专家级挑战 - 哔哩哔哩

153. Gemini 长文档处理技巧,百万级上下文高效用 - 哔哩哔哩

154. 大模型如何突破上下文窗口?RoPE、ALiBi与长文本扩展全解析

155. 国产AI编程王炸!通义千问Qwen3.6全系解析:百万上下文+Agent编程,全面超越上代

156. Claude Sonnet 4.6 实测:编码能力超越 Opus 4.5,电脑操作接近人类水平

157. Gemini 3 Pro技术深度拆解:架构升级与实测数据解析

158. DMXAPI平台长文本模型实测,kimi-k2.5推理效果强,比官方更便宜

159. ChatGPT5.4镜像技术实测:速度、多模态与长文本能力的深度测试

160. DMXAPI推出新模型:长文本处理神器!kimi-k2.5-free免费不限量

161. 大模型能读 1M Token,就真的读懂了吗?

162. Claude Sonnet 4.6 深度实测:代码、推理、长文本,它到底强在哪?

163. 2026 年大模型 Benchmark 全解析

164. 文心一言(文心5.0)深度解析:国产AI标杆

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章