80页合同才几万字,100万窗口的AI却读到第20页忘了前19页:缺的根本不是窗口

源自121位全网作者

05:38

八月的AI圈在集体刷同一个数字:100万。7月16日,Kimi K3发布,2.8万亿参数、100万上下文。微博微博

8月3日Qwen3.8-Max正式版跟上,2.4T参数、单次激活95B,同样带100万上下文。微博 8月12日,DeepSeek官网悄悄更新API文档,V4-Pro就这么上线了。微博

8月14日Gemini 3.7 Flash上线,支持100万Token超长上下文,还能一口气读取文字、图片、视频、音频和PDF。微博 8月26日,智谱发布GLM-5.3-Flash,把这场军备竞赛凑齐了第五块牌。微博 K3官方技术报告的第一页摘要里,"100万token上下文窗口"就是卖点之一。知乎

80页合同才几万字,100万窗口的AI却读到第20页忘了前19页:缺的根本不是窗口

但另一个平台上,风向完全相反。9月1日的小红书笔记写了很多人的真实体验:想让AI帮你梳理一份80页的合同,结果它读到第20页就忘了前面说了啥。小红书 另一篇教"三步让AI读长资料"的笔记发布时间只隔一天,文末避坑提醒写的是:资料太长就分段喂,别一次塞太多。小红书

一边说整包丢进去,一边说拆开喂。我翻完8月下旬这四个平台的翻车帖和技术文章,结论是:大部分人把锅甩错了对象——你的AI忘事,从来不是因为窗口不够大。

先算一笔容量账,数字小得反常识

一份80页的合同,按每页500到800字算,也就4万到6万字。现在主流模型的中文token比在0.6到1之间,换算下来撑死六七万token。而100万token的窗口,按中文估算能吃进上百万字——一份80页合同占不满窗口的十分之一,就算回到128K窗口的老模型,它也放得下。

所以你遇到"读到第20页忘了前19页"的时候,窗口里其实空了九成。这不是塞不下的问题,是看见了没记住的问题。知乎8月31日那篇《上下文越大,AI越容易忘事》里有句话说得准:上下文窗口是工作记忆,不是长期记忆,容量变大不等于记得更牢。知乎

原因不玄乎:Transformer处理n个token要做n²次两两注意力计算,每多一个token,都从那块有限的注意力预算里分走一杯羹,窗口越长,单条信息分到的注意力越薄。Anthropic在2025年9月发布的《Effective Context Engineering for AI Agents》给这个现象起了名字:context rot(上下文腐坏)——随着token数量增长,模型对信息的召回精度反而下降。知乎 而且这是注意力机制的固有属性,Claude、GPT、DeepSeek、GLM、Kimi,一个都绕不开。

研究早就画出了那个坑的形状:U形

斯坦福Liu等人2023年的论文《Lost in the Middle》(后发表于TACL 2024)做过一个直观的测试:给模型一长串文档,其中只有一篇含答案,把答案文档从开头滑到结尾,画出来的"位置—准确率"曲线是标准的U形——开头和结尾最准,中间掉得最狠。更扎心的是:当答案埋在 20 篇文档正中时,GPT-3.5 的得分甚至低于它"不看任何文档"的闭卷基线(56.1%)。知乎 喂了长文,还不如不看。

80页合同才几万字,100万窗口的AI却读到第20页忘了前19页:缺的根本不是窗口

这两年新模型只是把坑填浅了些,没填平,从4K到1M都是这个形状。知乎 注意厂商爱用的"百万字大海捞针测试"——它只测单针检索:捞得起一根针,不等于记得住一把针。

对着你的合同看,这个形状有多要命:头几页是主体和定义(U的左端,稳),末页是签章和附件说明(U的右端,也稳),而违约责任、自动续约、免责条款、排他约定,全挤在中间。社区里流传最广的那句"AI没提的条款是不是就没有",问的其实就是这个中间洞。8月21日知乎还有文章介绍ACL 2026专门治位置偏差的三种方案,它对现象的描述很直白:把关键信息放在长文本的正中间,模型反而最容易忽略它。知乎

社区里的"忘事"分三种,只有一种要怪模型

把这轮翻车帖按毛病分个类,别一锅端:

  1. 中间条款漏看:单条义务、散落各章的限定条件对不上。这是结构性问题,中间洞,换谁家新模型都还有。

  2. 总结丢出处:纪要整整齐齐,追任务时发现负责人和截止时间没了。多半是用法问题——你根本没要求它带页码。

  3. 多轮越问越乱:追问十几轮后前后矛盾。这是长对话逼近上限触发了压缩、或者旧结论和新结论在窗口里打架,还是用法问题。

顺带和之前那篇"AI把PDF读错了"的讨论划个界:那是文档解析翻车(表格、扫描体没拆开),错在"没看清";这篇是看清了但没记住,错在"注意力"。两种病,别开同一个药方——第一种的解法是换解析工具,换模型没用;第二种才是今天的主题。

决策表:什么时候整包丢,什么时候别丢

可以放心整包丢的

  • 50页以内、只要大意和框架的文档——整包丢就是比手动分段快,别被焦虑帖骗回去手搓分段粘贴;

  • 关键词原话检索:"这份文件里哪几处提到’竞业’?"找字面出现的词是强项;

  • 单份文件的通读式摘要。

别整包丢、要换打法的

  • 合同审核、条款冲突检查、数字核对这类漏一条就有成本的活:不要指望它"通读后总结",改成"先列目录、再逐条回查";

  • 多文件对比(甲方稿和乙方稿各一份):分开喂,要求输出差异清单而不是各自摘要;

  • 开会前救命用的长报告:摘要之外,必须加一轮反向质询。

三句可以直接抄进对话框的指令,前两句来自我翻到的社区做法,第三句是我把机制倒推出来的:

  1. “列出这份合同的全部条款标题和对应页码,不许省略。”——先把骨架捞出来,标题结构在文档层级里重复出现,掉不进洞底。

  2. “只根据文件本身整理’结论|依据|使用条件’三栏表,每条结论标注章节或页码;找不到就写’没找到’,不要把建议当事实。”

  3. “列出你认为最可能被漏掉的中段条款,给我页码。”——主动逼它自查中间洞,比问"还有补充吗"有用得多。

第二句是从小红书一篇教Kimi读30页报告的帖子里抄来的,妙处就在"没找到"三个字:它给模型留了诚实的出口,堵住一半幻觉。小红书

接下来盯什么

一是厂商披露口径:发布会放出的只有跑分表——比如千问官方8月中旬公布的Qwen3.8-Max基准成绩表,Document intelligence一栏确实排得漂亮,但那测的是"看得懂文档",不是"读完一百页还记得住第五十页"。到目前为止,没有一家公布"召回精度随上下文长度衰减"的曲线。下次再有新模型喊200万、500万,先看它放没放长文评测曲线,只有大海捞针成绩的,先按营销处理。

80页合同才几万字,100万窗口的AI却读到第20页忘了前19页:缺的根本不是窗口

二是中文场景的实测。Lost in the Middle那条曲线是英文数据画出来的,中文token化更细、条款结构更密,中间洞是更深还是更浅,目前只有零星个人测试,没有系统数据——等谁先放出来。

窗口数字翻倍是真实的进步,它只是没解决你上一个问题。当"装不装得下"不再是瓶颈,“会不会用"才刚成为瓶颈。你的那份80页合同,从今晚起别再问它"帮我总结一下了”——问它要页码。

精选参考来源

1
#全球最大规模开源模型发布#【中国企业发布全球最大规模的开源模型Kimi K3】财联社7月17日电,2026世界人工智能大会暨人工智能全球治理高级别会议即将举行之际,新一代模型Kimi K3于16日发布,参数规模达2.8万亿。这是目前全球参数最大的开源模型。发布模型的北京月之暗面科技有限公司介绍,Kimi K3原生支持视觉理解,具备100万词元上下文窗口,面向软件工程、知识工作、深度研究、多模态理解等复杂任务场景进行优化,进一步提升了大模型复杂任务的处理能力。
2
#KimiK3和Fable5谁更强#看了一天的评测和案例,被K3刷屏了,Kimi K3 的100万上下文和2.8万亿参数,就已经是开启了一个新的时代,是目前全球参数规模最大的开源大模型。怕回头限购先加一个 Coding Plan,明天上课咱就用这个了~ - AA给的智能分数,Kimi K3第三,已经是仅次于Fable 5和GPT-5.6 Sol(图2)- Arena 给的前端代码能力评分中,K3 在7个领域中6个里排名第一,从上一个版本排名18位直接跃升到了第一(图3)收集了一些广告片和网友的对比视频可以看看效果感受一下~甚至还看到一个一句话案例,用下方提示词,跑了三个小时,仿出来了一套macOS系统:「在当前浏览器里搭建一套 macOS 27 系统,包含全部默认原生应用,极致还原液态玻璃视觉效果,并且所有界面组件都可以正常交互使用」效果可以看:macos27.kimi.page#How I AI#
全部
来源
内容由AI生成

精选参考来源

1. #全球最大规模开源模型发布#【中国企业发布全球最大规模的开源模型Kimi K3】财联社7月17日电,2026世界人工智能大会暨人工智能全球治理高级别会议即将举行之际,新一代模型Kimi K3于16日发布,参数规模达2.8万亿。这是目前全球参数最大的开源模型。发布模型的北京月之暗面科技有限公司介绍,Kimi K3原生支持视觉理解,具备100万词元上下文窗口,面向软件工程、知识工作、深度研究、多模态理解等复杂任务场景进行优化,进一步提升了大模型复杂任务的处理能力。

2. #KimiK3和Fable5谁更强#看了一天的评测和案例,被K3刷屏了,Kimi K3 的100万上下文和2.8万亿参数,就已经是开启了一个新的时代,是目前全球参数规模最大的开源大模型。怕回头限购先加一个 Coding Plan,明天上课咱就用这个了~ - AA给的智能分数,Kimi K3第三,已经是仅次于Fable 5和GPT-5.6 Sol(图2)- Arena 给的前端代码能力评分中,K3 在7个领域中6个里排名第一,从上一个版本排名18位直接跃升到了第一(图3)收集了一些广告片和网友的对比视频可以看看效果感受一下~甚至还看到一个一句话案例,用下方提示词,跑了三个小时,仿出来了一套macOS系统:「在当前浏览器里搭建一套 macOS 27 系统,包含全部默认原生应用,极致还原液态玻璃视觉效果,并且所有界面组件都可以正常交互使用」效果可以看:macos27.kimi.page#How I AI#

3. 今天,Qwen3.8-Max正式版,终于发布了。 2.4T,又一个国产巨无霸,单次激活95B,100万上下文。开源模型,终于全面迈入了2T时代。今天体验了一下,综合能力大概跟Kimi K3在同一个档位,互有胜负,你要硬说谁更好一点吧,我感觉从日常的任务和开发观感上,已经很难进行区分了。但是Qwen3.8-Max的优点就在于,价格低很多,以及推理速度非常的快,$2/百万输入、$6/百万输出,是Opus 5的30%的价格,K3的50%左右。前几天DeepSeek V4 Flash的斩杀线的梗我相信很多人都看过了,在长程Agent这种海量烧Token的场景下,有时候,差不多的性能,我比你便宜,那我就是好。Qwen的Token Plan目前价格还有优惠,可以随便买,而且这次口碑确实不错,就怕后面也涨价,我自己也买了一个季卡先囤着了。然后呢,这次Qwen3.8-Max的前端很强,网页结构、视觉层级、组件细节和动效都做得不错,在后端和长程任务上也不错。但是最让我意外的,居然是写作能力。这两年,所有模型都在疯狂特化Coding和Agent。然后我们现在就看到一个很奇葩的现象,大家的Coding和Agent能力疯狂进步,然后写作疯狂倒退,甚至现在我做内容创作的白月光,还是很久以前的Claude Opus 4.6,但是可惜的是,Claude把我封了。我的白月光也没有了。但是这一次,Qwen3.8-Max,居然意外地保住了语言上的感觉。让我感觉,写作能力居然出乎意料的还不错?它能理解语气、节奏和留白,在语感上虽然有时候也有黑话,但是比较少,可以通过Skill的限制全部去除掉,居然让我有了一种,用Opus 4.6的感觉。Qwen3.8-Max,意外的居然是个综合水桶。虽然我也不想天天来回摇摆,但是事实就摆在这,新就是好,新就是棒。现在,对于觉得绝大多数人来说,Qwen3.8-Max,可能就是最近一段时间的首选了。真的是,各家的模型,现在都是独领风骚十几天。。。Qwen3.8-Max下周正式开源。但是还有一个彩蛋,是我开心的想要跳起来的。除了2.4T的这个大模型,Qwen还会开源一个供开发者们本地部署的小模型Qwen3.8-27B。千问终于想起了,两年前,他们是怎么让整个社区为之沸腾的。旗舰模型,决定一家公司的高度。小模型,决定一个生态的宽度。如果他们只开源那个2.4T的,千问我觉得还是只能叫千问。但是他们居然还要再开源一个27B的,那没啥可说的了。我愿称之为。义父。2年前的那个曾经的千问。他们好像,又回来了。#千问##AI##howiai##ai创造营#

4. #DeepSeek发布V4Pro正式版#DeepSeek官网悄无声息地更新了API文档,DeepSeek-V4-Pro-0813就这么上线了。参数很能打。100万上下文、38.4万最大输出、支持思考与非思考双模式切换。价格也摆在那:输入3块、输出6块每百万tokens,正好是Flash的三倍。官方之前预告过要“大幅涨价”,现在看,Pro就是那个“涨”的答案。从内部流出的评测看,多项测试接近Fable 5水平。定位很明确了,Pro是给复杂任务准备的,贵有贵的道理。V4双版本格局落定:Flash跑量,Pro攻坚。

5. 就在刚刚,Gemini 3.7 Flash 正式上线!主打编程、网页开发和AI Agent,支持100万Token超长上下文,还能一口气读取文字、图片、视频、音频和PDF,思考强度还能三档调节。#how i ai# 优设AIGC的微博视频

6. #智谱发布GLM5.3Flash#智谱今天这手“牛来”变“Flash”,玩得挺溜。匿名上架OpenRouter钓了一周开发者反馈,回头直接甩出MIT开源协议,320B总参数只激活18B,推理成本已经打下来,更多人也跑得起。原生多模态加100万上下文,混合注意力架构也是冲着长视频理解去的。45层深度配合稀疏注意力,长上下文服务成本大幅降低——这话从智谱嘴里说出来,比某些厂“理论成本下降”的PPT有说服力得多。关键是当晚就放权重,这节奏对开发者比较友好。GLM-5系第一枪没搞期货,没搞邀请制,开源协议也干净。接下来就看社区能用这18B激活参数玩出什么花了。反正OpenRouter上那批测试的人已经爽了一周。

7. Kimi K3 开放日:模型权重、技术报告和关键 Infra 技术同步开放

8. AI 能读 100 万字 你还在分段贴

9. 三步让AI读长资料,三分钟出摘要

10. 上下文越大,AI 越容易忘事

11. 长上下文模型总在中间丢信息、列表选错行?ACL 2026三种方案专治位置偏差与鲁棒性塌方

12. Kimi读长报告:30页只看结论和证据

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章