如果你最近也在纳闷"AI输出怎么越用越不稳",这两天知乎上集中爆出来的几篇文章,值得花三分钟看完。它们表面各说各的,拼在一起却指向同一个结论:AI不好用,问题可能根本不在你以为的提示词上。
一场实验,把"提示词越写越长"的路堵了一半
先说今天最硬的一条。知乎上一篇22因子实验的文章:作者设计了一个2×2对照实验——同一个归类任务,提示词分详细版(多加了7个分析、检查步骤)和简短版,资料分完整版和故意缺4条的不完整版,每组独立跑5次,共20次,最后由独立评分环节盲评。知乎结果有点反直觉:
资料从12条补齐到16条后,任务覆盖率从47.37%直接干到100%;
而那套"更详细的提示词",对所有质量指标的主效应是零,只多烧了约200个输入token。
翻译一下:资料缺的时候,提示词写出花来,AI也变不出输入里不存在的信息;资料给全了,多加步骤基本没用。

当然,这个实验自己把边界说得很清楚:它只测了一个封闭归类任务,每组5个样本,推不出"提示词无用论"。它能支撑的结论是——当任务本身已经明确时,继续往提示词里堆步骤,没有观察到任何收益。
为什么这周的讨论集中爆发
因为这事戳的是真痛点。同样在知乎,有人把团队八月份攒的提示词从头到尾盘了一遍:收藏夹里躺着几十条,每天真正在用的就三四条,剩下全是"一次性消耗品"——某次跑出个漂亮答案,收藏,然后再也没用过。知乎原文那个比喻特别狠:跟收藏健身视频一样,收藏的时候觉得自己马上要练成彭于晏,然后就没有然后了。
小红书则是同一件事的另一面。7月那条《一条封神!目前为止我用过最惊艳的提示词!》,点赞18万+、收藏超20万。小红书大家都在疯狂囤,但很少有人问一句:囤完之后,输出该翻车还是翻车,为什么?
再加上八月本来就是模型换代季——DeepSeek刚给V4 Flash装上"眼睛",多模态评测里多项成绩逼近顶级模型,各家新模型密集上线——"模型变强了,我怎么没变强"的落差感,这周格外明显。36氪

病根一:缺的是资料,不是指令
这周的讨论里有个机制被反复说透:AI输出的上限,很多时候由你给的上下文决定,而不是由你的措辞决定。
听起来像常识,但真干活时,大多数人的第一反应是去打磨措辞:加角色、加步骤、加一句"写专业一点"。可"专业"这俩字,每个人定义都不一样。真正缺的信息——活动是什么、给谁看、手头有哪些数据、验收标准是什么——一样没喂,AI只能猜。知乎每次猜的方向不同,输出自然时好时坏。
那个实验还揭开了一个困扰很多人的谜:它把"说得对不对"和"覆盖得全不全"拆开,发现资料不全时,AI答出来的部分照样100%准确,但只覆盖了一半任务。这就解释了为什么有些回答"每句看着都对,整体就是差口气"——它没说错,它只是没说完,因为缺的那部分你没给它。
病根二:你还在用弱模型时代的提示词,指挥强模型
还有一个更隐蔽的变化。知乎上一篇讲"任务契约"的文章说得很直白:旧提示词是为了照顾弱模型设计的,把任务拆成固定路线——先查A、再改B、别碰C。对弱模型这是扶手,对强模型可能变成围栏。知乎他举了个真实案例:让AI排查订单系统的bug,提示词里写死"先查重试函数,不要动消息消费逻辑"。结果AI在错误的地方把补丁打得漂漂亮亮,测试全过,线上问题照旧。不是AI笨,是它太听话——你把"你的怀疑"写成了"事实",它就老老实实照着你的怀疑执行到底。

官方口径也在转向。OpenAI在GPT-5.6提示词指南里明确建议写"精简提示词":指令只写一次,别反复要求模型多思考。他们内部coding agent评测里,精简后的提示词分数提升10%—15%,token成本降了三成以上。知乎文中也注明这是特定样本,不能直接外推,但方向很清楚。Anthropic也有个类似的说法:提示词是地图,任务是领土,地图永远有没画到的地方——与其试图一次画全,不如标清楚"哪里是未知,先探查再定"。
一个排查顺序,下次翻车照着走
把这周的信号合起来,可以整理出一个排查顺序。下次AI输出不行,别急着换提示词,按顺序问四个问题:
第一问:信息给全了吗? 这个任务需要哪些事实、材料、背景?我喂给它了吗?——大部分翻车到这一步就破案了。
第二问:目标和验收标准清楚吗? 输出给谁用、什么算合格?你自己说不清,AI就只能猜。复杂任务可以让它先列出"还缺什么信息"再来问你,多花两分钟问路,省的是后面二十分钟返工。知乎
第三问:这条提示词是给当年那个弱模型写的吗? 如果你还在给强模型一步步指定路线,试试改成"给目标、给边界、给验收证据、说清哪里拿不准要停下来问"。
第四问:前三个都过了还不行,再修措辞。 到这一步才轮到"怎么问"——这一步其实比大多数人以为的少得多。

顺带说下适用边界:这套逻辑主要针对"让对话AI干正事"的场景——写文案、做分析、出方案、跑任务。如果你玩的是图像、视频生成,提示词更像调参数,逻辑不完全一样,别硬套。另外,如果你只是偶尔拿AI聊聊天,这套也不用上,直接问就行。
收藏夹该留什么、该删什么
趁这波讨论,正好清一清提示词收藏夹。对照这周的复盘,给个清单:
值得留的三类:
修复类——输出翻车后用来补救的那几句修正指令,翻一次车攒一条,这才是越用越值钱的部分;
模板类——规则固定,只替换产品名、数据、目标读者这几个变量,换个任务照样能跑;
先问后写类——让AI先问清缺什么信息再动笔的指令。
可以删的三类:
一次性惊艳款——当时跑出过好答案,但场景不可复现;
只有"写专业一点""高级一点"这种模糊风格词的,说了等于没说;
把具体任务路线写死的指令——“先查XX、别碰XX”,模型换代后最容易变成围栏。
最后提醒一句消费层面的:别因为焦虑去买什么"指令包"“提示词课”。微博上长期用AI干活的人早就劝过:大模型更新太快,老旧指令淘汰得也快,这钱真没必要花。微博
写在最后
这波讨论其实是AI圈难得的一次"祛魅":提示词技巧不是没用,而是它的位置该摆正了——它解决"怎么表达",解决不了"给什么"和"怎么验收"。
今天就可以做一件小事:打开你的提示词收藏夹,数一数最近一个月真用过的有几条。如果只有三五条,别焦虑,这很正常——把真正好用的留下,把省出来的精力花在喂资料上。
你囤的提示词,真用上的占比有多少?评论区聊聊。