Karpathy一天400万浏览的新帖,借的是40年前的飞机维修手册治AI废话:急着抄「四层输出阶梯」之前,先把活儿对号,再带走这两句中文提示词

源自166位全网作者

10-06 11:01

国庆假期,AI圈被Karpathy的一条帖子刷屏了。

10月2日,他在X上发了一段话,开头就戳中了很多人的日常——我们今后会花多得多的时间,去理解语言模型的输出。然后他给了一套完整办法:让AI用一份40年前的航空写作规范来解释问题;不够,就让它画图;再不够,让它做交互式网页;他最看好的,是让它给你生成一条完全定制的讲解视频。这条原帖据博主援引的统计,一天就冲过了400万浏览。假期里中文技术圈全线跟进——机器之心发文、知乎冒出十几条讨论和实测、微博有人喊出“ASD-STE100 + HTML成了AI圈新的魔法数字”。知乎哔哩哔哩微博

Karpathy一天400万浏览的新帖,借的是40年前的飞机维修手册治AI废话:急着抄「四层输出阶梯」之前,先把活儿对号,再带走这两句中文提示词

为什么这事值得你停下来看?因为它点破了一个你大概率已经遇到、但还没总结过的痛点:AI越来越能干,输出却越来越长。“再简单一点”成了肌肉记忆,追问三轮,还是一堵字墙。Karpathy的判断是,未来人的工作会从“让AI干活”上移到“监督和理解AI交回来的结果”——而“理解”这件事本身,也可以让AI帮忙,前提是你得会挑输出形式。

第一层:治好废话的,是一本飞机维修手册

最反常识的是第一层。Karpathy说自己“用得很顺手”的办法,是让大模型用ASD-STE100来解释问题。

这是上世纪70年代欧洲航空业搞出来的受控语言规范。当时维修体系越来越国际化,英文维修手册要交给不同语言背景的技术人员看,要求每一句话只能有一种理解。于是航空业主动给英语上了枷锁:最新版Issue 9包含53条写作规则、约900个批准使用的基础词,还有约1200个建议避免、并给出替代表达的词。规则朴素得很——程序性指令一句尽量不超过20个词;一句话只安排一个操作;尽量用主动语态说清谁做什么;同一个概念从头到尾只用同一个名字。36氪

最后这条你肯定有感觉。大模型为了显得文笔“丰富”,特别爱换同义词,同一个东西一会儿叫“该功能”一会儿叫“此机制”,读到第三段你已经忘了它们是不是一个东西。ASD-STE100的思路正好相反:能叫一个名字,就一直叫这个名字。

Karpathy也知道整套规范对日常对话太严,所以他的实际用法是要求“做到ASD-STE100的八成”——借它的骨架,不锁死它的血肉。知乎

Karpathy一天400万浏览的新帖,借的是40年前的飞机维修手册治AI废话:急着抄「四层输出阶梯」之前,先把活儿对号,再带走这两句中文提示词

第二到第四层:图不够,网页来凑;网页不够,视频伺候

往上走,是形式的连续升级。

Karpathy一天400万浏览的新帖,借的是40年前的飞机维修手册治AI废话:急着抄「四层输出阶梯」之前,先把活儿对号,再带走这两句中文提示词

第二层,图表/图像:与其让AI写文字,不如让它画一张图,图表往往更容易消化和解析。

第三层,网页:在提示词里加一句“用HTML输出”,就能得到一个带布局、动画甚至交互的页面。Karpathy举的例子很具体:想理解神经网络里的学习率,文字只能告诉你“太小收敛慢、太大易震荡”,网页可以直接放一个滑块,你自己拖动,看着小球的下降轨迹实时变化——这时模型已经不只是在“解释”,而是临时给你做了一个帮助理解的小工具。36氪

第四层,讲解视频:他最看好的形式,是让模型“为X制作一个3b1b风格的讲解视频”。3b1b就是3Blue1Brown,那个用程序化动画把抽象概念一步步“演”出来的知名频道。配音可以接ElevenLabs的API,没有API密钥,就让模型帮你找能在本地跑的免费替代方案。知乎

这层不是空想。开发者Tibo看到帖子后马上实测,只给了一句“解释一下Shazam是怎么工作的”,模型就生成了一段专门讲解Shazam原理的视频。Karpathy给这类产物起了个名字:大型、定制、用完即弃的软件产物。放在过去,“为一个问题专门做一段动画”根本不划算;当智能和代码都越来越便宜,用完就扔反而成了合理选择。36氪

社区接招:有人做成了Skill,也有人泼冷水

这几天中文圈的接招速度相当快。微博上有人把ASD-STE100整理提炼成中文版文档,放进自定义指令里直接用。GitHub上一个三个月前就做好的开源项目asd-ste100-skill被翻了出来,它把这套规范用在工具描述、报错信息、Agent之间的指令和系统提示词上,还分了两种模式:Strict适合误读成本高的程序步骤,STE-flavored适合README这类解释性文本。B站博主还提到,有人已经把四层玩法写进了CLAUDE.md配置。微博36氪

Karpathy一天400万浏览的新帖,借的是40年前的飞机维修手册治AI废话:急着抄「四层输出阶梯」之前,先把活儿对号,再带走这两句中文提示词

但冷水同样真实。Hacker News上就有人直言:格式治不了废话——输出长得像手册,内容照样可能是错的。哔哩哔哩

最有价值的反证,来自知乎上一篇受控中文小测试。作者用DeepSeek V4 Pro、GPT-6.1-sol、Kimi K3、GLM-5.3等模型,对比了四种提示方式:默认、只提ASD-STE100的名字、只提CNL(受控自然语言)的名字、自己手写一套具体规则。结论相当冷静:知乎

其一,名字确实能当“风格锚点”。GLM默认回答里把冰淇淋和溺水称为“同伙”、说它们不是“凶手”,Kimi爱用“幕后推手”“我推你”这类修辞——加了名字之后,这些比喻和聊天式展开明显少了。

其二,效果很不稳定。GPT的默认回答本来就带着“可能”“如果其他条件也控制得当”这类限定,再加名字,看不出额外好处。名字管不管用,得看模型原本怎么写。

其三,也是最隐蔽的坑:歧义变少,有时只是把说过头的判断表达得更干脆了。DeepSeek在CNL组介绍随机对照实验时直接写“结果的差异只能归因于处理本身”,而ASD组和具体规则组用的都是“主要来自”“更可能来自”。作者那句话值得抄下来:文字读起来像技术手册,并不代表内容经过了技术审查。知乎

其四,模型在结尾自称“已遵循STE100原则”,不能当证据,要看它实际写出来的东西。

小红书上也有实测者给出差评:这些方法非常依赖模型能力,“现在效果不尽如人意”。连一些正面介绍的实测者也承认,简单问题加不加规范看不出区别——内容越复杂(长技术解释、多步骤操作、Agent之间传信息),效果才越明显。小红书36氪

知乎上还有人提了个更细的追问:把答案做成精致的可交互页面,用户会不会更快相信结果,反而少核对一步?交互能响应,计算仍可能出错。知乎

对号入座:你的活儿该用哪一层

把各方信息拼起来,这套四层玩法的正确打开方式不是全盘照抄,而是按任务对号:

  • 日常问答、三五句话能说清的问题——别折腾,默认输出就行,加规范纯属仪式感。

  • 长技术解释、操作步骤、排障文档、给同事看的交接材料——文字层就够,一句“借鉴ASD-STE100的受控表达原则”是成本最低的改造。

  • 结构、流程、对比类内容——让它画图,一张图胜过三段字。

  • 需要调参数、比阈值、看数据分布的东西——让它出HTML交互页,把“解释”升级成“小工具”。

  • 学一个全新概念、想被人带着走一遍——生成讲解视频。成本最高,留给真正值得的内容。

中文场景可以直接贴的两句话(来自那篇知乎受控中文小测试,专门为中文改造过):

请借鉴 ASD-STE100 的受控表达原则,用自然中文解释。保留必要的前提、适用范围和不确定性。

请使用受控自然语言(Controlled Natural Language, CNL)风格的中文解释,把术语逐个定义清楚,保留必要的前提、适用范围和不确定性。

注意是“借鉴”而不是“严格遵守”——这套规范是给英文技术文档设计的,中文只能借原则。另外,“保留前提和不确定性”这半句千万别省,它是防过断言的保险丝:前面说了,受控表达最大的风险就是把“可能”写成“必然”,还写得特别干脆。知乎

最后说三点带走的东西

第一,这套办法不会让AI更聪明,只会让AI的产出更容易被你理解和检查。它省的是你的阅读成本,不是生成成本——如果你现在的痛点是答案不对而不是答案太长,这四层帮不了你。

第二,从最便宜的一层试起。一句提示词零成本,先看文字层能不能解决你八成的“废话痛”,再考虑网页和视频,别一上来就为每条回答生成动画。

第三,留两个观察信号。一是模型厂商会不会把这种“可理解性”内化成默认输出。那位小红书差评帖主的判断是,这在不远的未来会发生。真到那天,今天的技巧就会像当年的“提示词模板”一样退役。二是asd-ste100-skill这类项目在Agent生态里的扩散速度,如果它变成智能体的标配,“AI说人话”就从个人技巧变成了基础设施,届时你该关心的会是下一个问题:AI说得太顺、太像手册的时候,谁来替你把最后一道关。小红书

内容由AI生成
1
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章