刷榜的AI,找不到南贤居:96年的《金庸群侠传》成了大模型考卷,Fable 5.1出门都用了4分钟

源自42位全网作者

06:15

刷榜的AI,找不到南贤居:96年的《金庸群侠传》成了大模型考卷,Fable 5.1出门都用了4分钟

发售30年,这款老游戏成了AI的照妖镜

9月3日,微博博主"斌叔OKmath"(橙旭园CEO,粉丝109.9万)发了一条长帖:他把1996年的《金庸群侠传》做成了测试大模型长程任务(long-horizon)能力的沙盒——crpg-bench。微博评测方式简单粗暴:给模型看游戏截图,模型决定动作,程序执行,循环往复,最终目标是集齐14本天书通关。模型拿到的,就是这么一幅画面:

刷榜的AI,找不到南贤居:96年的《金庸群侠传》成了大模型考卷,Fable 5.1出门都用了4分钟

他给自己定了个时间窗:20分钟,谁探索得最多谁厉害。为了避免模型全程无意义烧token,他还专门写了一套SKILL,让模型对游戏任务和操作有基本认知。微博

结果,对玩过原版的三十多岁人来说,有种哭笑不得的解气。

榜单:4分钟出新手村,没有一个找到南贤居

他在帖子里贴出了20分钟内能顺利走出出生地的模型名单和时间。微博

  • Fable 5:3分钟

  • Fable 5.1:4分钟

  • Opus 5:5分钟

  • Sonnet 5:6分钟

  • Gemini 3.7 Flash:12分钟

然后补了一刀:上述模型没有一个成功找到南贤居。微博而他测过的一部分国产模型,连出生地都出不去。他的结论是"Anthropic和Google的模型在VLM上做的功课可能比国产多一点"。

考虑到这个榜的观感太抽象,他又替不玩游戏的人翻译了一遍:"3分钟出家门、20分钟没找到南贤居,就是早上上班不刷牙不洗脸、光着身体才找到家门口走出去,然后20分钟找不到公交车站——放现实中就是痴呆水平。"扫荡家里宝箱这种RPG基操,没有任何一个模型做到;“游戏完成率0.01%,和清档重来无区别”。微博

观察trace能看出毛病出在哪:模型把大量时间花在基础视觉探索和重复、无效的动作上,“每步思考看似合理,连起来一直在原地打转”。这条评测做完,他自述对AGI的判断从bullish转bearish。微博

为什么卡住AI的,偏偏是这盘老游戏

帖子给的原因相当圈内,拆开看全是老玩家的肌肉记忆:

第一,它是彻头彻尾的长程任务。开放世界,升级、招人、打怪,集齐14本天书才能触发结局——目标奖励远在几百步之外,中间全靠自主规划。

第二,画面本身就是VLM地狱。2.5D斜45度视角+320x200分辨率,他的原话是"怪视角+渣画质+分布外"。模型拿到的不是什么清晰UI,而是山河、道路、人物糊在一起的1996像素包。

第三,老攻略杂志的隐性知识是悬崖。虽然是开放世界,但开局必须先找南贤北丑,“不然寸步难行,而且很容易误闯故事线直接被打死”。开局不先问路,转头就撞进剧情的下场大致是这种局面:

刷榜的AI,找不到南贤居:96年的《金庸群侠传》成了大模型考卷,Fable 5.1出门都用了4分钟

96年的人靠攻略杂志和机房口口相传,模型只能自己猜。而老玩家都知道,这江湖的第一步本该从这里迈出:

刷榜的AI,找不到南贤居:96年的《金庸群侠传》成了大模型考卷,Fable 5.1出门都用了4分钟

这就是这篇评测最有意思的地方:AI卡住你的,不是比你当年更难的事,而是你20分钟就趟平、之后嫌它简单的事。你觉得"出家门找南贤"理所当然,它今天到不了终点。

魔幻对照:不会"玩"的模型,正在像素级"复刻"它

更值得玩味的对照发生在一个半月前。7月21日,知乎用户YuWong发文《Fable 5像素级复刻金庸群侠传(Godot版、以及纯Html+JS版本)》:把DOS原版直接丢给Fable 5重写成Godot版。知乎按他的说法,第一版"有模有样但细节差异很大"——因为模型主要在参考已有的开源复刻,并非真正逆向。于是他反复在提示词里强调"基于原版逆向还原、不要参照现有开源代码",配合人工测试反馈迭代,最终成品"几乎以假乱真"。顺带把DosBox时代的痛点全扔了:MIDI播放不再卡顿、低延迟高刷、跨平台,还能用Godot的调试命令行让AI自己跑大量测试,甚至加上了自动存档。

同一代模型,一边找不到南贤居,一边把游戏本体复刻得以假乱真——把这两件事放一起看,结论其实很清楚:人类智慧的"成品"(代码、素材)在分布之内、可被机器验证,AI已经能抄作业;而"过程"(盯着糊成马赛克的画面,在几百步里自己形成计划、纠错、达成目标)才是当前大模型的真正短板。这也是斌叔吐槽的点:X上那些one-shot做小游戏、做3D渲染的炫技,“只能说明模型从训练分布里采样采得好”,测不出真智商。

现在的群侠传,正被AI从两头夹击

把这条线拉长,2026年的《金庸群侠传》社区是个罕见的双向现场:

创作者在用AI续写江湖:B站上用Seedance 2.0做的《金庸群侠传2》AI同人动画已经出到第二集。哔哩哔哩一个UP主用AI+Godot把金庸X和江湖十一捏成免费武侠游戏,两个多月干到1.5万播放。哔哩哔哩此前连不会写代码的人都能用AI搓出免费EA的《群侠传:幸存者》。

工程师在用老游戏考AI:crpg-bench、像素级复刻,连微博社区里都出现了"搞懂现在本地部署大模型,有种回到96年为了跑《金庸群侠传》捣鼓config.sys和autoexec.bat的感觉"的怀旧类比。微博

三十年前,这游戏是国产单机向开放世界伸的第一次手;三十年后,它成了中文互联网少有的"长程+视觉+决策"能力标尺。一个96年的老游戏,最后既被用来致敬AI、又被用来审判AI,这事放整个华语游戏圈也是独一份。

这份榜单该怎么读,下一步看什么

先把边界说清楚,再给行动建议:

  1. 这是个人评测,不是官方榜。样本量、环境搭建、SKILL提示词、20分钟时限全是斌叔一手定的,数字供谈资可以,供结论还得再等等。

  2. "完成率0.01%“测的是探索下限,不代表策略天花板。十四天书收集路线、野球拳、战棋配队这些深水区根本还没测到,别拿它直接推导"AI玩不了策略”——真正的原版玩家看到这张界面,可太知道水有多深了:

刷榜的AI,找不到南贤居:96年的《金庸群侠传》成了大模型考卷,Fable 5.1出门都用了4分钟

  1. 但它的价值也恰恰在这:这是目前少有的、能看见回放和trace的中文长程任务基准。作者公开了prompt和评测回放——手上有模型和harness的朋友,可以复制去跑一把,看看自家模型几分钟出家门,比围观跑分实在。微博

想重玩青春的也别只盯着DosBox了:知乎那篇Godot复刻、B站正在日更的《桃源念》2.20通关系列都是现成入口——但注意,原版版权和自制的边界都还在,二创归二创,别为"情怀整合包"掏钱买来路不明的东西。

最后留个群聊谈资:下次再有人跟你聊"AI什么都会了",把这份榜单甩过去——2026年最贵的那批模型,花4分钟才走出《金庸群侠传》的出生地,花20分钟没摸到南贤居。它们还没跑赢的,是1996年那个暑假,坐在屏幕前一下午想清楚第一站先去哪的你。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章