最近这一周,"AI做逆向"这事在技术圈连着炸了好几张实战成绩单,密度有点不寻常:
8月24日,有开发者全文翻译了一篇海外实测——把一个商业软件的许可证验证系统丢给开源权重模型Qwen 3.8 27B,模型在一台本地工作站上花了30分钟把整套机制拆了个底朝天,连厂商刻意混淆的RSA公钥都挖了出来。微博 同一天,知乎上一篇讲开源项目reverse-skill的文章开始被转发,这个项目一个月内星标冲到一万多,干的事就是教AI编程助手"怎么像模像样地做逆向分析"。知乎 再往前,8月19日有Unity开发者复盘了用一周人机协作,逆向了Unity从不公开文档的Profiler通信协议,做成了开源工具;而5月那篇爆火的《大航海时代2的逆向工程实验》,8月下旬又在微博被人以"比乎神帖"的名义翻出来讨论。微博 四个案例方向完全不同——软件保护、老游戏结构、闭源协议、流程工具——但回答的是同一个问题:逆向工程这种以前默认属于资深玩家的硬活,现在AI到底能接手多少?
我把四篇全文加评论区都翻了一遍,交叉对比之后,结论值得说道说道:能干,而且比很多人想的能干;但AI干什么、不干什么,界限划得非常清楚。想上手的人,先看清边界再掏时间。

先看成绩单:这四个案例各自干成了什么
案例一:本地27B模型拆掉商业软件许可证验证。
原作者Adam Conway扔给模型的目标,是他自己付费购买、正在使用的一款商业应用。过程有几个细节值得咂摸:他先试着用越狱提示词让模型"假装这是我们开发的应用",模型直接识破,还点破了签名证书显示他并不是开发者。知乎 改成"审计我自己买的这份软件"的口径后,模型才开始干活——全程纯静态分析,反编译框架、翻数千行arm64汇编、把安全函数映射到调用点,最后把供应商藏在二进制里的RSA公钥还原了出来,还用作者机器上的正版许可证验证了签名确实匹配。
模型给出的弱点报告也专业:密钥尺寸远低于现代标准、全离线校验意味着密钥泄露只能靠推送更新撤销、所有检查都在本地代码里所以理论上都能打补丁。
最让我意外的是中间一个插曲:第一次重建密钥时,签名校验过了,但二进制里一个完整性哈希对不上。按原作者的说法,大多数模型到这儿就宣布完工了,Qwen却自己指出不匹配、从头再来,反复迭代到逐字节吻合。微博 最后它还把发现变成了一个能跑的概念验证——作者把自己合法许可证挪开、运行脚本,绕过了。
30分钟,一个作者估计"人类工程师要花更久"的活。但原文的免责声明同样重要:只有一个应用、一次运行,目标难度不明,作者自己都说不会把一个成功外推成模型能逆向一切。知乎
案例二:《大航海时代2》实验——80%的体力活被接走了。
这篇894赞的长文做的事,是把1994年这款游戏的内部结构——数据表、剧本字节码、剧情拓扑——从二进制里完整抠出来。几个数字很说明问题:5800条游戏文本,AI半天给出粗分类,作者花两小时筛错,纯手工至少要两到三周;48个chunk、186个subscript、745条派发边,AI半小时画完拓扑图,手画要一周。知乎

作者的总结非常克制,我认为是目前对"AI逆向能力"最准确的定位:按工作量算,AI是主力——项目里80%以上的时间花在整理、归纳、对齐、记账上,这些基本全交给了AI。知乎 按判断权重算,AI还是助理——opcode到底是什么语义、某条边是控制流还是误识别,必须靠反汇编器、调试器和最小实验去压实。
他有一句原话值得所有想上手的人记住:逆向工程里最危险的就是"看起来合理",AI在这一层会猜,且经常猜得读起来很通顺。知乎

案例三:一周逆向Unity闭源协议,靠的是"证据链"纪律。
这位开发者的目标很冷门:Unity编辑器的Profiler到底怎么跟手机通信?官方从不公开,网上流传的说法大多以讹传讹。他和AI用一套四步循环推进:抓包→比对→假设→实验。AI的角色是"实验仪器制造商"——中间人抓包工具、diff工具、假Player、测试用例全是AI写的;但"下一步验什么"永远由人拍板。知乎 一周下来,他们纠正了一个流传很广的错误说法:所谓Profiler走tcp:55000直连,实测USB通道走的是Unix抽象套接字。团队还原了消息头布局、GUID常量、版本编码规则,最终做成一个脱离Unity Editor的性能分析Agent并开源。
这个项目里最硬核的一句话是关于注释的:"逆向项目的代码注释不是解释代码的,是保存证据的——三个月后没人记得某个魔数是哪来的。"所有结论都落成"实测自Unity 2022.3真机"的记录。知乎 这恰恰是AI最容易缺的东西:它给你结论,但不自带证据链,证据链的纪律得人来上。
案例四:reverse-skill一万星,说明大家已经被"裸跑AI"坑够了。
这个项目的走红本身就是个信号。作者吐槽的场景很多人眼熟:让AI分析一个APK,它上来就"用jadx反编译",jadx没装;“那用apktool”,也没装;最后建议你装IDA Pro。工具瞎猜,流程瞎选,同一个错下个项目接着犯,“像一个永远不做笔记的实习生”。
reverse-skill的解法很朴素:给AI装一套"分诊台"。先查本机装了什么工具、判断任务类型、确认授权范围,再按决策树一步步执行;没有scope(授权范围),不许碰目标。知乎 它覆盖APK、iOS、二进制、.NET、JS去混淆、恶意软件分析、CTF、固件等场景,依赖Java、Node 22+和Python,门槛不低,零基础的人光靠它出不了活——它更像是把老工程师的经验变成AI能读的规则,给有基础的人加速。

四个案例摆在一起,AI的真实位置就清楚了
把四件事拆开看,会发现AI逆向的能力谱系高度一致,大致是三层:
体力层:AI已经是主力。 批量分类、对齐、记账、写工具脚本、画拓扑、跑检查——这些"看见了但还没组织起来"的脏活,传统逆向里一半的工作量,现在基本可以整体外包给AI。大航海实验里这是数量级的效率提升,Unity项目里"脏活累活AI写得又快又好"。
分析层:能用,但必须验证。 还原结构、识别模式、从汇编里找关键函数——AI已经能打出有效战果,Qwen还原混淆密钥就是例子。但这一层的产出默认带"疑似"标签:符号信息全的时候它很强,混淆堆上去,效果就打问号。
判断层:人说了算。 语义确认、真假阳性裁决、结论落证据——三个案例的作者不约而同地把这一层留在自己手里。大航海作者用反汇编器和最小实验逐条钉死高置信结论;Unity作者坚持"人负责用真机把规则逼出来"。
还有一层没人明说但都默认的前提:这套玩法里,AI没有替代任何一个传统工具。反汇编器还是反汇编器,调试器还是调试器,AI接手的是中间那一大段"材料已经摊开、但还没变成结构"的地带。
三条边界,想上手的人先看完
第一,混淆和符号依赖是真实存在的天花板。
Qwen那篇文章的评论区里,有安全从业者泼了盆冷水:裸的二进制逆向代表不了什么,LLM逆向现在过于依赖符号,混淆堆上去很容易把模型的注意力打散。知乎 这条反证很重要——商业保护级别的混淆模型已经能啃,但更极端的对抗性混淆呢?目前没有公开验证。评论区还有一条补充信息:有人认为DeepSeek-v4-flash的逆向表现比Qwen 3.8 27B更好,也有人建议关掉"思考"模式提速。模型选型本身就是个未定论的开放问题。
第二,部署成本别想得太美。
Qwen那个"本地运行"的前提是一台搭载英伟达GB10芯片、128GB统一内存的紧凑型工作站。模型权重本身约17GB,而评论区有人实测24GB显存的RTX 5090,结果是爆显存、非常的慢。知乎 所以"消费级显卡就能跑"这句话得打个折扣——能跑和跑得动是两回事。没有大内存机器的话,云端模型或订阅制Agent是更现实的起点。
第三,光有模型不够,能力长在"流程纪律"上。
reverse-skill一个月冲一万星,本质上是大家集体意识到:模型能力到位之后,瓶颈转移到了路由、授权管理、验证习惯这些工程纪律上。大航海那篇的评论区已经有人把同样的方法用在《仙剑奇侠传》DOS版和《轩辕剑2》的逆向上——可复用的从来不是某个游戏的结论,而是"AI摊开候选加置信度、人用实验钉死"这套工作流。知乎

如果你真想上手:三条路线,按成本自己挑
路线一:零硬件成本,先用订阅工具碰低风险目标。 Unity那篇作者的经验值得抄:他一个API Key都没有,靠手里的Codex和Cursor订阅就把项目做完了。知乎 用他的话说,站在协议的肩膀上,比站在API的泥地里好。目标从低风险开始:自己怀旧老游戏的结构研究、合法购买软件的行为分析、开源项目的协议理解。今天小红书上都已经有人拿大模型复原2001年《半条命》的老启动器了,玩法门槛比想象的低。小红书
路线二:有编程基础的,装一套技能包再开工。 reverse-skill这类项目的价值是帮你少踩"工具瞎猜"的坑。预期管理好:Java、Node 22+、Python的依赖装起来够喝一壶,部分文档偏简略,预留一两个晚上踩坑。知乎 装完先跑一遍工具索引,再按决策树接任务。
路线三:要认真做本地逆向的,门槛在内存。 128GB统一内存级别的机器是这次实测的基准配置。本地方案的核心价值不是省钱,而是"二进制、许可证和分析过程全程不出机器"——分析专有代码、机密代码或者恶意样本时,这是刚需。但这也是双刃剑:没有云端监督,用它干什么完全取决于坐在键盘前的人。知乎
最后说两件别碰的事
一是授权边界。Qwen案例里有个细节很妙:模型识破越狱提示、拒绝替"冒充开发者"的人干活,是整个流程里最先发生的事;大航海实验的作者也明确切割——目标是结构研究,和破解、金手指、外挂无关。知乎 只碰自己合法拥有的软件和拿到授权的目标,这条线在AI把逆向门槛拉低的今天,反而比以前更重要了。
二是别把"看起来合理"当终点。AI给的每一个通顺结论,都要问一句证据链在哪。逆向这行的老规矩在AI时代依然成立:没有实测记录的结论,就当假设处理。
接下来值得持续盯的信号有三个:DeepSeek-v4-flash这类"据传更强"的模型会不会出现更多公开验证;模型厂商对"审计可以、绕过不行"这条灰带的态度怎么演化;以及reverse-skill这类领域技能包的星星增长——它是"AI从通用助手走向专业助手"这个趋势最直接的体温计。
AI逆向这事,已经不是"能不能"的问题,而是"谁先把流程纪律建起来"的问题。