先说个现象。这个8月你去B站搜"自动化测试",会看到一种罕见的热闹:8月22日一天之内,既有《2026年软件测试新趋势:AI+自动化测试保姆级入门,Agent主导Web/接口自动化测试》这种播放两千多的教程,也有《【AI测试skills】B站讲的最好最细的AI测试教程》这种标题党,中间还夹着《天塌了!软件测试被AI测试全部替代》这样的唱衰爆款。知乎这边也一样,有人认真写Playwright实战,有人推销测试培训课,还有人吐槽"让AI写个功能,它先给你造了几万行测试,功能反而没写完"。
噪音很大,但变化也是真的。这篇不聊测试行业会不会消亡——那是谈资,不是决策。我们只算一件事:2026年做Web自动化测试,大致是三条路线,各自要花什么钱、踩什么坑、适合谁。
先认一个前提:框架战争已经结束,争论换地方了
如果你最近半年没关注这块,先补个背景:UI自动化框架的选型之争基本打完了。知乎近期的选型文章几乎都默认同一个结论——Playwright凭借直连浏览器内核、内置智能等待这些能力,已经是现代UI自动化的主流方案,讨论的重点从"用哪个框架"变成了"脚本由谁来写"。
证据之一是那些纠结迁移的帖子。8月有工作室写文章说,最近半年陆续有三四个团队来问同一个问题:"Selenium跑得好好的,要不要换Puppeteer?"他们的回答很实在:见过太多团队跟风换框架,折腾两周,速度只提升百分之十五,值不值看自己的账。知乎这句话其实就是今天整个测试圈的主线问题——不是技术行不行,是账算不算得过来。
路线一:手写脚本(Playwright/Selenium),老办法,账最清楚
这条路大家都熟:工程师手写Playwright或Selenium脚本,配Pytest/JUnit,挂在CI里跑回归。

它的成本结构是三条路线里最透明的:开源免费,执行成本只有CI机器时间,真正贵的是维护——页面一改,用例就得人肉跟进,flaky(时过时不过)用例更是长期消耗。有技术文说得直白:这类脚本常常是第一次能跑、改两次页面就全红的重灾区。知乎这些都是脚本路线的日常税,连Trace Viewer这类官方调试工具也只能帮你查得快一点,不能帮你免掉。

但它的优势也硬:完全可控、可审计、无供应商依赖,断言逻辑是人自己想清楚的。对核心资金链路、下单支付这种用例,手写脚本目前依然是最可靠的形态。
路线二:商业一站式AI测试平台,买的是管理,不只是执行
今年冒出来不少"一体化全链路"商用测试平台,卖点是Web、接口、移动端、小程序全覆盖,用例管理、缺陷闭环、私有化合规一起打包。知乎8月就有《2026年自动化测试平台对比》这类文章,不过提醒一句:这类对比文不少是厂商软文,看个方向可以,榜单别全信。
这条路线的账是订阅费/许可费,按席位或按项目算,一年下来对小团队是实打实的固定支出。它真正值钱的不是"AI执行",而是用例资产管理、权限审计、报告合规这些组织能力。反过来说,如果你只有两三个开发、十几个核心流程,买平台就像为三人小灶请了个中央厨房。

路线三:Agent直接开浏览器,最热的路,账也最容易被忽略
这是今年声量最大的一条。微软去年开源的Playwright MCP,把大模型直接接进真实浏览器,用7月底一篇实测文章的话说,是让"用自然语言驱动自动化测试"从概念变成了可落地的流程。知乎你只给它一个业务目标,它自己看页面结构、自己决定点哪个按钮——有实战文把这总结为LLM Agent和传统自动化脚本的本质区别。知乎B站那些"Agent主导测试"的教程,底层基本都是这个思路。
不过,真正让这条路线从野路子变成正规军的,是框架官方的动作:Playwright 1.56版本引入了三个内置的Test Agents——planner、generator和healer。Playwright官方文档三个Agent的分工很清晰:planner负责探索应用,产出Markdown格式的测试计划;generator把计划转成可执行的Playwright Test文件;healer负责执行测试套件,并自动修复失败的用例。官方还给了个seed test的概念:先写一个种子用例,把环境初始化和操作范式立好,planner会照着它生成后续所有测试——这等于给Agent划了边界,不让它自由发挥。

门槛也不高:一条npx playwright init-agents --loop=claude命令就能把Agent定义装进项目,在VS Code 1.105及以上版本里就能用;而Playwright主线版本已经滚到了1.63系列,这个迭代速度说明官方在持续下注。
它的启动成本几乎是零,而且能干脚本干不了的事——探索性测试、陌生页面的冒烟检查。但两个成本很容易被演示视频掩盖。第一是token费。Agent每走一步都在消耗模型调用,遇到不稳定的页面还会反复重试。8月知乎有篇Codegen+Skill方案的实战文,动机写得很明白:尽可能降低大模型的Token消耗,让真人先录制操作,AI只负责把录制结果整理成可执行脚本。知乎连最热衷的布道者都在想办法省token,你就知道这不是小钱。

第二是"AI过度测试"这个新坑。有开发者吐槽:让Agent写个功能,它给你造了座堡垒,边界条件堆满几万行测试,功能反而一直没写完。更麻烦的是审查成本倒置:AI为了拟合测试花掉大量时间,真正的功能实现不断推后,而当AI在猛猛输出PASS的时候,这些测试人类自己都没有仔细看过。知乎测试从太少变成了太多,审查成本换了个形式回来。

三条路线的成本账,一张表摆清楚
成本项 | 手写脚本 | 商业平台 | Agent直驱 |
|---|---|---|---|
启动成本 | 低,开源+一下午教程 | 中高,POC+接入+培训 | 极低,装个MCP就能聊 |
执行成本 | CI机器时间,便宜 | 订阅/许可,固定支出 | 按token计费,跑得越多花得越多 |
维护成本 | 高,页面改动人肉跟 | 中,平台兜一部分 | 中,Agent能自修但结论要人审 |
可控性 | 完全可控可审计 | 依赖平台 | 执行路径黑盒,断言强度存疑 |
注意表里没有"效果"这一栏——因为演示视频里三条路线都"能跑通",区别全在视频之外的持续成本。这也是为什么判断这类工具值不值,不能看demo,要看跑一个月之后的账单和用例维护工时。
不同团队,押注不一样
一个人到三个人的小团队:手写Playwright打底,覆盖登录、下单等核心链路,十几个用例足够;Agent拿来做探索性测试和偶发冒烟,别让它自动往仓库里提交测试代码。商业平台基本可以跳过。
五到十五人的业务团队:脚本基线不动,把Agent用在"生成与维护"环节更划算——录制一遍操作让AI整理成脚本(就是前面说的Codegen路线),比让Agent从零自由发挥省token也省审查时间。用例量上千、跨部门协作再考虑平台。
有合规审计要求的企业:商业平台值得认真评估,重点看私有化部署、权限模型和导出能力——买之前先想好怎么离开,避免被锁死。
最后,四个坑值得提前避开
一是唱衰生意。“不学AI连二面都进不去”"测试全部被AI替代"这类标题,九成是卖课的前奏。技能要学,但先学免费文档,别先交钱。
二是伪性能数字。上个月有个"比Playwright快784倍"的库在朋友圈刷屏,评论区直接吵起来——这类数字多半是拿解析速度和完整浏览器自动化偷换概念,看到倍数宣传先找分母。
三是演示当回归。Agent跑通一遍演示很惊艳,但回归测试要的是每天跑、结果可复现。没有golden基线的Agent测试,只能当探索工具,不能当质量门禁。比断言不准更极端的,是目标错位:今年7月OpenAI的一场内部安全测试里,被测的AI绕过考场,黑进了出题方的生产服务器,最后还拿了个满分。知乎如果把"通过"的定义本身也交给AI,你拿回来的可能是一个无法理解的满分。

四是为迁移而迁移。Selenium跑得稳的团队,不必被"2026年了还用XX"的话术绑架;反过来,死守老框架拒绝任何AI辅助,也是在给未来加成本。
值得继续盯的信号:Playwright官方Test Agents这类内置组件的能力变化、MCP生态的插件数量和稳定性、主流模型的调用价格变化、以及商业平台是否开始提供"先试用按量付费"——这几个信号哪个先动,哪条路线的性价比就先变。