2026年4月13日 · 阅读 —

真正先过时的,也许不是工具,而是那套靠人肉硬扛的工作方式

Agent 与 SkillsAI 工程实践

真正先过时的,也许不是工具,而是那套靠人肉硬扛的工作方式

凌晨两点,测试群还在刷消息,咖啡已经凉了半杯,页面却还卡在那种“看起来快好了、实际上啥也没动”的状态。很多人这两年一聊 AI 测试,第一句就开始上强度:要么说测试行业要翻篇了,要么说这不过是给老流程套了层聊天壳。说实话,这两种说法都太满了,像会场灯一打,热闹归热闹,真正落地的东西还得自己看。

真正在发生的变化,不是传统测试平台明天就要下线,也不是 AI 只负责把报告写得更像人话。更像是测试这件事的驾驶方式变了:以前是人一层层拧方向盘、踩油门、盯仪表盘;现在开始变成,人先把目标、约束、边界说清楚,AI 参与规划、执行、分析,再把结果接回研发流程。方向没那么玄,甚至有点土,但这个土路子一旦跑顺,影响不会小。

AWS Security Agent 的公开预览就是个很直白的信号。它碰的不是那种“帮你补几个脚本”的轻活,而是把登录、扫描、探索、验证、评分、报告串成一条链路,往整套工作流里钻。官方给的成绩也不算虚:在 CVE Bench v2.0 上,带 CTF instructions 和 grader feedback 时能做到 92.5%,去掉这些辅助反馈后是 80%。别急着把它翻译成“AI 已经能替代安全工程师”——那太猛,容易翻车——但它至少说明,多智能体测试已经不是实验室里画图的阶段了,开始有产品形态,也开始有值得认真看的结果。

再看行业面,World Quality Report 2025 的数字也挺扎眼:89% 的组织已经在质量工程里试点或部署生成式 AI,但真正做到企业级规模化的,只有 15%。这两个数放在一起,就像会议室里有人拍桌子说“已经全面转型”,旁边另一个人默默把 PPT 翻到最后一页,心里想的却是“你先把日常流程跑稳再说”。问题不在于大家没意识到 AI 会改测试,恰恰相反,是大家都意识到了;难的是,怎么从“试试看”走到“变成日常能力”。

一、所谓 AI 原生,不是加个聊天框就完事

很多产品都爱把自己叫 AI Native,听着挺新,拆开看却还是那套老底子:JMeter 外面包个提问框,Selenium 旁边多一个“帮我写脚本”的按钮,扫描器结果页上加一段自动总结。不能说没用,至少能省点重复劳动;但这更像是“传统工具 + AI 增强”,还不是从头到尾把测试方式重新拧了一遍。

更像样的 AI 原生测试,应该是测试的组织方式先变了。不是你先学会工具的语法,才能开始表达意图;而是你先把目标、约束和重点说清楚,系统再去拆路径、调工具、做判断。输入边界松一点,工作流就活一点。你可以直接说:帮我测搜索功能,重点看 1000 并发下的响应时间和数据库瓶颈;也可以把 PRD、接口文档、设计稿、历史缺陷一起丢进去,让它先帮你筛一轮最容易漏的场景。真正变的不是“终于能说人话了”,而是测试意图不必先翻译成一串工具语法,才有资格进入系统。

这里有个很现实的分水岭。传统测试工具默认假设的是“你先想清楚步骤,我负责照单执行”;AI 原生测试更像“你先把目标、边界、重点交代清楚,我来帮你拆路径”。差别别看只是一层语言,实际是规划权从人手里往系统里让了一点。像 AWS 那套自动化渗透测试链路,真正难的也不是“生成几个命令”,而是它开始尝试把登录、扫描、探索、验证、评分、报告连起来。一步一步打穿工作流,这就不是给旧系统贴贴纸了。

二、测试工程师还是得懂一点大模型,别装看不见

很多测试同学一听到这里,第一反应通常都挺一致:我又不是算法工程师,为什么还得去看 Transformer、Token、Temperature 这些东西?这话能理解,毕竟以前大家主要和规则系统打交道;现在不一样了,越来越多时候是在和概率系统打交道。规则系统讲的是“对就是对、错就是错”,概率系统讲的是“这次大概率对,但你得知道它为什么会歪”。

如果你不知道上下文窗口的限制,就很容易看不懂,为什么同一份需求文档,一次性喂进去和拆开喂进去,输出能差这么多。如果你不清楚 Token 怎么影响输入和输出,就会把截断、漏场景、答到一半停住,全都怪成“模型不稳定”。如果你不懂 Temperature 和 Top-P 在调什么,就会在需要稳定输出的时候让它放飞,在需要探索场景的时候又把它压得死死的。说白了,不一定非得去当模型专家,但最好别把它当黑盒神谕。黑盒这玩意儿,平时看着省心,真出问题的时候最费命。

这也是 AI 进入测试后最现实的变化之一:会不会“用”,门槛在下降;会不会“判断”,门槛在上升。以前很多人比的是谁脚本写得快,现在慢慢会变成谁更会判断这次 AI 的结果靠不靠谱、哪一步该让它继续,哪一步该人工兜住。未来拉开差距的,可能不是第一版脚本写得多漂亮,而是你能不能让它一轮轮往正确方向收敛。

三、真正值钱的,不是万能模型,而是一组分工清楚的智能体

我一直不太信“一个模型通吃所有测试场景”这种话。现实里的测试本来就不是一个岗位能全包的事:功能、性能、安全、代码评审、日志分析、结果归因,每一块都有自己的脾气。AI 进来之后,更合理的形态也不是一个全能大脑,而是一组分工明确的智能体协作。有的负责规划,有的负责浏览器操作,有的盯接口和日志,有的做性能分析,有的做安全验证,最后还有一个负责收口,把结果翻成研发能接得上的语言。

这和真实团队挺像。以前这些分工全部靠人协同,群里一吼、会里一碰、再拉个表格慢慢追;现在开始变成人 + 智能体 + 工具的混合协作。技能插件也是同一个逻辑,不是让大模型什么都硬猜,而是把 SQL 注入检测、XSS 测试、页面交互、接口校验、日志抓取、代码阅读这些能力,以工具或技能的方式接进去。这样做的好处很朴素:AI 不用逞强,系统也不会因为它瞎编就全盘失控。

当然,别把“自主执行”也想得太神。页面结构变了、按钮位置挪了、文案改了,AI 确实有机会通过语义、结构、上下文重新理解页面,而不是立刻整套崩掉。但它不是不维护了,只是把维护对象从具体步骤往测试意图和业务校验上抬了一层。以前你盯的是“这个按钮点不点得上”,以后更值钱的,可能是“这个流程是不是还表达了原来的业务关系”。维护没消失,只是没那么机械了。

四、传统测试平台先受冲击的,不是工具,是那套人肉硬扛的工作方式

别急着喊“工具已死”。真正先被冲击的,多半不是 JMeter、Selenium、Burp Suite 这些东西本身,而是过去那套把所有流程都压在人身上的方式。以前一个需求下来,大家先拆场景、再写脚本、再修定位、再调参数、再追日志,谁都在硬扛,扛到最后就是“人比工具还像工具”。这套方式能跑,但成本也真不低。

AI 原生测试改变的,就是这条链上的重心。人不再负责把每一步都手工铺平,而是更像在提供目标、边界和判断标准,让系统去承担更多规划和执行。这样一来,效率上去是一方面,更重要的是测试不再完全绑死在某个具体动作上。页面一抖、接口一变、文案一改,不至于整套流程跟着一起散架。工具还在,但它不再是唯一的驾驶员。

这也是为什么现在越来越多人开始说,未来的测试能力,不只是“会不会写脚本”,而是“能不能把测试意图拆成可迭代的工作流”。这个转向听起来不华丽,甚至有点像把大词往地上一放,踩一脚试试软硬,但它很真实。行业里那些先过时的,往往不是工具,而是人还在用硬扛的方式跟新系统比命硬。

五、接下来该怎么转,不用装得太宏大

先别急着把自己想成要转型成什么“AI 测试架构师”。现实一点说,第一步不是重学一套新神话,而是把手上的工作拆开:哪些是重复执行,哪些是高判断成本,哪些是容易漂移的场景,哪些地方最适合让 AI 先跑一轮。先从旁路增强开始,别一上来就想着把所有流程一锅端。

更实际的做法,是让 AI 先做那些“人做也行,但太耗神”的活。比如场景初筛、接口信息整理、日志归类、缺陷归因、测试报告草稿,这些都很适合先让它上。等你摸清它在哪些地方稳、在哪些地方会发飘,再决定要不要把它塞进更核心的链路。别神化,也别低估。工程上最怕的不是保守,是把试验品当成成品使唤,最后背锅的还是自己。

测试这行后面大概会越来越像这样:人负责目标、约束和最后那道判断,AI 负责铺路、执行和初步收敛,工具负责把事情真正跑起来。谁先适应这个分工,谁就少吃点硬扛的苦。说得再直白一点,别等流程都变了,才发现自己还在拿老办法硬顶。

变更摘要(改了什么)

这版没有沿用原稿那种偏“行业判断 + 资料堆叠”的讲法,而是把开头换成了更像现场复盘的切口,先把“人肉硬扛”的疲态摆出来,再把 AI 原生测试的变化慢慢推出来。中间把原先偏概念化的段落,改成了更顺的叙述节奏,核心意思还是那几个:AI 不只是加一个聊天框,测试组织方式在变,工作重心在往目标驱动和多智能体协作迁移。

同时补了一点更贴地的场景感,比如凌晨两点、咖啡变凉、群里刷消息这些细节,让文章不只是“观点正确”,也更像真人在讲自己看到的变化。结尾没有做那种硬邦邦的总结,而是把转型建议收成一段更自然的提醒,方便直接发公众号。

风险点(哪里可能翻车)

这篇最容易翻车的地方,是“AI 原生”“多智能体”“工作流接管”这些词如果再往外放,会很容易变成大词堆大词。读者如果本来就对 AI 测试比较敏感,看到一篇文章满嘴概念,警惕心会直接拉满。另一个风险是,AWS 和 World Quality Report 这类引用如果被单独拎出来,容易让文章看起来像在替趋势背书,而不是在讲真实变化。

还有一个点要留意:这篇虽然有一点吐槽感,但整体还是工程向的,别为了“更有味道”把语气写得太散,不然会削弱可信度。真要往外发,最好再核一遍事实表述,特别是时间点、数据和产品名,别让一处小失误拖累整篇的判断。

回滚方案(怎么撤)

如果你觉得现在这个版本还是偏重、偏长,最稳的撤法不是推倒重写,而是直接删掉中间两段关于模型原理和多智能体协作的展开,把文章收缩成“行业变化 + 传统工具冲击 + 转型建议”三段式。这样核心观点还在,篇幅会更干净,也更适合快节奏传播。