本文整理自 QCon 北京 2026 张亦驰分享《小红书GUI Agent在智能化测试中的工程落地实践》,通过AI音视频总结工具Ai好记进行语音转文字整理,以下为整理总结后的内容。
测试自动化到底提效没有
张亦驰在小红书负责 GY 和 AI Coding 方向,分享开头就抛了一个很真实的问题:测试自动化到底提效没有?
对外汇报通常都是正面的——省了多少人力、提升了多少测试覆盖率。但实际呢?可能只是把「人工维护用例」变成了「人工维护脚本」。紧急情况还是要人工介入。
他用一个案例说明问题:传统自动化找到了 80 个 bug,但最后还是要人工兜底,没能彻底释放人力。
理想的测试 Agent 应该是什么样?人尽量少参与,能独自长时间运行。给个意图,AI 自己去探索执行。
传统测试自动化的三个硬伤
小红书的团队总结了三方面的问题:
一是用例维护难。XPath 复杂度高,而且是静态的,很容易被页面改动破坏。自然语言用例的结构虽然更稳定,但写起来仍然耗时。
二是多端多机型适配复杂。Android、iOS、鸿蒙三端,再加上不同机型,代码里要写大量兼容逻辑。一个资深测试才能搞定。
三是断言能力弱。传统断言只能识别简单的文本「有还是没有」,产品换个文案就识别失败了。无法做视觉层面的校验,比如颜色、布局、元素缺失。
测试自动化的三个阶段演进
小红书测试自动化的演进分为三个阶段:
第一阶段:传统自动化。XPath 定位 + 脚本维护。覆盖率高但人力节省有限,编写和维护成本都很高。
第二阶段:自然语言用例。用自然语言描述测试意图,结构更稳定,编写成本降低。但执行引擎需要足够智能才能把自然语言翻译成可执行步骤。
第三阶段:GUI Agent 智能化测试。这是小红书目前重点落地的方向。人只需要给出测试意图,Agent 自主理解页面、规划步骤、执行操作、验证结果。
核心解题思路:执行引擎 + 知识补充
小红书的方案分为两大模块。
执行引擎是核心,要解决 Agent 怎么理解页面和怎么操作页面。纯视觉的方案:截图 + 多模态大模型来理解当前页面的状态,不需要依赖 DOM 树或 XPath。
具体执行流程上,张亦驰参考了 AI Coding 的思路。做过 AI Coding 的人对这套逻辑应该很熟悉——就像 AI 理解代码库一样,Agent 理解 App 界面,然后自主规划操作路径。
减少幻觉和知识补充是第二个关键模块。
纯视觉方案的问题是:大模型对某些场景没有足够的知识储备。所以小红书建设了企业级知识库,把业务场景、操作链路、常见异常都沉淀进去。Agent 在执行过程中先查知识库,再结合视觉理解来做决策。
开源方案参考
小红书在落地过程中参考了几个开源工程。
张亦驰重点推荐了智谱 AI 开源的 AppAgent,他认为这是一套轻量化的方案,纯视觉识别与执行,单步执行时间在 10 秒以内。适合作为企业二次开发的起点。
其他方案各有优劣。阿里的开源方案是多 Agent 模式,视觉校验和自愈方面有借鉴价值。最早一批开源的工具依赖 DOM 树和 XPath 做定位,在复杂场景下容易误识别。
谈两个容易被忽视的问题
张亦驰在分享里特别提到了两点,我觉得挺有启发的。
一个是用例的「思考时间」不能被节省。
测试人员花 50% 的精力在执行测试用例,另外 50% 在写测试规划(15%)、跨岗位沟通(15%)、写用例(25%)。
AI 能帮你省掉执行和写用例的时间,但思考测试规划的时间不能省。这其实说明了测试人员的核心价值在哪——不是写脚本,而是设计测试方案。
另一个是从 AI Coding 视角看 GUI Agent。他之前在 AI Coding 方向的积累直接迁移到了 GUI Agent 的落地中。两个领域的核心挑战是相通的:怎么让 AI 理解复杂环境、怎么保证执行的可靠性、怎么处理边界情况。这给团队降低了不少学习成本。
后续展望
张亦驰在展望部分提到几个方向:
- 执行引擎从纯视觉方案向多模态融合演进
- 知识库从人工维护向自动沉淀进化
- 单端执行向多端协同(安卓+iOS+鸿蒙同时跑)推进
整个测试领域的 AI 化还在早期。把「人工维护脚本」换成「调试 AI 决策」确实提升了效率,但距离「人只给意图」的理想状态还有一段路要走。
以上内容由Ai好记转录整理。
Ai好记 是一款支持音视频转图文笔记的视频总结工具,支持音视频的转录、翻译、总结。可以将B站、抖音、小红书、小宇宙等平台链接及本地/网盘的音视频文件解析成笔记,语音转文字后自动生成精华速览、思维导图和结构化笔记,帮助你把几小时的视频内容变成可搜索、可复习的图文笔记。