ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

多模态大模型怎么应用到软件测试?

多模态大模型怎么应用到软件测试? 多模态大模型在软件测试领域落地应用多模态大模型同时理解文本、图片、截图、UI界面、视频、音频、HAR报文、日志、PDF需求文档等多种输入区别于纯文本LLM。下面从测试全流程需求→用例→自动化→缺陷→线上监控→测试评估讲应用场景、落地方式、能力边界、风险偏向工程可落地不空谈概念。一、需求设计阶段多模态理解输入前置质量风险传统LLM只能读PRD文字多模态可以直接喂原型截图、Figma设计稿截图、UI录屏、PDF需求、接口文档、手绘草图。多模态需求解析与歧义识别输入PRD文档 UI设计截图 交互演示视频模型能力同时比对文字需求和界面视觉识别需求矛盾文字写“按钮红色”设计稿是蓝色文案描述弹窗逻辑视频演示交互不一样。产出需求风险清单、遗漏点、模糊点输出初步测试点。价值把质量左移不用等开发写完代码才发现需求和设计不一致。UI视觉校验前置直接传入Figma截图提取组件、颜色、尺寸、文案输出UI规范检查清单提前发现设计本身问题。局限复杂业务逻辑、隐性业务规则多模态也无法凭空脑补必须依赖输入素材。二、测试用例生成与评审1. 多模态输入生成测试用例输入素材可以是PRD文本 页面截图 操作录屏。纯文本LLM只能根据文字猜界面长什么样经常脑补不存在页面多模态看懂真实界面元素识别按钮、输入框、弹窗、tab、图片区域生成贴合真实UI的用例区分可见/不可见控件。输出功能用例、边界用例、UI校验点、异常场景。2. AI辅助用例Review上传生成的用例 页面截图。模型校验用例步骤是否和界面控件匹配是否遗漏截图上可见的交互元素预期结果是否和UI展示一致识别用例写的“点击A按钮”截图里根本没有A按钮这类错误。痛点AI生成用例普遍存在冗余、缺少业务深层规则必须人工审核不能直接入库。三、自动化测试领域3.1 UI自动化视觉驱动自动化替代传统元素定位传统Playwright/Selenium依赖xpath、id、class前端一改DOM结构脚本直接报废维护成本极高。多模态大模型UI自动化两种模式Agent式UI自动化多模态Agent输入业务目标“完成登录输入错误密码看报错弹窗” 当前页面截图。模型看懂截图上的按钮、输入框自主决策点击哪个控件、输入什么内容输出操作指令给浏览器驱动完成流程。不需要写xpath不依赖DOM属性页面改版只要视觉没变脚本就可用。截图转自动化脚本上传页面截图多模态识别页面元素直接输出Playwright/Pytest代码把可视化界面翻译成自动化脚本。⚠️ 短板执行速度慢每一步都要调用大模型复杂页面控件多容易识别错相似按钮适合冒烟、主流程不适合大规模高频回归。3.2 视觉回归测试增强传统视觉回归只是像素对比改一点无关像素就大量误报。多模态大模型做语义级视觉比对输入基准截图 新版本截图不是比每个像素而是理解页面语义“按钮文字是否变了、弹窗是否出现、图片是否加载、报错文案是否正确”过滤掉布局微小偏移带来的误报只报真正业务缺陷。3.3 多模态接口测试把HAR文件抓包文件、接口返回JSON、截图一起喂给模型。场景接口返回数据同时看前端页面渲染截图判断接口返回数据是否正确渲染到页面上。传统只能单独校验接口返回值很难校验“后端数据→前端展示”链路多模态可以打通前后端联合校验。四、缺陷发现、缺陷自动分析与提交截图/录屏直接生成缺陷单测试人员只需要截图报错页面、录一段bug复现视频。多模态模型识别页面报错文案、弹窗、错乱UI结合截图自动生成缺陷标题、复现步骤、预期结果、实际结果附带截图描述直接输出可复制的缺陷内容。实测极大减少测试写bug单的时间。缺陷根因辅助定位输入报错截图 后端报错日志文本 HAR报文。多模态同时解析页面报错、网络请求、堆栈日志给出可能根因方向前端渲染问题 / 接口返回异常 / 参数传错。注意只是辅助线索不能直接判定根因。缺陷分类、自动打标签根据截图日志自动区分UI缺陷、功能缺陷、兼容性、性能报错。五、兼容性测试多模态非常适配不同浏览器、不同分辨率、手机不同机型截图批量喂给模型自动识别文字截断、按钮遮挡、图片错乱、弹窗溢出、样式崩坏。不用人工一张张看截图批量做兼容性筛查。六、性能、音视频类专项测试软件不光图文还有音频、视频模块视频播放器上传播放录屏识别花屏、卡顿、黑屏、字幕错位语音模块音频输入识别杂音、播报文案错误、声音截断传统自动化很难校验音视频内容多模态天然适合。七、线上监控 生产环境质量巡检线上用户报错截图、用户反馈录屏、异常页面快照。自动巡检线上页面快照批量发现线上UI异常、报错弹窗用户反馈附带截图多模态自动解析用户反馈初筛是不是缺陷归类问题分流给研发/产品。八、测试本身的评估评测AI测试能力多模态评测Agent测试效果输入界面截图 标准用例评估AI Agent执行是否正确用于评测AI测试工具本身判断模型会不会看错界面、误操作。多模态大模型测试落地架构参考素材输入层PRD、Figma截图、页面截图、录屏、HAR、日志、音频视频 ↓ 多模态大模型层理解图文音视频输出测试分析、操作指令 ↓ 执行层测试用例生成、自动化Agent执行、缺陷生成、视觉比对 ↓ 输出层风险清单、测试用例、自动化脚本、缺陷单、质量报告核心优势 vs 现实痛点维度优势现实痛点UI理解不依赖DOM看懂视觉界面弥补传统自动化短板识别相似控件容易出错有幻觉执行速度慢左移质量同时解析需求文档设计稿提前发现不一致无法理解隐性业务规则素材不全就输出错误结论缺陷处理截图录屏一键生成bug单降低测试文案工作量复杂bug复现步骤会编造需要人工复核专项测试音视频、视觉兼容性传统工具很难做多模态擅长批量调用成本高token消耗大落地建议不要直接拿来完全替代测试人员定位是测试助手负责信息提取、初筛、初稿生成人做最终决策。分层使用高价值场景需求歧义检查、截图生成缺陷、视觉语义比对、简单业务Agent冒烟谨慎使用核心业务大规模自动化回归稳定性不足。做输入约束给模型完整素材截图、需求素材残缺多模态幻觉会明显上升。成本管控大批量页面巡检做好采样不要每一张截图都调用最高规格多模态大模型。和普通文本LLM做软件测试的核心区别普通文本LLM只能读文字脑补界面经常虚构页面控件对UI类场景能力弱。多模态大模型看见真实界面截图、视频以真实视觉信息作为依据适合UI、前后端联动、音视频这类非纯文本测试场景。
返回列表