2025-03-25-中智凯灵_北京_科技-基于多模态大模型的用户界面交互和测试_49页_4mb
报告摘要
基于多模态大模型的用户界面交互与测试技术研究
王俊杰研究员从多模态大模型驱动的GUI测试方法展开系统分析,重点探讨了自动化测试技术的演进与挑战。当前GUI测试工具如Monkey、Fastbot2、Droidbot等存在覆盖不足、操作路径规划不精准等问题,尤其在处理复杂界面逻辑、复合操作及非崩溃功能缺陷时效率有限。
针对文本输入生成,提出基于自然语言模型(LLM)的“填空式”方法,通过上下文感知生成测试提示,实现高覆盖率的文本输入测试。例如,在ICSE 2023中,该方法通过对界面元素的语义理解,生成符合业务规则的测试用例,测试通过率可达87%。进一步改进的GPTDroid技术将GUI测试问题转化为交互式问答任务,利用LLM理解界面布局并推断操作步骤。其核心包含三个模块:通过视觉和文本信息提取界面上下文,动态生成执行指令,结合功能记忆机制优化测试路径。实验显示,GPTDroid实现75%平均活动覆盖率,比现有方法提升32%,且检出95个bug(提升31%)。
为解决非崩溃功能缺陷检测难题,VisionDroid引入多智能体协作框架,包含Explorer Agent(通过截图和视图层级探索功能区域)、Monitor Agent(监控测试过程并触发检测机制)、Detector Agent(基于功能逻辑识别潜在错误)。该方法通过视觉与文本对齐、功能导向探索及测试预言推理,有效提升检测精度(50%-72%)和召回率(42%-65%),在ICSE 2024中展现显著优势。
在文本输入模糊测试方面,提出“异常文本输入生成”技术,通过LLM识别并模拟违反业务规则的输入模式(如插入特殊字符、超出范围数值)。该方法在ICSE 2024实验中检出率比基线高72%-78%,且操作次数显著减少。
针对文本输入组件交互体验优化,开发HintDroid系统,通过GUI实体提取、示例增强及反馈机制预测文本输入的提示信息(hint-text)。结合4950款应用数据,发现76%应用缺失明确提示,66%存在无明确内容的文本输入。该系统通过自动化内容校验和错误消息提取,提升视障用户输入准确性(提升14%-112%),并覆盖更多界面状态。
当前研究面临三大挑战:1)复杂界面元素(如单页超100个组件)导致测试覆盖不足;2)图标类组件缺乏标签信息影响测试精准性;3)大模型输出标号与描述不匹配、模糊描述定位偏差等问题。未来方向将聚焦优化模型输出机制、提升视觉标注精度及增强多模态协同能力,以实现更高效的GUI自动化测试。
相关成果已应用于贝壳找房、抖音、华为鸿蒙系统及新能源汽车车载系统,且多次获得ACM/IEEE杰出论文奖,体现其技术实用性与学术价值。
试读结束,高清完整版pdf/doc/ppt,请点下载