随着软件系统复杂性和交互性的持续提升,保证软件质量已成为软件工程领域的重要挑战。图形用户界面测试是软件质量保障中的关键环节。众包测试通过组织来自不同背景、设备和使用环境的测试人员参与测试,能够覆盖丰富的真实使用场景,并有效发现传统测试方法难以触发的功能缺陷和边界问题。然而,传统众包测试高度依赖人工参与,存在组织成本高、测试过程难复现、结果质量不稳定等问题。与此同时,基于大语言模型的自动化 GUI 测试方法在可控性、可复现性和执行效率方面展现出较大潜力,但现有方法通常采用相对固定的探索策略,难以模拟真实众包测试人员在测试思维、探索偏好和交互习惯方面的行为多样性。
针对上述问题,iSE 实验室联合慕尼黑工业大学软件工程与 AI 教席创新地提出了一种基于大语言模型人格化的自动化众包 GUI 测试框架 PersonaTester。该方法尝试将真实众包测试人员的行为差异建模为可控制、可复现的人格化测试代理,从而在自动化测试过程中保留众包测试的行为多样性。具体来说,PersonaTester 基于真实众包测试报告中的 GUI 探索轨迹,从测试思维、探索策略和交互习惯三个正交维度刻画测试人员行为。其中,测试思维描述测试人员在探索过程中的认知取向,如顺序连贯或发散非线性;探索策略描述测试人员在界面交互中的关注重点,如点击导向、核心功能导向或输入导向;交互习惯描述测试人员在输入操作中的具体偏好,如短有效输入、长有效输入或无效输入。基于这三个维度,PersonaTester 构建了九类具有代表性的测试人格,并将其注入到大语言模型驱动的测试代理中,使不同代理能够表现出稳定且可区分的测试行为。

在测试执行过程中,PersonaTester 首先结合传统计算机视觉技术、多模态大语言模型和文本理解能力,对移动应用界面进行结构化理解,识别界面中的可交互控件、临时组件和语义信息,并将当前 GUI 状态转换为便于大语言模型推理的结构化表示。随后,系统通过两阶段推理机制生成测试行为:第一阶段根据当前界面状态、历史操作和人格配置生成高层测试意图,第二阶段根据该意图生成具体的 GUI 操作。该设计使测试过程具有更好的可解释性和行为一致性。操作执行后,PersonaTester 进一步利用多模态模型检查操作结果是否符合预期,并识别潜在的崩溃缺陷、功能错误和界面异常,从而形成包含理解、推理、执行和验证的闭环自动化测试流程。
实验结果表明,PersonaTester 能够有效模拟真实众包测试人员的行为模式,并显著提升自动化 GUI 测试的有效性。与未引入人格机制的基线方法相比,PersonaTester 在同一人格内部表现出更高的行为一致性,在不同人格之间表现出更清晰的行为差异。此外,引入人格指导的测试代理能够生成更加有效的测试事件,。在缺陷发现方面,PersonaTester 能够发现多类由特定测试行为触发的问题,例如时序敏感过滤错误、闹钟编辑锁定问题、外围页面渲染异常和长文本输入导致的界面遮挡问题。这些结果说明,通过显式建模测试人员行为差异,PersonaTester 能够在自动化条件下模拟众包测试中的虚拟测试人群,从而提升测试探索的真实性、稳定性和缺陷发现能力。
该研究首次将 " 人格 " 概念系统性引入软件测试领域,提出了面向大语言模型测试代理的人格化建模方法,为自动化众包测试提供了新的技术路径。与传统自动化GUI测试方法相比,PersonaTester 不再仅依赖单一探索策略或随机行为,而是通过多类人格化代理协同模拟真实测试人员群体的差异化行为。该方法在保留众包测试行为多样性的同时,降低了人工组织成本,并增强了测试过程的可控性和可复现性。相关成果《 Towards Automated Crowdsourced Testing via Personified-LLM 》已被软件工程领域顶级会议 FSE 2026( CCF-A )录用。
论文第一作者虞圣呈博士于 2024 年毕业于南京大学软件学院,现为慕尼黑工业大学博士后研究员,论文由南京大学陈振宇教授、房春荣副教授,和慕尼黑工业大学陈春阳教授共同指导完成。虞圣呈博士主要研究方向为智能化软件测试、GUI 自动化测试和众包测试,已围绕软件质量保障中的知识理解、场景建模和人机协同测试开展了一系列研究工作。该研究进一步拓展了大语言模型在软件工程质量保障中的应用边界,为构建可扩展、可复现且具有人类行为多样性的智能测试系统提供了重要参考。