Beyond a Single Judge: Simulating Social Persona Panels for Generative UI Evaluation
作者: Zheng Wu, Yibo Luo, Pu Zhang, Cheng Yang, Zhuosheng Zhang
分类: cs.CL
发布日期: 2026-07-30
🔗 代码/项目: GITHUB
💡 一句话要点
提出ESPP方法以解决生成用户界面评估中的多样性问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 生成用户界面 评估方法 心理多样性 社会加权 人机交互
📋 核心要点
- 现有的生成用户界面评估方法依赖于人工评估或单一模型评估,存在成本高、评估结果不一致的问题。
- 本文提出的ESPP方法通过心理多样化的评估面板,结合证据基础和社会加权机制,提升了评估的准确性和多样性。
- 实验结果显示,ESPP方法在跟踪人类判断上显著提升,皮尔逊相关系数从0.716提升至0.922,显示出其有效性。
📝 摘要(中文)
生成用户界面(GenUI)允许大型语言模型根据自然语言指令合成完整的可渲染界面,但评估生成内容的质量仍然是一个未解决的问题。人工评估成本高且受评者差异影响,而使用LLM作为评估者虽然可扩展,但只能反映单一隐含观点,无法捕捉不同用户群体对同一界面的真实感知。本文提出了一种证据基础的社会加权人格面板(ESPP),该方法通过心理多样化的面板独立评估截图,基于特征导向的语义门控机制进行意见交流,并通过类德尔菲的社会加权聚合成单一判断。实验表明,ESPP在跟踪人类判断方面显著优于传统单一评估者,皮尔逊相关系数从0.716提升至0.922。
🔬 方法详解
问题定义:本文旨在解决生成用户界面(GenUI)评估中的多样性和一致性问题。现有方法如人工评估成本高且受评者差异影响,单一模型评估无法反映用户的多样化观点。
核心思路:ESPP方法通过构建一个心理多样化的评估面板,利用证据基础和社会加权机制,使不同用户群体的意见能够被有效整合,从而提高评估的准确性和可靠性。
技术框架:ESPP方法分为三个阶段:首先,面板成员独立评估截图;其次,面板成员在特征导向的语义门控机制下交换意见;最后,通过社会加权聚合形成单一判断。
关键创新:ESPP的主要创新在于引入了心理多样性和社会加权机制,使得评估结果更能反映真实用户的多样化感知,克服了传统方法的局限性。
关键设计:在设计中,采用了特征导向的语义门控机制来引导面板成员的讨论,并通过类德尔菲方法进行社会加权,确保每个评估者的意见都能被合理整合。
🖼️ 关键图片
📊 实验亮点
实验结果显示,ESPP方法在跟踪人类判断方面显著优于传统的单一评估者,皮尔逊相关系数从0.716提升至0.922。此外,使用提示集控制方法仅恢复了约三分之一的差距,表明人格和证据基础的有效性是提升的主要来源。
🎯 应用场景
该研究的潜在应用领域包括用户界面设计、用户体验评估和人机交互等。通过更准确的评估方法,设计师可以更好地理解不同用户群体的需求,从而优化界面设计,提高用户满意度。未来,该方法可能推动生成用户界面技术的广泛应用,促进人机交互的进一步发展。
📄 摘要(原文)
Generative UI (GenUI) lets large language models synthesize a complete, renderable interface directly from a natural-language instruction, but evaluating the quality of what they generate remains an open problem. Human evaluation is costly and rater-variant, while LLM-as-a-judge is scalable but reflects only a single implicit viewpoint, unable to capture how different populations of real users actually perceive the same interface. We propose the Evidence-Grounded, Social-Weighted Persona Panel (ESPP), a three-stage GenUI evaluation method in which a panel of psychologically diverse, evidence-grounded personas independently rates a screenshot, exchanges opinions under a trait-derived, semantically-gated bounded-confidence mechanism, and is aggregated via Delphi-inspired social weighting into a single judgment. ESPP tracks human judgment substantially more closely than a naive single-pass judge, raising Pearson $r$ from $0.716$ to $0.922$, and a prompt-ensemble control recovers only about a third of this gap, isolating genuine persona and evidence grounding as the dominant source of improvement. Beyond this fidelity gain, retaining each panelist's individual rating further reveals that user subgroups agree on overall model rankings yet diverge sharply on specific rating dimensions, a structural disagreement a single homogeneous judge would systematically erase. The codes are available at https://github.com/Wuzheng02/ESPP.