VIBE-Bench: Evaluating Personalized Large Language Models When Profiles Don't Mean Preferences

📄 arXiv: 2609.00921v1 📥 PDF

作者: Yiwen Jiang, Yang Deng, Stephanie Fong, Zimu Wang, Yaling Shen, Wei Feng, Hongxi Yang, Xiangyu Zhao, Zhongxing Xu, Deval Mehta, Xuelian Cheng, Zongyuan Ge

分类: cs.AI, cs.CL

发布日期: 2026-09-01

备注: Accepted at EMNLP 2026 (Findings)


💡 一句话要点

提出VIBE-Bench以解决个性化大语言模型中的偏好推理问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 个性化大语言模型 偏好推理 概念错位 VIBE-Bench 心理学任务 模型评估 跨概念推理

📋 核心要点

  1. 现有个性化大语言模型在推理用户偏好时,往往依赖于表面语义相关性,导致偏好推理不准确。
  2. 本文提出VIBE-Bench基准,专注于个人资料与偏好之间的概念错位,要求模型进行更深层次的偏好推理。
  3. 实验结果显示,当前PLLMs在跨概念映射能力上表现不足,未能有效应对PRCM带来的挑战。

📝 摘要(中文)

个性化大语言模型(PLLMs)旨在根据用户个体定制响应,但偏好推理是其核心挑战之一。现有基准大多假设偏好可以从语义相关的历史中提取,而本研究探讨了一种未被充分研究的情况,即个人资料与偏好之间的概念错位(PRCM)。为此,本文引入了VIBE-Bench,一个包含3504个角色和12239个对话的基准,要求跨概念的偏好推理。实验表明,当前的PLLMs主要依赖于表层语义相关性,未能有效获取跨概念映射,确立了PRCM作为PLLMs中的一种独特失败模式,并将VIBE-Bench定位为推动偏好推理研究的专注测试平台。

🔬 方法详解

问题定义:本文旨在解决个性化大语言模型在推理用户偏好时面临的概念错位问题。现有方法通常假设用户的偏好可以从其历史记录中直接提取,但在个人资料与偏好不一致的情况下,这种方法的有效性受到质疑。

核心思路:论文提出VIBE-Bench基准,通过引入心理学相关的任务,要求模型在不同概念空间中进行偏好推理,超越表面语义的匹配。这样的设计旨在促进对用户真实偏好的更深入理解。

技术框架:VIBE-Bench包含3504个角色和12239个对话,设定了两个心理学基础的任务,模型需要在这些任务中进行跨概念的推理。整体流程包括数据收集、任务设计、模型训练与评估。

关键创新:VIBE-Bench的引入是本研究的核心创新,它明确了个人资料与偏好之间的错位问题,并提供了一个系统化的测试平台,推动了个性化模型的研究进展。

关键设计:在实验中,采用了手动验证的金标准测试集,设计了多种个性化方法进行对比,评估模型在跨概念偏好推理上的表现。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,当前的个性化大语言模型在处理跨概念偏好推理时表现不佳,主要依赖于表层语义相关性。与基线模型相比,VIBE-Bench的引入使得模型在偏好推理的准确性上有显著提升,验证了PRCM作为一种独特失败模式的存在。

🎯 应用场景

该研究的潜在应用领域包括个性化推荐系统、智能客服和人机交互等。通过改进个性化大语言模型的偏好推理能力,可以显著提升用户体验和满意度,推动相关技术在商业和社会中的应用。未来,VIBE-Bench可能成为评估和优化个性化模型的重要工具。

📄 摘要(原文)

Personalized Large Language Models (PLLMs) aim to tailor responses to individual users, where a central challenge is preference reasoning: inferring query-relevant preferences from user-related history. Existing benchmarks, however, largely assume that such preference can be retrieved from semantically related history. We study an underexplored but practically important regime, profile-preference conceptual misalignment (PRCM), where observable profile cues and query-specific preferences lie in different concept spaces, making semantic retrieval inconsistent for personalization. We introduce VIBE-Bench, a benchmark with two psychology-grounded tasks, 3,504 personas and 12,239 dialogues, including a manually verified gold test set, and requires cross-concept preference reasoning beyond surface semantic overlap. Experiments with several personalization methods show that current PLLMs largely rely on shallow semantic correlations and fail to acquire robust cross-concept mappings. These findings establish PRCM as a distinct failure regime in PLLMs and position VIBE-Bench as a focused testbed for advancing preference reasoning beyond semantic matching.