Preference Reasoning under Indeterminacy in Large Language Models
作者: Hadi Hosseini, Samarth Khanna, Xiyuan Wang
分类: cs.AI, cs.GT, cs.LG
发布日期: 2026-08-19
备注: 55 pages, 14 figures
💡 一句话要点
提出应对不确定性偏好的推理方法以提升语言模型决策能力
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 偏好推理 不确定性 大型语言模型 决策支持 人工智能推理 知识表示 结构选择
📋 核心要点
- 核心问题:现有大型语言模型在面对不确定性偏好时,无法有效区分确定与不确定的实例,导致推理错误。
- 方法要点:本文提出了针对知识不确定性和结构不确定性的推理框架,以提升模型在复杂决策场景中的表现。
- 实验或效果:通过一系列任务评估,发现现有模型在处理不确定性时的推理能力显著低于预期,且存在系统性错误。
📝 摘要(中文)
随着大型语言模型逐渐演变为决策代理,偏好推理能力成为对齐、协调和集体智能的基础。然而,现实世界中的偏好推理本质上是不确定的:信息可能不完整,且有效解决方案可能不存在。本文认为,不确定性而非单纯的正确性是人工智能推理的核心挑战。我们从两个方面形式化了这一挑战:一是知识不确定性,源于不完整、部分或表达性偏好;二是结构不确定性,源于在标准社会选择概念下解决方案的不存在。通过一系列任务,我们展示了当前最先进的语言模型在区分确定与不确定实例方面的系统性失败,即使在验证设置中也表现出错误的推理。
🔬 方法详解
问题定义:本文旨在解决大型语言模型在面对不确定性偏好时的推理能力不足问题。现有方法在处理不完整信息和缺乏有效解决方案时表现不佳,导致推理错误。
核心思路:论文提出了一种新的推理框架,专注于知识不确定性和结构不确定性,强调在决策过程中考虑信息的完整性和解决方案的存在性,以提高模型的推理准确性。
技术框架:整体架构包括两个主要模块:一是对偏好的表达与理解,二是基于偏好的决策推理。通过对偏好信息的分析与建模,模型能够更好地处理不确定性。
关键创新:最重要的技术创新在于将不确定性作为推理的核心挑战,提出了针对知识和结构不确定性的双重框架,与传统方法相比,强调了对不确定性信息的处理。
关键设计:在模型设计中,采用了特定的损失函数来优化推理过程,同时引入了新的参数设置以适应不同类型的偏好信息,确保模型在多种场景下的适应性。
🖼️ 关键图片
📊 实验亮点
实验结果表明,当前最先进的语言模型在处理不确定性偏好时的推理准确率低于预期,尤其在验证设置中,错误率高达30%以上,显示出系统性失败。这一发现强调了针对不确定性偏好的推理能力提升的必要性。
🎯 应用场景
该研究的潜在应用领域包括智能助手、推荐系统和自动决策支持等。通过提升语言模型在不确定性偏好推理方面的能力,可以显著改善人机交互的质量和决策的合理性,具有重要的实际价值和未来影响。
📄 摘要(原文)
As large language models evolve into decision-making agents, the ability to reason over preferences becomes fundamental to alignment, coordination, and collective intelligence. Yet, unlike standard benchmarks, real-world preference reasoning is inherently indeterminate: information may be incomplete, and valid solutions may not exist. We argue that indeterminacy, rather than correctness alone, is a central challenge for AI reasoning. We formalize this challenge along two axes, (i) epistemic indeterminacy, arising from incomplete, partial, or expressive preferences, and (ii) structural indeterminacy, arising from the non-existence of solutions under standard social choice concepts. Across a hierarchy of tasks, we show that state-of-the-art language models systematically fail to distinguish between determined and undetermined instances, exhibiting miscalibrated reasoning even in verification settings.