Enhancing Social Intelligence in LLMs with Hierarchical Reasoning and Utterance-Level Goal Rewarding

📄 arXiv: 2608.05832v1 📥 PDF

作者: Xiaofeng Wang, Kakam Chong, Shuai Xiao, DeXin Kong, Qingyuan Tian, Chen Ju, Xu Yan, Shuai Zhao, Fei Huang, Rui Wang, Shuguang Han, jufeng chen

分类: cs.CL

发布日期: 2026-08-06


💡 一句话要点

提出TSR框架与LHRL-VGR算法以提升LLMs的社交智能

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 社交智能 大型语言模型 层次强化学习 动态奖励机制 对话系统 多智能体交互 自然语言处理

📋 核心要点

  1. 现有方法在动态社交互动中表现不佳,无法有效处理长期目标协调和快速适应的需求。
  2. 本文提出的TSR框架将社交对话分为高层战略规划和低层语言执行,优化了对话的目标导向性。
  3. 实验结果显示,所提方法在目标完成成功率上超越了GPT-4o基线,提升幅度达到7.32%。

📝 摘要(中文)

大型语言模型(LLMs)在结构化任务中表现优异,但在动态社交互动中却面临挑战,尤其是在长期目标协调和快速适应方面。现有方法通常对每个发言应用统一的基于目标的奖励,忽视了对话轮次中目标的特异性及潜在策略的合理性。受计划行为理论启发,本文提出了Think-Strategy-Response(TSR)框架,将社交对话分解为高层战略规划和低层语言执行两个层次。为优化TSR,本文引入了线性化层次强化学习与方差门控奖励(LHRL-VGR)算法,该算法动态调整奖励,平衡目标完成与策略遵循。实验结果表明,所提出的方法在SOTOPIA基准上使Qwen2.5-7B代理的目标完成成功率超越GPT-4o基线7.32%,在多智能体社交谈判任务中展现了最先进的性能。

🔬 方法详解

问题定义:本文旨在解决大型语言模型在动态社交互动中的表现不足,现有方法未能针对每个对话轮次的特定目标进行有效奖励设计,导致策略执行不佳。

核心思路:提出的TSR框架通过将社交对话分为战略规划和语言执行两个层次,能够更好地捕捉对话中的目标特异性,从而提升模型的社交智能。

技术框架:整体架构包括两个主要阶段:高层的战略规划阶段负责设定对话目标,低层的语言执行阶段则负责生成具体的语言响应。LHRL-VGR算法在此框架下动态调整奖励,确保目标完成与策略遵循的平衡。

关键创新:最重要的创新在于引入了方差门控奖励机制,使得奖励信号能够根据目标达成的方差动态调整,从而更精准地引导模型学习。与现有方法相比,该机制能够更好地适应对话中的变化。

关键设计:在算法设计中,设置了特定的损失函数以优化策略执行,同时在奖励信号中引入了方差计算,以确保模型在不同对话轮次中能够灵活调整策略。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,所提出的LHRL-VGR算法在SOTOPIA基准上使Qwen2.5-7B代理的目标完成成功率超越了GPT-4o基线7.32%,展现了在多智能体社交谈判任务中的领先性能。

🎯 应用场景

该研究的潜在应用领域包括智能客服、社交机器人和多智能体系统等,能够显著提升这些系统在复杂社交场景中的表现。通过优化社交智能,未来可能推动人机交互的自然性和有效性,提升用户体验。

📄 摘要(原文)

Large language models (LLMs) excel in structured tasks but struggle with dynamic social interactions, where success requires long-term goal coordination and rapid adaptation. Current methods often apply uniform goal-based rewards to every utterance, overlooking the specificity of objectives at each dialogue turn and failing to account for the rationale of potential strategies. Inspired by the Theory of Planned Behavior, we propose the Think-Strategy-Response (TSR) framework, which decomposes social dialogue into two hierarchical stages: high-level strategic planning and low-level linguistic execution. To optimize TSR, we introduce Linearized Hierarchical Reinforcement Learning with Variance-Gated Rewards (LHRL-VGR), a novel algorithm that dynamically routes rewards - balancing goal completion and strategy adherence - based on the variance of goal achievement scores. Experiments on the SOTOPIA benchmark show that our approach fine-tunes a Qwen2.5-7B agent to surpass the GPT-4o baseline by 7.32% in goal completion success, demonstrating state-of-the-art performance in multi-agent social negotiation tasks.