Calibrating Artificial Guilt: Neurally Grounded Reward Shaping for Prosocial Multi-Agent Reinforcement Learning
作者: Aaditya Mehta, Arya Shah
分类: cs.AI
发布日期: 2026-08-05
备注: 12 pages, 6 figures, 3 tables
💡 一句话要点
提出基于神经数据的人工内疚信号以优化多智能体强化学习
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 多智能体强化学习 奖励塑造 神经数据 内疚信号 社交行为 近端策略优化 行为分析
📋 核心要点
- 现有的多智能体强化学习方法在奖励设计上依赖手动选择,缺乏系统性和科学性。
- 本文提出通过人类神经和行为数据校准内疚信号,以此作为奖励塑造的基础,增强智能体的合作性。
- 实验结果显示,校准后的智能体在社交选择上与人类表现接近,且在KL散度上显著优于其他基线条件。
📝 摘要(中文)
合作多智能体强化学习通常通过手动选择的社会奖励项来增强个体奖励。本文探讨了能否从人类神经和行为数据中校准内疚信号并转移至人工智能体。利用公共的SoDec责任fMRI数据集(40名参与者),我们通过回归分析瞬时幸福感变化与结果类型计数的关系,得到了内疚权重。将该权重嵌入双智能体社交彩票环境中,训练独立的近端策略优化(PPO)智能体。实验结果表明,校准后的智能体在社交安全选择率上与人类表现最为接近,显示出人类神经行为先验可以作为社会奖励塑造的量化约束。
🔬 方法详解
问题定义:本文旨在解决多智能体强化学习中奖励设计的主观性和不一致性问题,现有方法往往依赖于手动选择的社会奖励项,缺乏科学依据。
核心思路:通过分析人类的神经和行为数据,校准内疚信号作为奖励塑造的量化基础,从而提高智能体的合作性和社会行为。
技术框架:研究使用SoDec责任fMRI数据集进行回归分析,提取内疚权重,并在双智能体社交彩票环境中应用该权重,训练PPO智能体。主要模块包括数据收集、内疚权重提取和智能体训练。
关键创新:最重要的创新在于将人类神经行为数据转化为量化的奖励信号,提供了一种新的奖励塑造方法,与传统的手动选择方法形成鲜明对比。
关键设计:在实验中,内疚权重被设定为Partner-negative与Social-negative的对比,具体数值为1.118,使用Cohen's d进行效果评估,确保了奖励塑造的科学性和有效性。
🖼️ 关键图片
📊 实验亮点
实验结果表明,校准后的智能体在1,000个评估回合中,其社交安全选择率为0.459,接近人类的0.484,KL散度为0.0012,显著优于其他三种基线条件,显示出该方法的有效性和优越性。
🎯 应用场景
该研究的潜在应用领域包括多智能体系统、机器人协作、社交机器人等。通过引入基于神经数据的奖励塑造方法,可以提升智能体在复杂社交环境中的表现,推动人机交互和智能系统的进一步发展。
📄 摘要(原文)
Cooperative multi-agent reinforcement learning often adds social terms to individual rewards, yet the scale of those terms is usually chosen by hand. We ask whether a guilt signal can instead be calibrated from human neural and behavioural data and transferred to artificial agents. Using the public SoDec responsibility fMRI dataset (40 participants), we fit a subject-fixed-effects regression of momentary-happiness changes on outcome-type counts and recover a guilt weight as the Partner-negative minus Social-negative contrast ($\hat{w}=1.118$, Cohen's $d=0.214$). We embed this weight in a two-agent Social Lottery environment and train independent Proximal Policy Optimization actor-critics under four shaping regimes: neurally calibrated, uniform constant, zero (selfish), and a unit-coefficient oracle. Across 1{,}000 evaluation episodes per condition, the calibrated agents track the human Social safe-choice rate most closely ($0.459$ vs.\ human $0.484$; $\mathrm{KL}=0.0012$), while the other three conditions deviate by one to three orders of magnitude in KL. Human neurobehavioural priors can therefore act as quantitative constraints on prosocial reward shaping.