CultureConverse: A Multilingual Multi-turn Simulation Harness for Culturally Grounded Assistance in East and Southeast Asia
作者: Bryan Chen Zhengyu Tan, Weihua Zheng, Thong T. Doan, Bich Ngoc Doan, Jia Wang Peh, Xiaoyuan Yi, Jing Yao, Xing Xie, Nancy F. Chen, Zhengyuan Liu, JinYeong Bak, Wafi Shamdi, Soo Kai Chie, Liew Yu Siong, Aina Azyyati Binti Mohamad Rezal, Lew Yan Yan Vanessa, Huadan Wu, Dylan Raharja, Nadya Yuki Wangsajaya, Akane Fukushige, Kazushi Kato, Koji Inoue, Tatsuya Kawahara, Jaehyung Seo, Dongjun Kim, Seungyoon Lee, Zi Haur Pang, Rui Yang Tan, Charibeth Ko Cheng, Maria Regina Justina Estuar, Jann Railey Montalan, Pham Minh Duc, Roy Ka-Wei Lee
分类: cs.CL, cs.CY
发布日期: 2026-08-28
备注: EMNLP 2026
💡 一句话要点
提出CultureConverse以解决多轮文化背景对话的评估问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多轮对话 文化适应性 语言模型 智能助手 评估框架
📋 核心要点
- 现有的文化评估方法往往仅依赖单轮选择题,无法有效反映用户在多轮对话中寻求文化帮助的需求。
- CultureConverse通过模拟多轮对话场景,提供了一个多语言的评估平台,能够涵盖多种文化背景和身份特征。
- 在对18个模型的基准评估中,GPT-5 mini表现最佳,且通过微调显著提升了模型在文化相关任务中的表现。
📝 摘要(中文)
当前对大型语言模型(LLMs)的文化评估通常通过单轮选择题来简化文化内涵,未能捕捉用户在多轮文化场景中寻求实际帮助的常见用例。我们提出了CultureConverse,这是一个可扩展的多语言模拟和评估平台,涵盖东南亚10个地区、58个子群体身份和7个领域。每个模拟和评估的对话产生一个评分交互,助手在部分信息的基础上推断文化约束。CultureConverse-DS数据集包含14,610个基准评估对话和274,295个金标准对话。我们的基准评估显示,GPT-5 mini在辅助质量上表现最佳。人类注释实验表明,我们的评估框架足以作为人类判断的代理。通过在27,860个高质量样本上进行微调,模型在领域内的辅助能力得到了提升,并且在文化选择题和安全分类基准上也有迁移效果。我们发布了该平台及其数据集,以支持文化能力的互动评估。
🔬 方法详解
问题定义:本研究旨在解决当前文化评估方法在多轮对话中无法有效捕捉用户需求的问题。现有方法主要依赖单轮选择题,无法反映复杂的文化背景和用户交互。
核心思路:CultureConverse通过构建一个多语言的对话模拟平台,允许用户在多轮对话中获得文化背景的帮助,从而更真实地反映用户的实际需求。
技术框架:该平台包括多个模块,首先是对话生成模块,模拟用户与助手的交互;其次是文化约束推断模块,根据用户提供的部分信息推断其文化背景;最后是评估模块,对交互进行评分和分析。
关键创新:最重要的创新在于引入了多轮对话的评估框架,能够在真实场景中评估助手的文化适应能力,与传统的单轮选择题评估方法形成鲜明对比。
关键设计:在模型训练中,使用了27,860个高质量的CultureConverse-DS样本,设计了特定的损失函数以优化多轮对话的生成质量,并通过人类注释验证了评估的有效性。
🖼️ 关键图片
📊 实验亮点
在对18个模型的基准评估中,GPT-5 mini在辅助质量上表现最佳,显示出显著的性能提升。通过微调,模型在文化相关任务中的表现得到了显著改善,尤其是在领域内的辅助能力和跨领域的迁移能力上。
🎯 应用场景
CultureConverse的研究成果可广泛应用于智能助手、客服系统以及教育领域,帮助这些系统更好地理解和适应不同文化背景的用户需求。未来,该平台还可以扩展到其他地区和文化,提升全球范围内的对话系统的文化适应性。
📄 摘要(原文)
Current cultural evaluations for large language models (LLMs) often reduce culture to single-turn factual recall via MCQs, failing to capture a common use case: users seeking practical help over multiple turns in culturally grounded scenarios. We introduce CultureConverse, a scalable, multilingual simulation and evaluation harness for culturally grounded assistant dialogue that covers 10 East and Southeast Asian regions, 58 subgroup identities, and 7 domains. Each simulated and evaluated episode produces a scored interaction where the assistant assists the user and infers cultural constraints from partial information. The resulting CultureConverse-DS dataset contains 14,610 benchmark (evaluation) episodes and 274,295 oracle-guided (gold-mode) dialogues. In our benchmark evaluation of 18 models, GPT-5 mini achieves the highest assistance quality. Human annotation experiments suggest that our evaluation framework is a sufficient proxy for human judgment. Performance gains from fine-tuning on 27,860 high-quality CultureConverse-DS samples improve in-domain assistance and transfer out-of-domain to cultural MCQ and safety classification benchmarks. We release the harness, both splits, and judge prompts to support interactive evaluation of cultural competency.