A Shaky Voice Is Not Always a Dodge: Benchmarking Textual and Vocal Evasion Detection in Earnings Calls
作者: Mirae Kim, Seonghun Jeong, Youngjun Kwak
分类: cs.CL, cs.SD
发布日期: 2026-08-28
备注: EMNLP 2026 Findings
💡 一句话要点
提出DualEvasion以解决财报电话会议中的多维规避检测问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 规避检测 多模态学习 财报电话会议 声调分析 文本分析 机器学习 投资决策
📋 核心要点
- 现有的规避检测方法主要依赖文本,忽视了口语交流中的多维信息,导致检测效果不佳。
- 本文提出DualEvasion基准,结合文本和音频数据共同检测规避,强调表达方式的重要性。
- 实验结果显示,现有多模态模型在声调自信检测上存在明显不足,特别是在不自信的回答中。
📝 摘要(中文)
现有的财报电话会议规避检测方法主要集中于文本转录,视规避为单维现象。本文认为,口头交流中的规避本质上是多维的:除了高管所说的内容,表达方式也携带独立且互补的信息。为此,我们引入DualEvasion,一个用于财报电话会议问答中跨文本和音频的规避检测基准。该基准包含来自60场财报电话会议的505个标注问答对,每个对都有两个独立标签:文本规避(直接与规避)和声调线索(自信与不自信)。实验表明,现有的多模态模型在检测声调自信方面表现不佳,尤其是在不自信的回答上。我们的分析表明,这些模型孤立地解释声学线索,而未考虑每位发言者的基线。提供发言者级别的参考虽有适度改善,但与人类表现之间仍存在显著差距。
🔬 方法详解
问题定义:本文旨在解决财报电话会议中规避检测的多维性问题。现有方法主要依赖文本数据,未能充分考虑口语表达中的声调信息,导致检测效果受限。
核心思路:论文提出DualEvasion基准,通过结合文本和音频数据,全面分析高管在电话会议中的规避行为,强调声调和表达方式的独立性与互补性。
技术框架:DualEvasion基准包含505个标注问答对,涵盖文本规避和声调自信两个维度。实验中使用多模态模型进行数据分析,评估其在不同维度上的表现。
关键创新:最重要的技术创新在于将声调自信作为独立的检测维度,与文本规避相结合,突破了传统单一文本分析的局限。
关键设计:在模型设计中,采用了多模态学习框架,结合声学特征与文本特征,使用了适应性损失函数以提高模型对声调的敏感性,同时引入发言者基线参考以改善检测效果。
🖼️ 关键图片
📊 实验亮点
实验结果显示,现有多模态模型在声调自信检测上表现不佳,尤其是在不自信的回答中,准确率显著低于人类水平。尽管引入发言者级别的参考有所改善,但与人类表现之间仍存在显著差距,表明该领域仍需进一步研究与优化。
🎯 应用场景
该研究的潜在应用领域包括财务分析、投资决策和企业沟通等。通过更准确地识别高管在电话会议中的规避行为,投资者和分析师可以更好地理解公司真实的财务状况和管理层的信心,从而做出更明智的决策。未来,该方法还可扩展至其他领域的多模态交流分析。
📄 摘要(原文)
Existing approaches to evasion detection in earnings calls focus on textual transcripts, treating evasion as a single-dimensional phenomenon. We argue that evasion in spoken communication is inherently multidimensional: beyond what executives say, how they say it carries independent and complementary information. To study these dimensions jointly, we introduce DualEvasion, a benchmark for evasion detection across text and audio in earnings call Q&A. The benchmark contains 505 annotated question-answer pairs from 60 earnings calls, each with two independent labels: textual evasion (direct vs. evasive) and vocal cues operationalized as speaker confidence (confident vs. unconfident). Our experiments show that state-of-the-art multimodal models struggle to detect vocal confidence, particularly on unconfident responses. Our analysis suggests these models interpret acoustic cues in isolation rather than relative to each speaker's baseline. Providing speaker-level references yields modest improvements, but a substantial gap with human performance remains.