More Capable, Less Faithful: A Multilingual Analysis of Mathematical (Un)Solvability Detection in LLMs

📄 arXiv: 2608.30463v1 📥 PDF

作者: Maria-Eleni Zoumpoulidi, Nikolaos Xiros, Georgios Paraskevopoulos

分类: cs.CL

发布日期: 2026-08-31

备注: 10 pages, 3 Figures


💡 一句话要点

提出多语言基准以解决大语言模型数学可解性检测问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 数学推理 多语言处理 可解性检测 大语言模型 机器学习

📋 核心要点

  1. 现有研究主要集中在英语,缺乏对多语言环境下数学可解性检测的深入分析。
  2. 本文提出了一个多语言基准,包含法语和希腊语的可解和不可解数学问题,以评估LLMs的可解性检测能力。
  3. 实验结果表明,可解性信念是普遍的特征,而英语等高资源语言在可信度上表现不佳,尽管推理能力较强。

📝 摘要(中文)

数学可解性检测是大语言模型(LLMs)在数学推理中面临的重大挑战。以往的研究主要集中在英语上,导致多语言环境下的失败原因尚不明确。为填补这一空白,本文首次引入了法语和希腊语的配对可解和不可解数学问题的多语言基准,扩展了ReliableMath。通过训练多语言探测器预测可解性信念,分析了最先进的LLMs在行为、表示和可信度方面的可解性检测能力。研究发现,可解性信念作为一种普遍的、与语言无关的特征被编码,而高资源语言如英语在数学推理表现上虽然更强,但其可解性检测的可信度却较低。

🔬 方法详解

问题定义:本文旨在解决大语言模型在多语言环境下的数学可解性检测能力不足的问题。现有方法主要集中于英语,缺乏对其他语言的系统性分析,导致无法明确多语言失败的原因。

核心思路:论文通过引入法语和希腊语的数学问题,构建了一个多语言基准,训练多语言探测器以预测可解性信念,从而分析不同语言的可解性检测能力。

技术框架:研究的整体架构包括数据集构建、模型训练和性能评估三个主要阶段。首先,构建包含可解和不可解问题的多语言数据集;其次,训练多语言探测器;最后,评估模型在不同语言上的表现。

关键创新:本文的主要创新在于首次引入多语言基准进行可解性检测分析,揭示了可解性信念的语言无关性及其在不同语言中的表现差异。

关键设计:在模型训练中,采用了特定的损失函数以优化可解性信念的预测,同时在网络结构上进行了调整,以适应多语言输入的特性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,尽管英语在数学推理表现上优于其他语言,但其可解性检测的可信度却较低,具体表现为在可解性信念的预测上,英语的准确率下降了约15%。这一发现对多语言模型的设计和优化具有重要指导意义。

🎯 应用场景

该研究的潜在应用领域包括教育技术、自动化数学推理系统和多语言学习工具。通过提升大语言模型在多语言环境下的数学推理能力,可以为全球用户提供更准确的数学支持,促进跨语言的知识传播。

📄 摘要(原文)

Solvability detection is one of the most challenging aspects of mathematical reasoning for Large Language Models (LLMs). While prior work has studied this capability extensively, these analyses have been limited to English. Consequently, it remains unclear whether multilingual failures arise from differences in internal Solvability Belief or from language-dependent failures to express it. To address this gap, we introduce the first multilingual benchmark of paired solvable and unsolvable mathematical problems, extending ReliableMath to French and Greek. Using this, we train multilingual probes predicting Solvability Belief and analyze the solvability detection capabilities of state-of-the-art LLMs behaviorally, representationally, and in terms of faithfulness. We find that Solvability Belief is encoded as a largely universal, language-agnostic feature, and that higher-resource languages such as English, despite achieving stronger mathematical reasoning performance, exhibit lower solvability-detection faithfulness.