SignalReasoner: Assessing the Upper Bound of 3B Models for Signal Mathematical Reasoning

📄 arXiv: 2608.17301v1 📥 PDF

作者: Guozheng Sun

分类: cs.AI

发布日期: 2026-08-18


💡 一句话要点

提出SignalReasoner以提升信号数学推理能力

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 信号处理 数学推理 强化学习 监督微调 大型语言模型 优化策略

📋 核心要点

  1. 现有大型语言模型在信号处理领域的数学推理能力较弱,应用研究相对不足。
  2. 论文提出通过强化学习和监督微调相结合的方法,针对信号数学问题进行优化。
  3. 实验结果显示,最佳模型的准确率达到39.12%,相比未训练模型提升超过三倍,验证了方法的有效性。

📝 摘要(中文)

通过监督链式思维微调和来自可验证奖励的强化学习,后训练显著提升了大型语言模型的数学推理能力。然而,这些模型在信号处理问题上的应用仍然相对欠缺。本报告探讨了强化微调策略,以将Qwen2.5-3B-Base适应于WirelessMATHBench-XL中的研究生级信号数学问题。我们考察了两种训练范式:直接在WirelessMATHBench-XL上进行强化学习,以及在蒸馏的无线领域链式思维语料库上进行监督微调,随后进行领域特定的强化学习。通过基准测试,我们评估了不同优化策略的效果。我们的最佳模型整体准确率达到39.12%,相比未训练的基础模型提升超过三倍。

🔬 方法详解

问题定义:本研究旨在解决大型语言模型在信号处理领域数学推理能力不足的问题。现有方法在此领域的应用效果不佳,缺乏有效的训练策略。

核心思路:论文提出结合监督微调和强化学习的训练策略,以适应特定的信号数学问题。通过在领域特定数据集上进行训练,提升模型的推理能力。

技术框架:整体架构包括两个主要阶段:首先在WirelessMATHBench-XL上进行直接强化学习,其次在蒸馏的无线领域链式思维语料库上进行监督微调,最后再进行领域特定的强化学习。

关键创新:最重要的技术创新在于引入了领域感知的链式思维微调作为强化学习的有效初始化,探索了不同优化策略(GRPO、GSPO、GMPO)在信号推理任务中的表现。

关键设计:在训练过程中,采用了可验证奖励机制,并对不同优化策略进行了比较,重点关注稳定性和准确性。模型的参数设置和损失函数设计均针对信号处理问题进行了优化。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

实验结果表明,最佳模型在信号数学推理任务中的整体准确率达到39.12%,相比未训练的基础模型(12.37%)提升超过三倍,验证了所提出方法的有效性和优势。

🎯 应用场景

该研究的潜在应用领域包括无线通信、信号处理和自动化数学推理等。通过提升大型语言模型在信号数学推理方面的能力,可以为相关领域的研究和工程实践提供更强大的支持,推动智能系统在复杂信号处理任务中的应用。

📄 摘要(原文)

Post-training with supervised chain-of-thought fine-tuning and reinforcement learning from verifiable rewards has substantially improved the mathematical reasoning capabilities of large language models (LLMs). However, their application to signal processing problems remains relatively under-explored. This report investigates reinforcement fine-tuning strategies for adapting Qwen2.5-3B-Base to graduate-level signal mathematical problems from WirelessMATHBench-XL, a comprehensive benchmark for mathematical reasoning in this domain. We examine two training paradigms: (i) direct reinforcement learning (RL) on WirelessMATHBench-XL with verifiable rewards; and (ii) supervised fine-tuning (SFT) on a distilled wireless-domain chain-of-thought corpus, followed by the same domain-specific RL stage. Across both paradigms, we benchmark Group Relative Policy Optimization (GRPO), Group Sequence Policy Optimization (GSPO), and Geometric-Mean Policy Optimization (GMPO). We aim to assess whether domain-aware CoT SFT serves as an effective initialization for subsequent RL, and whether GSPO or GMPO offer advantages in stability or accuracy over GRPO for signal reasoning tasks. Our best model achieves an overall accuracy of 39.12\%, representing a more than threefold improvement over the untrained Base model (12.37\%).