EMRB: A Multi-Level Benchmark for Evaluating LLM Reasoning over Raw Electromagnetic Signals

📄 arXiv: 2608.24086v1 📥 PDF

作者: Mingxu Zhang, Ying Sun, Yuhan Li, Yang Ji, Dazhong Shen, Ke Zhang, Shan Huang

分类: cs.AI, cs.CE, cs.SE

发布日期: 2026-08-25

🔗 代码/项目: GITHUB


💡 一句话要点

提出EMRB基准以评估LLM在原始电磁信号上的推理能力

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 电磁信号 大型语言模型 推理能力 基准测试 信号处理 自动化分析 ReconPilot 物理层测量

📋 核心要点

  1. 现有方法未能有效评估LLMs在分析原始电磁信号方面的能力,缺乏针对物理层测量的基准。
  2. EMRB基准通过提供原始I/Q数据,要求LLMs编写代码进行分析,涵盖多种信号类型和问题类型。
  3. 实验结果显示,14个LLMs的得分差异显著,ReconPilot方法有效提升了模型的整体表现。

📝 摘要(中文)

大型语言模型(LLMs)在科学和工程分析中的应用日益增多,但其分析原始物理层测量的能力尚未得到验证。本文介绍了EMRB(电磁推理基准),用于评估LLMs通过编写和运行代码分析原始I/Q数据的能力。EMRB包含200个问题,涵盖五个难度级别和27种问题类型,涉及信号检测到OFDM设计,所有问题均基于11种信号类型生成,并具有经过验证的真实值。与基于预处理特征或结构化表格的基准不同,EMRB仅提供原始捕获数据,问题所涉及的量必须通过代码发现。我们评估了14个LLMs,得分范围为24.1%到78.9%,基本测量的平均得分为84.9%,而系统设计的得分降至21.2%。此外,我们提出了ReconPilot,一种结构化方法,分离信号侦察、针对性分析和自我验证。通过三种基础模型,ReconPilot整体得分提高了3.8到17.6分,并改善了测试的15种基础模型组合中的13种。所有数据和代码已在我们的GitHub仓库公开发布。

🔬 方法详解

问题定义:本文旨在解决现有LLMs在分析原始电磁信号时的能力不足,尤其是在缺乏有效基准的情况下,无法验证其推理能力。

核心思路:EMRB基准通过提供未经处理的原始数据,要求LLMs通过编写代码来发现和分析信号特征,从而测试其推理能力。

技术框架:EMRB包含200个问题,分为五个难度级别和27种问题类型,涵盖从信号检测到OFDM设计的多种任务。ReconPilot方法则将信号分析过程分为信号侦察、目标分析和自我验证三个阶段。

关键创新:EMRB的创新之处在于其使用原始数据而非预处理特征,迫使LLMs在没有结构化信息的情况下进行推理,显著提高了评估的挑战性。

关键设计:在实验中,使用了14个不同的LLMs,评估其在不同问题类型上的表现,ReconPilot方法通过结构化分析流程提升了模型的整体得分。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,14个LLMs的得分范围为24.1%到78.9%,其中基本测量的平均得分为84.9%,而系统设计的得分降至21.2%。使用ReconPilot方法后,整体得分提高了3.8到17.6分,显著改善了模型性能。

🎯 应用场景

该研究的潜在应用领域包括信号处理、通信系统设计和自动化科学分析等。EMRB基准为评估和改进LLMs在处理复杂物理数据方面的能力提供了新的工具,未来可能推动更智能的科学计算和工程设计。

📄 摘要(原文)

Large language models (LLMs) are increasingly used as code agents for scientific and engineering analysis, but their ability to analyze raw physical-layer measurements remains untested. We introduce \textbf{EMRB} (\textbf{E}lectro\textbf{m}agnetic \textbf{R}easoning \textbf{B}enchmark), which evaluates whether LLMs can analyze raw I/Q data by writing and running code. EMRB contains 200 problems across five difficulty levels and 27 question types, from signal detection to OFDM design, generated from 11 signal types with verified ground truth. Unlike benchmarks built on preprocessed features or structured tables, EMRB provides only the raw capture; the quantities each question refers to must first be discovered through code. We evaluate 14 LLMs spanning proprietary, open-weight, and reasoning-oriented families. Scores range from 24.1\% to 78.9\%, with the mean dropping from 84.9\% on basic measurement to 21.2\% on system design. We also propose \textbf{ReconPilot}, a structured method that separates signal reconnaissance, targeted analysis, and self-verification. Across three backbones, ReconPilot raises the overall score by 3.8 to 17.6 points and improves 13 of 15 backbone-level combinations tested. All data and code are publicly released in \href{https://github.com/mingxuZhang2/EMRB}{\textcolor{blue}{our GitHub repository}}.