Code as Representation: A Compilable Parsing Paradigm for Academic Documents

📄 arXiv: 2608.17550v1 📥 PDF

作者: Rihui Jin, Jun Wang, chengyuan zhu, Liang Mingyu, Yue Gao, Li Yunxuan, Kuicai Dong, Guilin Qi, Lin Ren, Yongrui Chen, Xinbang Dai, Jiaqi Li, Tongtong Wu, Gholamreza Haffari

分类: cs.CV, cs.CL

发布日期: 2026-08-18

备注: Accepted by ACM MM 2026


💡 一句话要点

提出可编译学术文档解析方法以解决科学知识表示问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 学术文档解析 多模态大语言模型 结构化学术元素 可编译文档 信息表示 科学知识管理

📋 核心要点

  1. 现有方法在解析学术文档时,无法有效保留文本与结构化学术元素的关系,导致信息丢失。
  2. 提出可编译学术文档解析(CADP)方法,通过将文档重构为LaTeX和可执行Python,提升信息表示的准确性。
  3. 实验结果显示,当前最先进的多模态大语言模型在生成可执行重构时仍存在显著不足,表明该领域有待进一步研究。

📝 摘要(中文)

学术论文是科学知识的主要载体,但大多数知识仍锁定在以人为阅读为优化的PDF中。对于多模态大语言模型(MLLMs),核心挑战不仅在于感知,还在于表示:科学页面交织着文本和结构化学术元素(SAEs),如表格、公式、图表和伪代码,其结构、数据和逻辑在常见替代格式(如Markdown)中难以保留。为此,本文提出可编译学术文档解析(CADP)方法,将完整页面重构为上下文相关的LaTeX和可执行的Python,以便重建、重新编译并直接验证结构保持元素和可执行图表表示。我们还引入CADP-Bench,这是一个经过专家验证的全学术页面基准,评估通过再注入编译协议进行的多种SAE类型的紧密耦合文本。研究表明,即使是前沿模型在生成高保真可执行重构方面仍然存在困难,显示出科学文档解析的结构感知方面有很大的改进空间。

🔬 方法详解

问题定义:本文旨在解决学术文档解析中信息表示不足的问题,现有方法难以有效保留文本与结构化学术元素(如表格、公式等)的关系,导致信息丢失和使用不便。

核心思路:提出可编译学术文档解析(CADP)方法,通过将学术页面重构为上下文相关的LaTeX和可执行的Python代码,确保结构保持元素和可执行图表的准确重建与验证。

技术框架:CADP的整体架构包括文档解析、结构重建和代码生成三个主要模块。首先解析输入的学术文档,然后重建其结构,最后生成可执行的代码以便于验证。

关键创新:CADP的核心创新在于将学术文档的结构化元素与可执行代码结合,形成一种新的表示方式,与传统的Markdown等方法相比,能够更好地保留信息的完整性和可操作性。

关键设计:在实现过程中,采用了特定的参数设置和损失函数,以优化结构重建的准确性,同时设计了适合学术文档特征的网络结构,以提高解析效果。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,当前最先进的多模态大语言模型在生成高保真可执行重构方面仍存在显著不足,尤其在处理复杂的结构化学术元素时,性能提升幅度有限,显示出该领域的研究潜力和改进空间。

🎯 应用场景

该研究的潜在应用领域包括学术文献管理、自动化文献分析和科研数据挖掘等。通过提高学术文档的解析和表示能力,能够促进科学知识的传播与利用,推动科研效率的提升。未来,该方法可能在教育、科研和信息检索等多个领域产生深远影响。

📄 摘要(原文)

Academic papers are a primary carrier of scientific knowledge, yet most of this knowledge remains locked in PDFs that are optimized for human reading rather than machine use. For Multimodal Large Language Models (MLLMs), the core challenge is not only perception, but representation: scientific pages interleave text with Structured Academic Elements (SAEs) such as tables, formulas, charts, and pseudocode, whose structure, data, and logic are poorly preserved by common surrogates like Markdown. We therefore propose Compilable Academic Document Parsing (CADP), a paradigm that reconstructs a full page as contextual \LaTeX{} plus executable Python, so that structure-preserving elements and executable chart representations can be reconstructed, recompiled, and directly verified against the source page. To support this setting, we introduce CADP-Bench, an expert-verified benchmark of full academic pages containing tightly coupled text and multiple SAE types, evaluated through a re-injection compilation protocol. We further study current capabilities using SOTA MLLMs and an exploratory multi-agent baseline that incorporates common agentic techniques. Results show that even frontier models still struggle to produce high-fidelity executable reconstructions, highlighting substantial room for improvement in structure-aware scientific document parsing. CADP-Bench is released for future research.