Stratified Consistency Distillation for Natural Language Formalization

📄 arXiv: 2608.30258v1 📥 PDF

作者: Zhichao Hou, Ferhat Erata, Joe Lilien, MohamadAli Torkamani

分类: cs.CL, cs.AI

发布日期: 2026-08-31


💡 一句话要点

提出分层一致性蒸馏方法以提升自然语言到逻辑公式的翻译准确性

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 自然语言处理 逻辑翻译 一致性蒸馏 神经符号推理 模型微调

📋 核心要点

  1. 现有方法在自然语言到逻辑公式的翻译中准确性不足,且依赖提示工程,难以扩展。
  2. 提出了一种分层一致性蒸馏方法,通过生成多个逻辑翻译并进行聚类和投票来选择伪标签。
  3. 实验结果表明,该方法在Pass@K和等价逻辑相似性指标上均显著提升,验证了其有效性。

📝 摘要(中文)

神经符号推理通过结合大型语言模型(LLMs)和符号求解器在复杂推理任务中取得了良好效果。然而,如何提高自然语言到逻辑公式的翻译准确性仍然是一个挑战。现有方法主要依赖于提示工程,难以在不同领域和输入格式中扩展。本文提出了一种基于微调的分层一致性蒸馏方法:首先使用前沿LLM为每个输入生成K个逻辑翻译,并按语义等价性进行聚类;然后根据熵水平应用多数投票、LLM作为裁判或统一/弃权;最后,利用选定的伪标签对较小模型进行微调。实验结果显示,在Pass@K和新提出的等价逻辑相似性指标上均有显著提升,展示了通过一致性蒸馏推进逻辑翻译的潜力。

🔬 方法详解

问题定义:本文旨在解决自然语言到逻辑公式翻译的准确性问题。现有方法主要依赖提示工程,难以适应不同领域和输入格式,导致翻译效果不佳。

核心思路:提出的分层一致性蒸馏方法通过生成多个逻辑翻译并进行聚类,利用熵水平选择合适的伪标签,从而实现对较小模型的有效微调。

技术框架:整体流程包括三个主要阶段:首先,使用前沿LLM为每个输入生成K个逻辑翻译;其次,根据语义等价性对翻译结果进行聚类;最后,依据熵水平选择伪标签并对小模型进行微调。

关键创新:该方法的创新点在于通过一致性蒸馏策略,结合熵水平动态选择伪标签,克服了传统方法在多样性和准确性上的局限。

关键设计:在参数设置上,选择K个逻辑翻译的数量和熵阈值是关键设计。此外,损失函数的选择和小模型的结构设计也对最终效果有重要影响。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,所提方法在Pass@K指标上提高了X%,在等价逻辑相似性指标上提升了Y%。与基线方法相比,表现出显著的性能改进,验证了分层一致性蒸馏的有效性。

🎯 应用场景

该研究在自然语言处理和逻辑推理领域具有广泛的应用潜力,尤其是在法律文本分析、程序验证和智能问答系统中。通过提高翻译准确性,可以增强机器理解复杂逻辑的能力,推动相关技术的实际应用和发展。

📄 摘要(原文)

Neurosymbolic reasoning has shown promising success in addressing complex reasoning tasks by combining large language models (LLMs) and symbolic solvers. While this approach shows promise, a fundamental challenge remains: improving the accuracy of translations from natural language to logical formulas. Current methods predominantly rely on prompt engineering, which is difficult to scale across different domains and input formats. Drawing inspiration from the success of fine-tuning in other model adaptation and alignment applications, we propose a fine-tuning-based Stratified Consistency Distillation approach: (1) We generate K logical translations per input using a frontier LLM and cluster them by semantic equivalence (2) Based on the entropy level, we apply majority voting (low entropy), LLM-as-a-Judge (medium entropy), or unification/abstention (high entropy), and (3) fine-tune a smaller model using the selected pseudo-labels. Our experiments show significant and consistent improvements in both Pass@K and our novel Equivalent Logical Similarity metrics, demonstrating the potential of advancing logical translation through consistency distillation.