When Machines Speak: A Unified Generative Framework for Integrating Machine-Native Symbols into Pretrained Large Language Models

📄 arXiv: 2608.19529v1 📥 PDF

作者: Su Yan, Rakesh Iyer

分类: cs.CL, cs.AI

发布日期: 2026-08-20

备注: Code: https://github.com/Stella-S-Yan/llm-internalization


💡 一句话要点

提出UniLang框架以解决语言模型与机器符号的整合问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 机器本地符号 生成模型 结构化预测 自然语言处理 预训练模型

📋 核心要点

  1. 现有方法在处理机器本地符号时,无法有效整合到预训练的语言模型中,导致语言建模与结构化预测之间的隔阂。
  2. 论文提出的UniLang框架将机器本地符号视为与自然语言标记并列的生成单元,从而实现了两者的联合建模。
  3. 在序列推荐和法律先例预测等任务中,UniLang的表现均优于现有强基线,展示了其在多领域应用的潜力。

📝 摘要(中文)

许多现实世界的AI系统使用离散的机器本地符号来表示实体、行为和结构化信息,而非自然语言。这些表示虽然紧凑且保留了任务相关的结构,但却超出了预训练大型语言模型(LLMs)的语言标记空间,造成了语言建模与结构化预测之间的根本鸿沟。本文提出了UniLang,一个统一的生成框架,通过将机器本地符号视为与自然语言标记并列的第一类生成单元,来弥合这一鸿沟。UniLang扩展了LLMs的词汇和嵌入空间,使文本和符号标记能够在单一自回归目标下共同建模和生成。该统一接口使得预训练的LLMs能够直接操作机器本地表示,而无需将其转化为自然语言或依赖于特定任务的架构。我们在两个结构上不同的任务上评估了UniLang,结果显示其在多个领域和结构化预测类型中均优于强基线。

🔬 方法详解

问题定义:本文旨在解决预训练大型语言模型与机器本地符号之间的整合问题。现有方法无法有效处理机器本地符号,导致语言模型在结构化预测任务中的应用受限。

核心思路:UniLang框架的核心思想是将机器本地符号视为与自然语言标记同等重要的生成单元,通过扩展模型的词汇和嵌入空间,实现两者的联合建模。

技术框架:UniLang的整体架构包括对预训练LLMs的扩展,增加机器本地符号的嵌入,并在自回归生成过程中同时处理文本和符号标记。主要模块包括符号嵌入层、联合建模层和生成层。

关键创新:UniLang的关键创新在于其统一的生成框架,使得机器本地符号能够直接参与生成过程,而无需转化为自然语言。这一设计突破了传统语言模型的局限。

关键设计:在参数设置上,UniLang采用了与LLMs一致的嵌入维度,并设计了新的损失函数以平衡文本和符号标记的生成目标。此外,网络结构上保持了自回归的生成机制,确保了生成过程的连贯性。

🖼️ 关键图片

img_0
img_1
img_2

📊 实验亮点

在序列推荐和法律先例预测任务中,UniLang的性能显著优于强基线,具体提升幅度达到XX%。这一结果表明,UniLang在处理结构化信息方面具有显著优势,展示了其作为通用生成建模基础的潜力。

🎯 应用场景

UniLang框架的潜在应用领域包括推荐系统、法律分析、智能问答等多个领域。通过有效整合机器本地符号,UniLang能够提升模型在结构化预测任务中的表现,具有广泛的实际价值和未来影响。

📄 摘要(原文)

Many real-world AI systems represent entities, behaviors, and structured information using discrete machine-native symbols rather than natural language. While these representations are compact and preserve task-relevant structure, they lie outside the linguistic token space of pretrained large language models (LLMs), creating a fundamental divide between language modeling and structured prediction. We introduce UniLang, a unified generative framework that bridges this divide by extending pretrained LLMs to treat machine-native symbols as first-class generative units alongside natural-language tokens. UniLang expands the LLM's vocabulary and embedding space with grounded machine-native representations, enabling textual and symbolic tokens to be jointly modeled and generated under a single autoregressive objective. This unified interface allows pretrained LLMs to directly operate on machine-native representations without requiring them to be verbalized as natural language or relying on task-specific architectures. We evaluate UniLang on two structurally distinct tasks, sequential recommendation and legal precedent prediction, spanning different domains and types of structured prediction. Across both tasks, UniLang consistently outperforms strong baselines, demonstrating a path toward extending pretrained LLMs beyond language and using them as a common generative modeling backbone for heterogeneous machine-native representations.