Loom: Weaving Diagnostic Strands into Free-Text Consensus via Embedding-Space Reweighting
作者: Ron Begleiter, Katya Egert Berg, Gilad Saban, Gil Shabat
分类: cs.AI, cs.CL, cs.LG
发布日期: 2026-09-02
备注: Accepted to EMNLP 2026
💡 一句话要点
提出Loom框架以解决工业环境中的文本假设聚合问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 自然语言处理 根本原因分析 文本聚合 嵌入空间 弱监督学习 大型语言模型 工业应用
📋 核心要点
- 现有方法在处理嘈杂和冲突的文本假设时,面临上下文限制和推理延迟等挑战。
- Loom框架通过将假设投影到连续嵌入空间,并使用质心重加权算法来聚合和解决冲突信号。
- 在OpenRCA基准测试中,Loom在多个数据集上表现出色,显著提高了处理速度和准确性。
📝 摘要(中文)
在实际工业环境中,聚合嘈杂且相互冲突的文本假设以形成可靠的共识是自然语言处理系统面临的基本挑战。虽然单一的大型语言模型(LLM)在根本原因分析(RCA)等任务中表现出极大的表达能力,但它们存在上下文限制、幻觉累积和推理延迟等问题。传统的弱监督方法虽然具有统计严谨性,但在数学上仅限于离散类别。本文提出的Loom框架通过将开放形式的假设投影到连续嵌入空间,并利用迭代的质心重加权算法解决冲突信号,从而实现了对真实世界RCA的有效聚合。Loom在OpenRCA基准测试中的表现显示,它在准确性和效率之间达到了优越的平衡。
🔬 方法详解
问题定义:本文旨在解决在工业环境中聚合嘈杂和冲突的文本假设所面临的挑战。现有的单一大型语言模型(LLM)在处理此类问题时存在上下文限制和推理延迟,传统的弱监督方法则仅限于离散类别,无法有效应对开放形式的假设聚合。
核心思路:Loom框架的核心思路是将开放形式的假设通过嵌入空间进行投影,并利用质心重加权算法来解决冲突信号,从而形成一个可靠的共识。这种设计使得模型能够在保持灵活性的同时,克服传统方法的局限性。
技术框架:Loom的整体架构包括多个主要模块:首先,使用模块化启发式生成开放形式的假设;其次,将这些假设投影到连续的嵌入空间;最后,通过迭代的质心重加权算法来聚合假设并生成共识,最终通过轻量级LLM进行合成。
关键创新:Loom的最重要创新在于其通过嵌入空间重加权的方式有效聚合开放形式的假设,这与传统的离散类别聚合方法有本质区别。该方法不仅提高了聚合的灵活性,还显著降低了推理延迟。
关键设计:在设计中,Loom采用了迭代的质心重加权算法,并通过动态填充的诊断模板来生成假设。这些模板根据特定事件的实体、时间和指标进行填充,确保了聚合过程的上下文相关性。
🖼️ 关键图片
📊 实验亮点
在OpenRCA基准测试中,Loom在Bank和Market-2数据集上与最先进的自主代理匹敌,并在Market-1和Telecom数据集上表现良好。Loom在所有四个数据集上每个事件仅使用一次LLM调用,速度提升约26倍,使用8B参数合成器时提升约33倍,展现了其在准确性与效率之间的优越平衡。
🎯 应用场景
Loom框架在根本原因分析(RCA)等实际应用中具有广泛的潜在价值,能够有效处理工业环境中的复杂文本数据。其灵活的假设聚合能力使其适用于需要快速响应和高准确性的场景,如故障诊断和决策支持系统。未来,Loom的设计理念可以扩展到其他领域,如医疗诊断和金融分析等。
📄 摘要(原文)
Aggregating noisy, conflicting textual hypotheses into a reliable consensus is a fundamental challenge when deploying NLP systems in real-world industrial settings. While monolithic Large Language Model (LLM) agents offer unbounded expressivity for tasks like Root Cause Analysis (RCA), they suffer from context limits, compounding hallucinations, and prohibitive inference latency. Traditional weak supervision offers statistical rigor but is mathematically restricted to discrete classes. We present Loom, a generative consensus framework deployed for real-world RCA that bridges these paradigms. Loom aggregates open-form hypotheses emitted by modular heuristics (diagnostic templates dynamically populated with episode-specific entities, times, and metrics) by projecting them into a continuous embedding space, and resolves conflicting signals with an iterative centroid-based reweighting algorithm. The resulting consensus weights ground a single lightweight LLM synthesis step. Evaluated on the OpenRCA benchmark, Loom occupies the accuracy--efficiency Pareto frontier: it matches a state-of-the-art autonomous agent on Bank and Market-2 and trails on Market-1 and Telecom, while using a single LLM call per incident on all four datasets ($\sim$26$\times$ faster; $\sim$33$\times$ with an 8B-parameter synthesizer). We discuss our deployment experience, highlighting lessons learned regarding the trade-offs between agentic depth and inference latency, negative results in redundancy detection, and how deterministic consensus fosters trust among Subject Matter Experts~(SMEs).