MURANO: Design, Run, and Reproduce Mechanistic Interpretability Experiments as Composable Pipelines

📄 arXiv: 2608.30662v1 📥 PDF

作者: Alireza Bayat Makou, Emirhan Böge, Phu Gia Hoang, Federico Tiblias, Jingcheng Niu, Subhabrata Dutta, Richard Eckart de Castilho, Iryna Gurevych

分类: cs.CL

发布日期: 2026-08-31

备注: Accepted to the EMNLP 2026 System Demonstrations Track. 11 pages, 6 figures, 2 tables


💡 一句话要点

提出Murano框架以解决机制可解释性研究的整合问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 机制可解释性 开源框架 研究效率 可组合步骤 大型语言模型 实验重现 跨学科研究

📋 核心要点

  1. 现有的可解释性研究库往往只关注工作流程的某一部分,导致研究人员需要在多个库之间进行适配,增加了工作复杂性。
  2. Murano框架通过将加载、记录、归因、干预和评估等操作整合为可组合的步骤,简化了可解释性研究的工作流程。
  3. 通过重现已有的可解释性研究和案例研究,Murano展示了其在研究效率和可重复性方面的显著提升。

📝 摘要(中文)

本文介绍了Murano,一个开源框架,旨在设计、运行和重现大型语言模型的机制可解释性研究,适用于各学科研究人员。这些研究通常结合了加载、记录、归因、干预和评估等多个环节,而现有库往往只关注这些工作流程的不同部分。因此,使用多个库的研究人员可能需要调整一个库的输出以供另一个库使用。为了解决这一问题,Murano将这五个领域的操作表示为可组合的步骤,步骤之间可以交换命名的结果工件,并声明所需的输入和产生的输出。Murano在现有的可解释性和机器学习库基础上构建,通过两个已建立的可解释性研究的重现和一个稀疏自编码器的案例研究展示了Murano的应用。

🔬 方法详解

问题定义:本文旨在解决现有可解释性研究库在工作流程整合上的不足,研究人员在使用多个库时面临的适配问题。

核心思路:Murano框架的核心思想是将可解释性研究的多个操作整合为可组合的步骤,允许步骤之间通过命名的结果工件进行交互,从而简化研究流程。

技术框架:Murano的整体架构包括五个主要模块:加载、记录、归因、干预和评估。每个模块都可以独立执行,并通过定义输入和输出进行连接。

关键创新:Murano的创新之处在于其可组合性设计,允许研究人员灵活地构建和调整研究流程,而不是依赖于单一库的固定功能。这种设计使得不同操作之间的协作更加高效。

关键设计:Murano使用标准化的地址来管理组件身份的传递,确保在不同步骤之间的结果可以无缝对接。此外,框架支持多种输入输出格式,以适应不同的研究需求。

🖼️ 关键图片

fig_0
img_1
img_2

📊 实验亮点

通过重现两个已建立的可解释性研究,Murano展示了其在实验设计和执行上的高效性,显著提高了研究的可重复性和可靠性。案例研究表明,Murano能够有效整合不同操作,提升研究效率。

🎯 应用场景

Murano框架在机制可解释性研究中具有广泛的应用潜力,能够帮助研究人员更高效地设计和重现实验,推动对大型语言模型的理解和应用。未来,该框架可扩展至其他机器学习领域,促进跨学科的研究合作。

📄 摘要(原文)

This paper presents Murano, an open source framework for designing, running, and reproducing mechanistic interpretability studies of large language models, intended for researchers across disciplines. These studies often combine loading, recording, attribution, intervention, and evaluation, while existing libraries tend to focus on different parts of this workflow. As a result, researchers using several libraries may need to adapt outputs from one for use by another. To bridge this gap, Murano represents operations from these five areas as composable steps. Steps exchange named result artifacts and declare the inputs they require and the outputs they produce. A pipeline executes its steps in the order supplied, and Murano uses canonical addresses when component identities pass between operations. Murano builds on existing interpretability and machine learning libraries. We demonstrate Murano through two reproductions of established interpretability studies and one illustrative sparse autoencoder case study.