A Composable Evaluation System for Reproducible Omni-Modal Foundation Model Evaluation

📄 arXiv: 2609.01315v1 📥 PDF

作者: Hodong Lee, Sanghee Park, Dohoon Ryu, Jungwhan Kim, Junyeob Kim, Soyoon Kim, Geewook Kim

分类: cs.AI

发布日期: 2026-09-01

备注: 12 pages, 3 figures. Code: https://github.com/naver-ai/omni-evaluator

🔗 代码/项目: GITHUB


💡 一句话要点

提出可组合评估系统以解决多模态基础模型评估问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多模态评估 基础模型 推理引擎 评估框架 可重复性 系统集成 性能比较

📋 核心要点

  1. 现有的多模态评估工具在推理引擎和评估标准上不兼容,导致难以进行跨模态比较。
  2. OmniEvaluator通过连接现有工具,提供统一接口,简化了多模态模型的评估过程。
  3. 该系统支持多个推理后端和评估框架,且能记录完整配置,确保结果可重复性。

📝 摘要(中文)

构建一个多模态基础模型需要在文本、图像、视频和音频等多个领域进行评估。虽然现有的评估工具包在每种模态上表现优异,但它们的推理引擎、提示约定和指标实现相互不兼容,导致实践者不得不为每个工具链维护单独的环境,并且在比较结果时仍然面临困难。为了解决这一问题,OmniEvaluator应运而生,它连接了现有的推理引擎和评估库,提供了统一的接口,支持多个推理后端和评估框架,并记录每次运行的完整配置以确保可重复性。该系统的演示视频和仪表板均已公开。

🔬 方法详解

问题定义:论文旨在解决多模态基础模型评估中存在的工具不兼容和环境维护困难的问题。现有方法无法有效比较不同模态的评估结果,导致实践者面临挑战。

核心思路:论文提出的OmniEvaluator通过整合现有的推理引擎和评估库,提供一个统一的接口,简化了多模态模型的评估流程,避免了重复实现基准测试的需求。

技术框架:OmniEvaluator的整体架构包括四个推理后端、四个评估框架和超过一千个基准测试,所有运行结果都记录为可重现的工件,并流入共享仪表板以便进行跨模型比较。

关键创新:该系统的主要创新在于其可组合性和高层次的连接能力,使得不同模态的评估工具能够无缝协作,解决了现有方法的局限性。

关键设计:OmniEvaluator设计了一个内置验证器,能够在CPU上运行,确保在不同引擎和提示下的评分稳定性,同时避免了高成本的API调用。

🖼️ 关键图片

fig_0
img_1
img_2

📊 实验亮点

实验结果表明,OmniEvaluator在多个模态的评估中表现出色,能够有效地记录和比较不同模型的性能。与传统方法相比,该系统在评估稳定性和可重复性方面有显著提升,确保了评估结果的可靠性。

🎯 应用场景

该研究的潜在应用领域包括多模态人工智能模型的开发与评估,尤其是在需要同时处理文本、图像、视频和音频的任务中。通过提供统一的评估框架,研究者和开发者能够更高效地比较和优化模型性能,推动多模态技术的进步。

📄 摘要(原文)

Building an omni-modal foundation model means evaluating it across text, image, video, and audio. Excellent evaluation toolkits exist for each modality, but their inference engines, prompt conventions, and metric implementations are mutually incompatible, so practitioners end up maintaining separate environments for every toolchain and still struggle to compare results across them. OmniEvaluator grew out of this need in our own model development: rather than reimplementing benchmarks, it connects existing inference engines and curated evaluation libraries at a higher level, exposing four inference backends, four evaluation frameworks, and over a thousand benchmarks through a single interface. Every run is recorded as an artifact capturing the full configuration for exact reproduction, and results flow into a shared dashboard for cross-model comparison. A federated mode shares GPU inference servers across concurrent evaluations, and a built-in verifier, small enough to run on CPU, keeps its score stable across engines and prompts where rule-based scoring fluctuates under configuration mismatch, matching cost-efficient commercial LLM judges without their recurring API cost. The system, demo video, and dashboard are publicly available. (https://github.com/naver-ai/omni-evaluator)