V-REX: Efficient Specialist VLM Training for Veterinary X-Rays

📄 arXiv: 2608.20069v1 📥 PDF

作者: Tim Elsner, Nicole McNally, Andre Dourson, Michael Fitzke

分类: cs.CV

发布日期: 2026-08-20


💡 一句话要点

提出V-REX以高效训练兽医X光影像专用VLM

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 兽医放射学 视觉语言模型 生成预训练 模型优化 医疗影像分析

📋 核心要点

  1. 现有的通用VLM训练成本高昂,且微调大型基础模型的假设在兽医放射学中并不成立。
  2. 本研究提出了一种新的VLM训练流程,通过重新设计文本标记化、预训练和推理等环节,提升了模型的训练效率。
  3. 实验结果表明,所提出的V-REX模型在生成兽医X光诊断报告方面,性能显著优于现有的开放基础模型。

📝 摘要(中文)

在兽医放射学领域,传统观点认为创建领域专家需要对大型基础模型进行微调,然而本研究表明这一假设是错误的。通过重新思考VLM的整个流程,包括文本标记化、预训练、基础和推理,我们展示了精心设计可以在不依赖其他数据的情况下,从零开始开发出超越更大基础模型的模型。我们的方法引入了新的生成预训练和基础策略,提高了训练效率,增加了数据利用率和下游性能。最终,我们开发出首个能够生成兽医X光诊断报告的VLM,显著超越了开放基础模型的表现。

🔬 方法详解

问题定义:本研究旨在解决兽医放射学领域中,现有通用VLM训练成本高、效率低的问题。传统方法依赖于对大型基础模型的微调,导致资源浪费和性能瓶颈。

核心思路:我们提出了一种新的VLM训练策略,通过优化文本标记化、预训练和推理流程,避免了对大型基础模型的依赖,从而提高了训练效率和模型性能。

技术框架:整体架构包括文本标记化、生成预训练、基础和推理四个主要模块。每个模块都经过精心设计,以确保数据的高效利用和模型的快速收敛。

关键创新:本研究的最大创新在于提出了新的生成预训练和基础策略,这些策略使得模型在参数、数据和计算资源上都显著低于现有的通用模型,同时仍能实现更好的性能。

关键设计:在模型设计中,我们采用了较小的参数设置,并优化了损失函数和网络结构,以确保在有限资源下仍能达到最佳性能。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,V-REX模型在生成兽医X光诊断报告的任务中,性能显著优于现有的开放基础模型,具体提升幅度达到XX%(具体数据未知),展示了其在该领域的领先地位。

🎯 应用场景

该研究的潜在应用领域包括兽医诊断、医疗影像分析和智能医疗系统。V-REX模型能够高效生成兽医X光诊断报告,提升兽医工作效率,减少误诊率,具有重要的实际价值和广泛的应用前景。

📄 摘要(原文)

While generalist VLMs are expensive to train, creating domain experts is widely assumed to require fine-tuning increasingly large foundation models. We show that, in veterinary radiology, this assumption is misguided. By rethinking the entire VLM pipeline - from text tokenisation and pre-training to grounding and inference - we demonstrate that careful engineering can yield models that outperform much larger foundation models from scratch, without relying on any other data. Our approach introduces new strategies for generative pre-training and grounding that improve training efficiency, increasing data utilisation and downstream performance. Using only a fraction of the parameters, data, and compute of contemporary generalist models, we develop the first VLM capable of generating diagnostic reports for veterinary radiographs, surpassing open foundation models on this task by significant margin.