Action-grounded tissue affordance enables anticipatory auto-framing that lowers surgeon cognitive workload during laparoscopic surgery
作者: Jiayu Gu, Yiwei Wang, Jie Zhang, Guojun Cao, Keshen Lyu, Song Zhou, Yimeng Chen, Haorui Wang, Qingmin Feng, Shenchao Shi, Huan Zhao, Wenbin Chen, Caihua Xiong, Chidan Wan, Jing Samantha Pan, Xiong Cai, Han Ding
分类: cs.CV, cs.AI
发布日期: 2026-08-03
备注: Preprint. 54 pages, including supplementary information and 7 main figures
💡 一句话要点
提出DiffeoAfford框架以降低腹腔镜手术中外科医生的认知负担
🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)
关键词: 腹腔镜手术 计算注意力 组织追踪 自动标注 认知负担 手术辅助系统 可供性热点
📋 核心要点
- 现有计算注意力模型在腹腔镜手术中面临的挑战是需要密集的空间标签,而这些标签因手术意图的专业性而难以获得。
- 论文提出的DiffeoAfford框架通过回顾已完成的手术过程,结合组织追踪与器械轨迹分析,自动生成可供性热点标签。
- 实验结果表明,该框架与专家标注和外科医生的注视一致,并在主观、身体和行为测量中显著降低了外科医生的认知负担。
📝 摘要(中文)
计算注意力模型可以帮助外科医生管理腹腔镜手术中的视觉需求,但需要密集的空间标签,这些标签因手术意图的专业性和隐性而难以获取。本文介绍了DiffeoAfford,一个基于动作的组织可供性框架,通过对已完成手术过程的回顾性分析,推导出视觉注意力的监督信号。该框架结合了流形约束的组织追踪与器械轨迹分析,生成可供性热点标签,无需手动逐帧标注。基于这些标签训练的实时预测模型能够预判相关手术区域,并实现AffordView,一个辅助的自动框架系统,从而在实际评估中降低外科医生的认知负担。
🔬 方法详解
问题定义:本文旨在解决腹腔镜手术中外科医生面临的视觉负担问题,现有方法依赖于难以获取的密集空间标签,限制了计算注意力模型的应用。
核心思路:DiffeoAfford框架通过对已完成手术的回顾性分析,结合组织追踪与器械轨迹,自动生成可供性热点标签,避免了手动标注的复杂性。
技术框架:该框架包括两个主要模块:流形约束的组织追踪模块和器械轨迹分析模块,前者用于追踪组织形状变化,后者用于分析器械运动轨迹,最终生成可供性热点标签。
关键创新:DiffeoAfford的创新在于其能够自动生成视觉注意力标签,且与专家标注高度一致,显著减少了外科医生的认知负担,区别于传统依赖手动标注的方法。
关键设计:在技术细节上,框架采用流形约束的算法进行组织追踪,损失函数设计为结合空间一致性与时间连续性,确保生成的标签准确反映手术过程中的关键区域。
🖼️ 关键图片
📊 实验亮点
实验结果显示,DiffeoAfford框架在降低外科医生认知负担方面表现优异,与传统方法相比,主观评估和生理测量均显示出显著的改善,具体提升幅度未知。
🎯 应用场景
该研究的潜在应用领域主要集中在医疗手术辅助系统,特别是腹腔镜手术中。通过降低外科医生的认知负担,DiffeoAfford框架能够提高手术效率和安全性,未来可能扩展到其他类型的手术和医疗场景中。
📄 摘要(原文)
Computational attention models could help surgeons manage the visual demands of laparoscopy, but they require dense spatial labels that are difficult to obtain because surgical intent is highly specialized and tacit. Here, we introduce DiffeoAfford, an action-grounded tissue affordance framework that retrospectively derives visual attention supervision from completed surgical procedures. By combining diffeomorphism-constrained tissue tracking with instrument trajectory analysis, DiffeoAfford generates affordance hotspot labels without manual per-frame annotation. A real-time prediction model trained on these labels anticipates relevant surgical regions and enables AffordView, an assistive auto-framing system for laparoscopic visualization. The proposed framework aligns with expert annotations and intraoperative surgeon gaze, and reduces surgeon cognitive workload during real-world evaluations using subjective, physiological, and behavioral measures.