[控场AI]
· 4 分钟阅读· 2,324 字

SCOPE-4D:内窥镜4D几何基础模型如何破解手术导航难题

SCOPE-4D:内窥镜4D几何基础模型如何破解手术导航难题

SCOPE-4D通过大规模数据集与运动分解机制,实现内窥镜场景下相机、深度与组织轨迹的联合4D几何理解。

SCOPE-4D是一个专为内窥镜场景设计的4D几何基础模型,能够从单目RGB视频中单次前向推理,同时预测相机参数、稠密几何结构与三维组织运动轨迹。研究团队构建了包含约5000段视频的SCOPE-5K数据集,涵盖真实与合成的胃肠道内窥镜和腹腔镜场景,为模型提供几何监督信号。核心技术创新是Common-Residual Motion(CRM)机制,将运动分解为共性运动与残差运动两部分,有效解决了内窥镜场景中相机运动与组织形变难以区分的固有歧义。实验结果显示,模型在多个公开及新采集基准上表现稳健,在长序列结肠重建和三维组织追踪上尤具优势,并通过盲测用户研究验证了临床视频上的重建质量。

内窥镜几何理解的双重困境

在微创手术和机器人辅助操作中,精准的几何理解是实现可靠导航的前提。然而内窥镜场景下的几何学习长期面临两个棘手问题:一是几何标注数据极度稀缺,获取高质量的三维标签成本高昂;二是相机运动与组织形变之间存在固有的歧义性——当画面发生变化时,算法很难判断究竟是镜头在移动,还是柔软的组织本身在变形。

这两个挑战直接制约了内窥镜导航和机器人辅助系统的可靠性。SCOPE-4D 的提出,正是针对这一痛点给出的系统性解决方案。它是一个专门面向内窥镜场景的 4D 几何基础模型,能够从单目 RGB 视频中,通过单次前向推理同时预测相机参数、稠密几何结构以及三维组织运动轨迹。

SCOPE-4D: Endoscopic 4D Geometry Foundation Models

SCOPE-5K:大规模内窥镜几何数据集

基础模型的能力很大程度上取决于训练数据的规模与质量。研究团队构建了一套数据整理与标注流程,产出了名为 SCOPE-5K 的数据集。该数据集包含约 5000 段视频片段,覆盖真实与合成两类来源,涉及胃肠道内窥镜和腹腔镜等多种手术场景。

这一数据集的价值不仅在于规模,更在于其提供了丰富的几何监督信号。此外,团队还新采集了体模(phantom)数据和真实结肠镜检查的评测集,为模型在真实临床环境下的表现提供了可靠的验证基准。在几何标注长期稀缺的内窥镜领域,这样一个覆盖真实与合成场景的数据集,本身就是对社区的重要贡献。

体模(phantom)数据是指使用模拟人体器官结构的人工制品采集的数据,常见形式包括3D打印的肠道模型或硅胶制成的腹腔模型。与真实临床视频相比,体模数据的优势在于可以获取精确的地面真值(ground truth)几何信息——例如通过光学追踪系统同步记录相机位姿和组织形变。这使得体模数据集成为评估几何估计算法的理想基准,但其外观和形变特性与真实人体组织仍存在差距,因此研究团队同时纳入真实结肠镜检查视频作为互补验证,二者共同构成了更具说服力的评测体系。

CRM 运动约束:分离组织形变与相机运动

SCOPE-4D 的技术核心之一是如何处理相机运动与组织形变的歧义。模型首先在 SCOPE-5K 上进行几何监督微调(Geometric Supervised Fine-tuning),从中学习内窥镜场景特有的几何先验,从而改善相机位姿和深度估计的准确性。

在此基础上,研究引入了 Common-Residual Motion(CRM,共性-残差运动) 机制。CRM 的思路是将组织的局部形变约束在相对于整体组织运动的框架之下——即把运动分解为"共性运动"与"残差运动"两部分。这一设计巧妙地缓解了相机与组织运动难以区分的问题。

实验表明,CRM 与轨迹监督相结合,在几何微调的基础上进一步提升了相机和深度估计的效果,同时还使模型具备了稠密三维组织追踪的能力。这意味着模型不仅能重建静态几何,还能跟踪软组织在时间维度上的动态变化,这正是"4D"的含义所在。

几何监督微调(Geometric Supervised Fine-tuning)的基础通常是预训练的通用视觉基础模型,例如针对自然场景训练的深度估计或相机位姿估计网络。由于自然场景与内窥镜场景在光照(强烈的点光源、镜面反光)、纹理(湿润黏膜的均匀低纹理)和场景动态(软组织蠕动)上存在显著分布差异,直接迁移效果往往不理想。微调阶段利用 SCOPE-5K 提供的几何标签,使模型学习内窥镜特有的深度分布和相机运动模式,从而将通用视觉模型的表征能力适配到这一高度专业化的应用域。

实验验证:从公开基准到临床视频

在多个公开及新采集的基准测试上,SCOPE-4D 展现出较强的几何估计能力,无论是领域内(in-domain)还是跨领域(out-of-domain)场景都表现稳健。在三维追踪任务上,模型相比现有方法具有明显优势,并且在长序列结肠重建中表现出更好的稳定性——长序列的稳定性恰恰是实际手术导航中最具挑战的环节之一。

研究团队还进行了一项盲测用户研究(blinded user study),结果支持了该模型在真实临床视频上的重建质量感知评价。这种引入人类主观评估的做法,弥补了纯客观指标难以反映临床实用价值的不足。

盲测用户研究(blinded user study)在医疗影像评估中具有特殊意义。由于内窥镜三维重建缺乏统一的临床质量标准,纯数值指标(如深度误差、轨迹误差)未必能反映外科医生实际使用时的感受。盲测通常邀请具备临床或手术经验的评估者,在不知晓方法来源的情况下对多组重建结果进行偏好排序或评分,从而获得更贴近真实使用场景的质量判断。这种人在回路(human-in-the-loop)的评估方式也日益成为手术AI领域论文的重要验证手段,有助于弥合算法性能与临床实用价值之间的鸿沟。

意义与展望

SCOPE-4D 的工作揭示了两个关键要素对内窥镜几何理解的价值:大规模的几何监督,以及针对运动歧义的专门约束机制。前者解决了数据稀缺问题,后者解决了相机与组织运动的本质性混淆。

将相机参数、稠密几何与三维轨迹的联合预测整合到单次前向推理中,不仅提升了精度,也为实时性应用奠定了基础。对于手术导航、机器人辅助以及术中三维重建等临床场景而言,这类基础模型的成熟将有望显著降低几何感知的门槛。随着内窥镜领域专用基础模型的不断演进,几何理解能力有望成为下一代智能手术系统的标准组件。

分享:

相关推荐