基于协同注意力的视觉-语言嵌入用于机器人手术视觉问题定位回答

作者 : admin 本文共512个字,预计阅读时间需要2分钟 发布时间: 2024-06-5 共2人阅读

文章目录

  • CAT-ViL: Co-attention Gated Vision-Language Embedding for Visual Question Localized-Answering in Robotic Surgery
    • 摘要
    • 方法
    • 实验结果

CAT-ViL: Co-attention Gated Vision-Language Embedding for Visual Question Localized-Answering in Robotic Surgery

摘要

  1. 医学生和初级外科医生经常依赖于资深外科医生和专家来回答他们在学习手术过程中的问题,但专家通常忙于临床和学术工作,很难提供指导。
  2. 现有基于深度学习的外科视觉问题回答(VQA)系统只能提供简单的答案,而无法给出答案的位置信息。同时,视觉-语言(ViL)嵌入在这类任务中也鲜有研究。
  3. 因此,一个能够提供视觉问题定位回答(VQLA)的系统对于医学生和初级外科医生学习和理解手术视频会很有帮助。
    论文提出了一种基于端到端Transformer的CAT-ViL (Co-Attention gaTed Vision-Language)嵌入模型用于外科VQLA任务,不需要通过检测模型进行特征提取。
    代码地址

方法

基于协同注意力的视觉-语言嵌入用于机器人手术视觉问题定位回答插图

实验结果

基于协同注意力的视觉-语言嵌入用于机器人手术视觉问题定位回答插图(1)
基于协同注意力的视觉-语言嵌入用于机器人手术视觉问题定位回答插图(2)
基于协同注意力的视觉-语言嵌入用于机器人手术视觉问题定位回答插图(3)
基于协同注意力的视觉-语言嵌入用于机器人手术视觉问题定位回答插图(4)

本站无任何商业行为
个人在线分享 » 基于协同注意力的视觉-语言嵌入用于机器人手术视觉问题定位回答
E-->