VisKG-LM
一种知识图谱增强问答模型,通过将子图渲染为图像并离线缓存,避免推理时重复编码图结构,实现图编码与语言推理解耦,以约400M在线参数达到与7B视觉语言模型相当的性能
时间轴 (近 90 天)
VisKG-LM将知识图谱的图编码与语言推理解耦,将检索到的子图离线编译一次并缓存为只读的视觉记忆供复用,从而消除在线阶段的重复图传播计算
VisKG-LM先将检索到的候选子图序列化为关系标注路径(Relation-Labeled Paths),再将这些路径渲染成保留分支结构的二维图像
VisKG-LM在CommonsenseQA、OpenBookQA和MedQA-USMLE三个基准上相比GreaseLM基线分别提升了1.2、0.8和4.3个点
VisKG-LM仅用约4亿(400M)在线参数,就达到甚至超过了70亿(7B)参数的视觉-语言模型GraphVis
VisKG-LM在三个基准上分别领先仅接收相同关系标注路径文本的纯文本对照模型4.2、6.5和5.1个点
VisKG-LM在MedQA-USMLE上提升尤为显著,部分原因在于医学知识图谱关系密度高、推理链路长,适合视觉化二维布局保留多路径交叉结构
VisKG-LM是一篇arXiv预印本,其泛化能力、在更大规模知识图谱上的表现以及图像渲染成本仍有待更多验证
全部知识事实 (7)
VisKG-LM将知识图谱的图编码与语言推理解耦,将检索到的子图离线编译一次并缓存为只读的视觉记忆供复用,从而消除在线阶段的重复图传播计算
50%待验证VisKG-LM先将检索到的候选子图序列化为关系标注路径(Relation-Labeled Paths),再将这些路径渲染成保留分支结构的二维图像
50%待验证VisKG-LM在CommonsenseQA、OpenBookQA和MedQA-USMLE三个基准上相比GreaseLM基线分别提升了1.2、0.8和4.3个点
50%待验证VisKG-LM仅用约4亿(400M)在线参数,就达到甚至超过了70亿(7B)参数的视觉-语言模型GraphVis
50%待验证VisKG-LM在三个基准上分别领先仅接收相同关系标注路径文本的纯文本对照模型4.2、6.5和5.1个点
50%待验证VisKG-LM在MedQA-USMLE上提升尤为显著,部分原因在于医学知识图谱关系密度高、推理链路长,适合视觉化二维布局保留多路径交叉结构
50%待验证VisKG-LM是一篇arXiv预印本,其泛化能力、在更大规模知识图谱上的表现以及图像渲染成本仍有待更多验证
50%