MDT
一种专为识别矛盾与犹豫情绪设计的多模态Transformer模型,通过显式编码跨模态差异特征(绝对差异特征和哈达玛积差异特征)来捕捉通道间冲突信号,采用9-token表示和FiLM文本条件调制机制
时间轴 (近 90 天)
MDT(Modality Discrepancy Transformer)是一种用于识别矛盾与犹豫(A/H)情绪的多模态方法,专门用来捕捉而非抹平跨模态冲突
MDT建立在Bekhouche等人提出的冲突感知多模态融合框架之上,其核心创新是把原有的6-token设计扩展为9-token表示
MDT的9个token由三个模态嵌入(面部、语音、语言)、三个绝对差异特征和三个哈达玛积差异特征构成
MDT中的绝对差异特征和哈达玛积差异特征通过线性投影学习得到,并作为输入表示的一等公民显式编码跨模态差异
MDT采用基于FiLM(Feature-wise Linear Modulation)的文本条件调制机制,让文本信号调制面部与语音特征
MDT使用LoRA(低秩适配)作为核心微调手段以降低训练成本
MDT在推理阶段引入文本引导的后期融合分支,将纯文本辅助预测头与完整多模态输出混合
MDT在第三届ABAW挑战赛的BAH数据集有标签测试集上取得0.7408的宏平均F1,在私有排行榜上取得0.7368的Macro F1
MDT相比已发表的最强基线方法领先超过10个百分点
MDT的整个训练过程在单块GPU上不到20分钟即可完成
还有 1 条时间轴事件
全部知识事实 (11)
MDT(Modality Discrepancy Transformer)是一种用于识别矛盾与犹豫(A/H)情绪的多模态方法,专门用来捕捉而非抹平跨模态冲突
50%待验证MDT建立在Bekhouche等人提出的冲突感知多模态融合框架之上,其核心创新是把原有的6-token设计扩展为9-token表示
50%待验证MDT的9个token由三个模态嵌入(面部、语音、语言)、三个绝对差异特征和三个哈达玛积差异特征构成
50%待验证MDT中的绝对差异特征和哈达玛积差异特征通过线性投影学习得到,并作为输入表示的一等公民显式编码跨模态差异
50%待验证MDT采用基于FiLM(Feature-wise Linear Modulation)的文本条件调制机制,让文本信号调制面部与语音特征
50%待验证MDT使用LoRA(低秩适配)作为核心微调手段以降低训练成本
50%待验证MDT在推理阶段引入文本引导的后期融合分支,将纯文本辅助预测头与完整多模态输出混合
50%待验证MDT在第三届ABAW挑战赛的BAH数据集有标签测试集上取得0.7408的宏平均F1,在私有排行榜上取得0.7368的Macro F1
50%待验证MDT相比已发表的最强基线方法领先超过10个百分点
50%待验证MDT的整个训练过程在单块GPU上不到20分钟即可完成
50%待验证MDT目前的验证仍局限于BAH单一数据集,其在更大规模、更多样化临床场景下的泛化能力仍有待检验
50%