[控场AI]
模型Modality Discrepancy Transformer / 模态差异Transformer

MDT

一种专为识别矛盾与犹豫情绪设计的多模态Transformer模型,通过显式编码跨模态差异特征(绝对差异特征和哈达玛积差异特征)来捕捉通道间冲突信号,采用9-token表示和FiLM文本条件调制机制

时间轴 (近 90 天)

9月18日

MDT(Modality Discrepancy Transformer)是一种用于识别矛盾与犹豫(A/H)情绪的多模态方法,专门用来捕捉而非抹平跨模态冲突

待验证50%
9月18日

MDT建立在Bekhouche等人提出的冲突感知多模态融合框架之上,其核心创新是把原有的6-token设计扩展为9-token表示

待验证50%
9月18日

MDT的9个token由三个模态嵌入(面部、语音、语言)、三个绝对差异特征和三个哈达玛积差异特征构成

待验证50%
9月18日

MDT中的绝对差异特征和哈达玛积差异特征通过线性投影学习得到,并作为输入表示的一等公民显式编码跨模态差异

待验证50%
9月18日

MDT采用基于FiLM(Feature-wise Linear Modulation)的文本条件调制机制,让文本信号调制面部与语音特征

待验证50%
9月18日

MDT使用LoRA(低秩适配)作为核心微调手段以降低训练成本

待验证50%
9月18日

MDT在推理阶段引入文本引导的后期融合分支,将纯文本辅助预测头与完整多模态输出混合

待验证50%
9月18日

MDT在第三届ABAW挑战赛的BAH数据集有标签测试集上取得0.7408的宏平均F1,在私有排行榜上取得0.7368的Macro F1

待验证50%
9月18日

MDT相比已发表的最强基线方法领先超过10个百分点

待验证50%
9月18日

MDT的整个训练过程在单块GPU上不到20分钟即可完成

待验证50%

还有 1 条时间轴事件

全部知识事实 (11)

来源文章