1、研究思路:
1)直接融合未经语义校准的音频和视频表示,容易让弱模态反过来干扰文本。
2)音频和视频都是时间序列,但传统的拼接、Cross-Attention 或 Mamba 并不一定适合 MOSI、MOSEI 这种较短的视频片段。作者因此提出一个更轻量的音视频时间交互模块。
因此,TEXT 先利用多模态大模型生成语言解释,再用这些解释校准音视频特征,最后才进行时间交互和多模态决策。
2、研究方法:文本主干+解释增强后的音频/视频→A/V 时间交互→文本路由专家融合→门控决策
3、模型名称:TEXT
模块1:多模态大模型生成解释
TEXT 首先使用经过 EMER-fine 数据集微调的 VideoLLaMA 3,为每个视频样本生成初步解释。提示词要求模型分别描述:音频中的语气和情绪;视频中的面部表情和行为;原始评论或字幕表达的含义。之后再使用 Qwen 3 对初始解释进行检查和润色,得到所谓的 fine explanation。
例如,原始音频只是连续声学信号,解释可能变成:“说话者的语气积极而热情。”
视频则可能被解释为:“说话者嘴角略微上扬,可能表达认同或积极情绪。”
这些解释随后通过 BERT 编码,成为可以与音频、视频特征进行注意力交互的语言表示。
借助多模态大模型,把难以直接解释的连续信号转写成显式情感语义。
模块2:解释对齐模块
解释生成以后,TEXT 并不直接把解释与原始特征拼接,而是使用 Cross-Attention 进行对齐。 对于某一模态特征 F 和对应解释 E,作者定义:
这里有一个非常关键的方向关系: 解释表示 E 作为 Query; 原始音频或视频特征 F 作为 Key 和 Value。
因此,这个模块实际在询问:“解释中提到的情感含义,能够在原始音频或视频的哪些位置找到证据?”
这比直接拼接更合理,因为解释并没有替代原始 A/V 特征,而是承担了一个语义筛选器的角色。
论文如何处理不同序列长度
文本、音频和视频原本长度不同,但作者没有直接在 50、375、50050、375、50050、375、500 这种原始长度上进行交互。论文明确表示,三种模态都被处理为50 个 token,并额外加入一个可学习的聚合 token,最终得到长度为 51 的表示:
Et,Ea,Ev∈R51×d
即先将各模态统一到相同长度,再执行音视频时间交互。
模块3:音视频对齐模块
它不是 Cross-Attention,也不是严格意义上的时间戳对齐,而是一个:对称的音视频跨模态门控卷积块。
左支路以音频为主体,视频经过 SiLU 后形成门控信号,控制音频卷积特征的保留程度;右支路则以视频为主体,让音频控制视频特征。
因此,其信息处理原则是:音频和视频不直接混成一个表示,而是先分别保留自己的残差主干,再利用另一个模态调节本模态的局部时间特征。
这个设计比直接拼接更有结构,也比完整的 Cross-Attention 更轻量。Conv1D 负责局部时间建模,逐元素乘法负责跨模态调制,残差连接保证原始模态信息不会完全丢失
文本路由的稀疏专家模型
一般的 Sparse MoE 会根据当前输入计算专家概率,而 TEXT 强调:SMoE(Et,Eav)
其中,文本负责 Router,音视频联合表示进入被选中的专家。 作者的解释是,不同专家可能逐渐擅长不同的情感主题。例如,文本中出现抱怨、赞同、讽刺或失望等关键词时,Router 会选择相应专家处理音视频上下文。
文本路由 SMoE 决定的则是:应该用哪一组参数处理当前样本的音视频信息。
最终门控融合与预测
TEXT 最后使用 Gate Fusion 将文本表示和经过专家处理的音视频表示结合,再通过 MLP 输出情感分数。
最终决策只使用每个序列中额外加入的可学习聚合 token,而不是将全部 50 个时间 token 展平。这相当于先在各模块内部完成序列信息汇总,再进行样本级预测。
Gate Fusion 本身不是这篇论文最有创新性的部分,它更像是一个稳定的最终融合器。消融实验中去掉 Gate Fusion 后,MOSEI 的 MAE 从 0.528 上升到 0.571,说明它确实有贡献,但该结构单独拿出来不足以构成主要创新。
效果
TEXT 在 MOSI、MOSEI、CH-SIMS 和 CH-SIMSv2 四个数据集上,与 ALMT、KuDA、DEVA,以及 GPT-4o、Qwen2.5-VL、VideoLLaMA3 进行了比较。
1)在 MOSI 上,TEXT 的主要结果是:MAE=0.666,Corr=0.829,其不含零样本的 Acc-2 达到 88.72%,F1 达到 88.76%。不过,Acc-7 为 45.92%,低于 KuDA 的 47.08%。
2)在 MOSEI 上,TEXT 的结果为: MAE=0.528,Corr=0.786整体表现较强,但 Acc-7 也不是最佳。
3)CH-SIMS 上的 MAE 达到 0.353,相比 KuDA 的 0.408 下降约 13.5%,这是论文最突出的结果之一。
消融实验
从 MAE 看,影响最大的是把时间对齐模块替换为简单拼接,误差增加了 0.052。Explanation Alignment 换成 Linear 后也明显下降,说明性能并不只是来自额外解释文本,解释与原始模态之间的注意力对齐同样重要。
同时,作者提出的轻量时间模块优于 Mamba 和 TCA。这至少在该模型与该实验协议下支持了一个观点:对短视频 MSA 而言,局部卷积、双向门控和残差保留,可能比完整状态空间模型或复杂跨注意力更合适。
其他
论文题目:A Text-Routed Sparse Mixture-of-Experts Model with Explanation and Temporal Alignment for Multi-Modal Sentiment Analysis
模型名称:TEXT,即Text-routed sparse mixture-of-Experts with eXplanation and Temporal alignment。
作者与团队:Rao Dongning、Zeng Yunbiao、Jiang Zhihua、Lv Jujian 等,来自广东工业大学、广东技术师范大学和暨南大学。
发表信息:arXiv 版本发布于 2025 年 12 月,论文首页标注为AAAI 2026。代码仓库也在论文中公开。
感悟:
1、这篇论文不是随意堆叠模块,而是形成了较清楚的链条,即便每个组件都不是从零发明,整体叙事是成立的。
A/V 难理解 → 用解释增加语义;
A/V 时间关系不清 → 用双向时间交互;
不同样本需要不同融合方式 → 用文本路由专家;
最终模态贡献不同 → 使用门控融合。
2、时间对齐模块轻量、容易复现
相较于复杂的 OT、动态时间规整或大规模 Cross-Attention,这个模块只包含 Linear、Conv1D、SiLU、逐元素乘法和残差连接。
它比较适合做普通期刊中的工程型结构改造:代码量不大,消融容易,信息流也容易解释。
这是一篇典型的性能驱动、工程驱动型 MSA 论文,叙事完整、模块可复现,最有价值的是“等长后音视频双向门控”的时间交互设计。解释生成和 SMoE 更像性能加码项,不宜全部照搬。