论文笔记:多模态学习综述 Multimodal Machine Learning: A Survey and Taxonomy
这是六七年前的一篇论文,展示了多模态机器学习蓬勃的生命力。该文提出了多模态概念,并详细介绍了学习的五大核心挑战(表示、对齐、融合、翻译、协同学习),系统奠定了领域框架,因此常被视为领域“开篇之作”。在此之前学届也曾提出机器学习的跨模态特征融合学习,有一些早期的奠定工作。
视听嗅味触是我们常见的几种感官,机器学习中我们主要关注图像、文本、声音三种模态。然而个人见解,乘着时代东风顺势而起的具身智能在未来或许可以将触觉嗅觉一并加入进来,形成一个更完整全面的智能体,这咱们姑且不谈。让咱们现在按照论文的思路学习。
(ps:文章是自己完整阅读后写下 旨在入门多模态 对这篇原文进行脉络理清 尽量用自己作为入门级可以理解的语言 融合了一些大模型结解析的更清楚之处 希望这篇文章有助于你理解 因为是综述类 重点放在了原文转义 很多地方没有细化 更细的知识点大家可以进一步研究 本人是刚刚接触多模态领域的大学本科生 文中可能出现的勘误之处欢迎大家指正 )
一、历史渊源
多模态最早的研究例子是视听语音识别(AVSR)。它是由Mc Gurk效应——言语感知过程中听觉和视觉的相互作用所激发的。视觉信息的主要优势主要体现在语音信号为噪声的时侯,也就是说,捕获的模态之间的相互作用是补充的,而不是互补的。
多模态应用的第二个重要类别来自多媒体内容索引和检索领域。早期的索引和搜索这些多媒体视频的方法是基于关键字的,但当试图直接搜索视觉和多模态内容时,引发了自动突变和视频摘要等新的多媒体内容分析研究问题。
第三类应用是在21世纪初围绕多模态交互这一新兴领域建立的,目标是理解人类在社会交往过程中的多模态行为,在情感分析、人际动态方面展示出潜力。
最近(相对2017而言)出现了媒体描述(一种强调语言和视觉的新的多模态应用),其中最具代表性的应用是图像描述,对输入图像进行文本描述。
想将我们构想的这样一个高融合性的智能体构建出来,我们面临着五个重要挑战(原文概括):
1)Representation. A first fundamental challenge is learning how to represent and summarize multimodal data in a way that exploits the complementarity and redundancy of multiple modalities. The heterogeneity of multimodal data makes it challenging to construct such representations. For example, language is often symbolic while audio and visual modalities will be represented as signals.
2) Translation. A second challenge addresses how to translate (map) data from one modality to another. Not only is the data heterogeneous, but the relationship between modalities is often open-ended or subjective. For example, there exist a number of correct ways to describe an image and and one perfect translation may not exist.
3) Alignment. A third challenge is to identify the direct relations between (sub)elements from two or more different modalities. For example, we may want to align the steps in a recipe to a video showing the dish being made. To tackle this challenge we need to measure similarity between different modalities and deal with possible long-range dependencies and ambiguities.
4) Fusion. A fourth challenge is to join information from two or more modalities to perform a prediction. For example, for audio-visual speech recognition, the visual description of the lip motion is fused with the speech signal to predict spoken words. The information coming from different modalities may have varying predictive power and noise topology, with possibly missing data in at least one of the modalities.
5) Co-learning. A fifth challenge is to transfer knowledge between modalities, their representation, and their predictive models. This is exemplified by algorithms of co-training, conceptual grounding, and zero shot learning. Co-learning explores how knowledge learning from one modality can help a computational model trained on a different modality. This challenge is particularly relevant when one of the modalities has limited resources (e.g., annotated data).
接下来我们详解:
二、五种挑战
1.多模态表示
比如说语言往往是象征性的,而声音和视觉模态则会表现为信号。那怎么将数据表示为计算模型可以使用的格式呢?前人告诉我们可以每个特征都指一个实体的向量或张量表示,不管它是图像、音频样本、单个单词还是句子。在这里又出现多种困难:如何组合来自异构数据源的数据;如何应对不同程度的噪声;以及如何处理缺失数据等等。
我们提出了两类多模态表征:联合和协调。联合表示将单模态信号合并到同一个表示空间中,而协同表示则分别处理单模态信号,但对它们施加一定的相似性约束,使它们进入我们所说的协同空间。
1.1联合表征
联合表示将来自多个模态的信息直接融合到同一个表示空间中,它最终得到一个单一的、统一的向量/张量 x_m,包含了所有输入模态的信息。数学上表示为: x_m = f(x_1, x_2, ..., x_n),其中 x_i 是各模态的输入表示,f 是融合函数(如神经网络层、概率图模型、RNN等)。
联合表示里提及了三种方法。
1.1.1 神经网络
首先,脍炙人口的神经网络。方法中每个模态先经过几个独立的处理层(如CNN处理图像,RNN处理文本),然后在一个“融合层”(通常是全连接层)将各模态的表示拼接或组合起来,再输入到后续的隐藏层或直接用于预测。基于神经网络的联合表示的主要优势在于当有标签数据不足以进行监督学习时,它们能够从无标号数据中进行预训练。缺点是处理确缺失模态不自然。文章中提及深度网络难以训练,但在现在来讲正以相当的速度取得进展,新的正则化、批归一化、和自适应梯度算法等等不断更迭。
1.1.2 概率图模型
经典的马尔可夫和状态转移。概率图模型通过引入潜在随机变量 (latent random variables) 来构建数据表示。这些潜在变量能够捕捉数据背后的抽象信息。论文中重点介绍了深度玻尔兹曼机作为一种重要的概率图模型。DBM 通常由堆叠的限制玻尔兹曼机(RBM)构成。RBM 是一种两层神经网络,包含可见层和隐藏层,层内无连接,层间全连接。与传统的深度神经网络类似,DBM 的每个连续层都旨在以更高层次的抽象方式表示数据。其一大优势是其生成性,这使得处理缺失数据的方法变得非常容易- -即使整个模态缺失,模型也有一种自然的处理方式。 缺点是DBM 的训练过程通常计算成本高昂,且需要使用近似变分训练方法,这比许多现代深度学习模型的训练更复杂。
1.1.3 循环神经网络及其变体
尤其是 长短期记忆网络 ( LSTMs),近年来因其在序列建模任务中的成功而广受欢迎,并被用于构建多模态数据的序列表示。RNNs天生能够处理输入和输出长度可变的序列。编码器: 一个 RNN负责读取输入序列,并将其压缩成一个固定长度的向量表示,这个向量被认为是整个输入序列的语义总结。解码器 : 另一个 RNN以编码器生成的向量作为初始隐藏状态,然后生成目标序列。对于多模态序列,可以将不同模态的序列输入到不同的RNN/LSTM,然后将它们的隐藏状态融合(如拼接)作为联合表示输入到后续层。 序列表示的核心优势在于能够灵活地建模和捕捉多模态数据中的复杂时序关系,这对于理解动态场景(如视频中的动作、对话中的情感变化)至关重要。
1.2 协同表征
每种模态、在自己的表示空间中学习其独立的表示。这些独立的表示之间通过施加特定的协调约束 (coordination constraint) 关联起来,从而使它们在“协同空间”中能够相互理解或进行比较。数学上,如果联合表征是x_m = f(x_1, ..., x_n),那么协同表征的表示形式更像是 f(x_1) ≈ g(x_2),其中 f 和 g 是各自模态的投影函数,将 x_1 和 x_2 映射到它们的协同空间中,而 ≈ 表示这些投影后的表示在一定程度上是协调的(例如,相似度最大化)。
论文将协同表征进一步细分为两种类型:基于相似度的和结构化协同空间模型。
1.2.1 基于相似度
核心思想就是最小化不同模态在协同空间中的距离,即让语义上相似的跨模态实例在表示空间中也彼此接近。用例子理解就更加通俗易懂,如“狗”这个词的表示和一张真狗图片的表示,它们之间的距离应该小于“狗”与“汽车”图片的距离。
1.2.2 结构化协同空间
结构化协同空间是在上述基础上,强制在表示空间中施加额外的结构约束。这种结构通常根据具体的应用需求而定。如跨模态哈希,旨在将高维数据压缩成紧凑的二进制代码,并要求来自不同模态的相似对象具有相似的哈希码。这里强制的结构是 N 维 Hamming 空间(定长二进制代码)和相似性保持特性,例如17年某个论文里使用深度学习方法学习图像和文本之间的共同二进制空间。
综上所述,联合表征通常将所有模态信息合并为一个共同的输入,形成一个统一的潜在空间,适用于所有模态在推理时都存在且需要深度交互的任务。协同表征因其各模态独立处理,输出在协调空间中进行对齐或比较,更适合于单模态查询、跨模态匹配、或需要从一个模态预测另一个模态而没有直接联合输入的情况。
2.翻译
第二个挑战是如何将数据从一种模态转换到另一种模态。因为不仅数据是异构的,而且模态之间的关系往往是open-ended或subjective的。例如,许多方式描述一个图像都可以认为正确,可能不存在最完美的翻译。多模态翻译是一个由来已久的问题,早期的工作主要集中在语音合成、视觉语音生成、视频描述、跨模态检索等方面。
我们将其分为基于实例和生成式方法两部分。在这篇论文写作时期生成模型还具有很大挑战性,因为它们需要能够生成符号(例如,句子)的信号或序列。这对于任何模态来说都是困难的,特别是当需要生成时间和结构一致的序列时。所以早期翻译更多基于实例。近些年随着深度学习大模型出现,情况有所好转。
2.1 基于实例
基于实例的算法受限于其训练数据。其中又分为基于检索和基于组合两类。
2.1.1 基于检索
基于检索的模型可以说是最简单的多模态翻译形式,如我们熟悉的k最近邻。他们依赖于在字典中找到最接近的样本并将其作为翻译结果,简而言之,通过度量相似度。检索可以在单模态空间或中间语义空间中进行,只需要我们检索单一模态。问题是单模态空间中的相似性并不总是意味着一个好的翻译。
2.1.2 基于组合
基于组合的模型则依赖规则更复杂,根据检索到的多个实例创建翻译。它会反应多个模态,这往往需要大型训练数据集,人工构造或学习这样的语义空间。然而基于实例算法得到的答案永远都在字典中。除非你任务简单或词典确实庞大,得到的答案可能准确,但显然不现实。
2.2 生成式方法
三大类生成模型:基于语法的、编码器-解码器和连续生成模型。基于语法的模型通过使用一个语法限制目标域来简化任务,例如,基于一个主语、宾语、动词模板生成限制语句。编码器-解码器模型首先将源模态编码为潜在表示,然后由解码器生成目标模态。连续生成模型基于源模态输入流,连续生成目标模态,最适合于文本到语音等时序序列之间的转换。
接下来详解:
2.2.1 基于语法
这是最早期的、非端到端的多模态翻译方法。【咱们先来解释一下什么是端到端学习,它是一种深度学习模型的设计理念,使用一个单一的、统一的模型,直接学习从原始数据(输入端) 到最终目标(输出端) 的复杂映射函数。端指的是任务的起点和终点。让单个模型像天才学徒一样,通过观察大量“案例,直接掌握从问题源头到解决方案的完整技能。】该方法的核心是不直接学习从一种模态到另一种模态的完整映射,而是将任务分解为两个独立的阶段:内容检测和表面实现。先从源模态(如图像)中识别出关键元素(如物体、属性、动作),再将检测到的元素填入一个预先定义好的语法模板或规则中,以生成目标模态(如句子),个人认为可以将其理解成完形填空。但是这种方法需要手动设计大量模版,且模版的局限性使其无法生成任何更丰富、新颖的描述。因而迅速被更灵活的深度学习方法所取代。
2.2.2 编码器-解码器方法
第二类,编码器-解码器方法。论文中重点阐述的当前主流和核心技术范式,它实现了真正的端到端学习。将多模态翻译任务建模为一个序列到序列 (Seq2Seq) 的问题。一个编码器负责“理解”源模态并将其压缩成一个数学表示,一个解码器则根据这个表示逐步生成目标模odal。
论文中介绍了其发展历程。开始时编码器将一个深度神经网络(如用于图像的 CNN)将整个输入(如图像)编码成一个单一的、固定长度的上下文向量,解码器 用一个循环神经网络(RNN/LSTM/GRU)接收这个上下文向量作为初始状态,然后自回归地(一步步地)生成输出序列(如单词),但使用RNN进行翻译生成面临的一个问题是,模型必须从图像、句子或视频的单一向量表示中生成描述。这在生成长序列时变得尤为困难,因为这些模型往往会忘记初始输入。
之后著名的Attention is all you need问世后,注意力机制被引入,编码器不再生成单一向量,而是输出一组特征向量(例如,CNN 的最后一个卷积层特征图),每个向量对应输入的一个局部区域。解码器在生成每一个输出单元(如一个单词)时,都会计算一个注意力权重分布,决定此时应该“关注”输入的哪个部分。然后,它根据加权后的特征动态地生成输出。它极大地提升了翻译质量和细节准确度,并且通过可视化注意力权重,模型变得可解释。
再后来我们完全抛弃了 RNN 的循环结构,解码器和编码器完全由自注意力和前馈网络层堆叠而成。自注意力机制允许序列中的任意两个位置直接建立联系并进行信息交互,极大地提升了信息传递的效率和范围,从根本上解决了长距离依赖问题。在解码器中,交叉注意力层扮演了与上述注意力机制完全相同的角色——让解码器在每一步都能关注编码器的所有输出。
2.2.3 连续生成模型
第三类,连续生成模型。如果说 Encoder-Decoder 主要处理生成离散序列(如文本)的任务,那么这部分则关注生成连续、高维数据(如图像、音频)的翻译任务。它代表了多模态生成领域的前沿方向。这里的“翻译”目标是生成一个非符号化、连续的信号。这类任务通常不使用标准的 softmax+交叉熵损失,而是采用专门为连续数据设计的生成模型框架。虽然它们内部可能依然借鉴了 Encoder-Decoder 的结构,但其生成机制和目标函数是根本不同的。
连续生成模型用于在线式的序列转换(如语音合成、语音识别、视频描述等),要求在生成过程中保持不同模态间的时间一致性。早期方法主要依赖图模型或隐变量模型 ,现代逐渐转向神经网络编码器-解码器结构,能够直接处理原始信号(如音频、视频),并生成更复杂的输出。应用于视听语音合成(音频生成视觉参数)、文本转语音、视频生成声音、语音识别等。
论文最后介绍了其评估方法。多模态翻译方法面临的一个主要挑战是它们很难评估。一些任务如语音识别有单一的正确翻译,而语音合成和媒体描述等任务则没有。有时,正如在语言翻译中,多个答案都是正确的,很难决定哪个翻译更好。评价一个主观任务的理想方式往往是通过人的判断。也就是说,由一群人对每一个译文进行评价。但它们是耗时和昂贵的。一种解决方案是,我们将翻译任务转化为其他类型任务,如将图像共参考任务框定为多模态对齐而非翻译,这咱们稍后再叙。
3. 对齐
与“联合表示”试图将所有信息融合进一个共享空间不同,对齐更关注于定位和连接子组件。比如当视频画面中出现“打鸡蛋”的动作时,字幕恰好显示“crack the eggs”,音频也恰好在讲解打鸡蛋。我们将其分类为显式对齐和隐式对齐。
3.1 显式对齐
显式对齐的一个非常重要的部分是相似性度量。这些相似性可以通过人工定义或者从数据中学习得到。我们识别了两类处理显式对齐的算法- -无监督和(弱)有监督。
3.1.1 动态时间规整
无监督中,作者主要介绍了动态时间规整( DTW )与概率图模型。动态时间规整已被广泛用于对齐多视图时间序列,它衡量两个序列之间的相似性,通过时间弯曲(插入帧)找到它们之间的最佳匹配,要求两个序列中的时间步长具有可比性,并要求它们之间具有相似性度量。因而, DTW需要一个预先定义好的相似性度量来比较不同模态的“点”。 研究者将DTW与机器学习结合,让模型在执行对齐的同时,学习这个相似性度量。例如,典型时间规整 使用CCA来学习一个线性映射,然后再进行DTW对齐。更进一步,深度典型时间规整 使用深度神经网络学习非线性映射,大大增强了对齐能力。
3.1.2 概率图模型
而概率图模型我们在联合表征中也介绍过,只不过现在我们把它用于对齐。使用隐变量模型来模拟对齐过程。模型假设存在一个未观测到的“对齐状态序列”,它生成了我们观察到的多模态数据。通过推断这个隐状态序列,就能找到对齐关系。
这听上去有些抽象,我们可以把这类比一场木偶戏。假设木偶师的手操控着两个木偶同时做出动作,即我们观察到的两种模态的数据(如视频和音频)。木偶师的手是隐藏的,但我们知道,正是木偶师的手的特定动作(隐状态), 导致了木偶的特定行为(观测数据)。在这个比喻中,两个木偶的动作在时间上是“对齐”的(同时发生),并不是因为它们彼此直接通信,而是因为它们共享同一个原因——木偶师当前的手部状态。因此, 推断对齐关系,就等价于推断出在每一个时间点,木偶师的手是处于哪种状态。如果我们能推断出隐状态序列,我们就知道了是哪个共同的“原因”在驱动着两个模态,从而也就找到了它们之间的对齐关系。文章中举了隐马尔可夫模型(HMM)、贝叶斯模型等。HMM隐状态对应音素或词。每个隐状态会发射出不同长度的音频特征向量。通过维特比(Viterbi)等算法,找出最有可能产生整个音频序列的隐状态(音素/词)序列,从而完成音频到文本的对齐。
3.2 隐式对齐
隐式对齐即不将对齐当成最终目标,而是作为另一个任务的中间(通常是隐式的)步骤,用以提升该任务的性能。
咱们可以类比想象你在回答“照片里那个穿衬衫的人在喝什么?”这个问题,你的目光会下意识地移动到照片中那个人的身上,进一步聚焦于他手里的杯子和里面的液体,这个“目光移动和聚焦”的过程,就是一种隐式对齐。它不是你的最终目的,但却是你得出答案不可或缺的一步。
论文明确指出,注意力机制是实现隐式对齐的最核心、最普遍的技术。它完美地模拟了上面那个类比中的“目光移动和聚焦”过程。
我们以句子生成为例,解码器将特征向量进行匹配度计算,分别得到注意力权重,再根据权重进行加权求和,得到上下文向量。解码器在每一步生成输出时,动态地决定要“关注”输入的哪个部分。这个动态变化的注意力权重分布,其本身就是隐式对齐的可视化体现。
以及还有另一种用于跨模态检索图像与字幕对齐的神经备选方案。模型通过使用图像区域和单词表示之间的点积相似性度量将句子片段对齐到图像区域。虽然它不使用注意力,但它通过训练检索模型间接学习的相似性度量来提取模态之间的潜在对齐。
总的来说,多模态比对技术面临三大核心挑战:缺乏明确标注的对齐数据、难以设计有效的模态间相似性度量,以及对齐关系本身存在多重可能性和成分缺失的复杂性。为解决这些难题,该领域的技术路径经历了清晰的演进:早期工作主要依赖无监督方法,如动态时间规整和概率图模型,通过手动定义或有限地学习相似性度量来对齐序列;随着标注数据的增多, 监督学习得以应用,通过神经网络将不同模态映射到共享的嵌入空间,从而自动学习更强大的相似性度量函数;而当前趋势则走向了更先进的无监督联合学习,模型不再将“对齐”视为独立任务,而是将其作为中间步骤,通过端到端地优化翻译或融合等最终目标,来自发地推断出最优的对齐关系,从而在更高层次上实现了对无需标注的复杂模态关系的理解。
4. 融合
提起这个词你可能觉得陌生,但是你一定听过许多多模态融合的应用,包括视听语音识别、多模态情感识别、医学图像分析、多媒体事件检测等等。
“融合”可以说是多模态学习中最核心、最无处不在的问题。它的目标是将来自多个不同模态的信息整合起来,以进行预测或生成。
我们根据是否基于模型将其分为两类:
4.1 模型不可知方法
历史上绝大多数多模态融合都是使用模型不可知的方法来完成的,可以分为早期(基于特征)、晚期(基于决策)和混合融合。
4.1.1 早期融合
早期融合在模型处理的最早期阶段就将多模态特征进行合并。 最简单直接的方法是特征拼接,将每个模态中提取的特征向量直接拼接成大的向量,再输入到一个统一的下游分类器或回归器中进行预测。但越是简单的办法缺点也很明显,它忽略了不同模态的内在结构和时间动态,对同步性要求高,亦可能会产生维度非常高的特征向量,难以训练。
4.1.2 晚期融合
晚期融合在模型的最终决策阶段才进行信息融合它为每一个模态独立训练一个完整的模型,让每个模型都输出一个初步的预测结果,再通过某种策略合并,得到最终的全局预测。文中提到几种合并策略:投票(少数服从多数)、平均(对得分进行加权或非加权平均),或训练一个小模型(学习一个元分类器)等。缺点是它忽略了模态间的底层交互: 在决策之前,模态之间没有任何信息交流。这使得模型无法捕捉到模态间的跨模态关联。
4.2 基于模型的方法
在这一部分中,我们描述三类方法:基于核的方法,图形模型和神经网络。
4.2.1 基于核的方法
核方法的核心在于,它不需要显式地将数据映射到高维空间,而是通过一个核函数(核可以看作是数据点之间的相似度函数,对数据的不同模态/视图使用不同的核)直接计算数据点在那个高维空间中的内积(可以理解为相似度)。这使得我们可以在一个极其复杂的特征空间中线性地解决问题(如寻找一个分离超平面),而计算开销却很低。
这在核选择上具有高灵活性,并且MKL的一个优点是损失函数是凸的,允许使用标准优化包和全局最优解进行模型训练。此外,MKL可以用于执行回归和分类。MKL的一个主要缺点是在测试时间内依赖训练数据(支持向量),导致推理速度慢和内存占用大。
4.2.2 图形模型
图模型主要分为两类,生成式模型和判别式模型。生成式模型目标是建模联合概率,即 p(模态A, 模态B, 标签Y),它们试图理解数据是如何被“生成”的。判别式模型目标是建模条件概率,即 p(标签Y | 模态A, 模态B),它们只关心如何在给定输入数据的情况下做出正确的预测。一些最早期的多模态融合工作采用了生成式图模型,后来逐渐被判别式模型取代。
判别式模型牺牲了对联合概率的建模能力,以换取更强的预测能力。代表模型有条件随机场(CRF)和引入隐变量的判别式模型。如通过结合图像的视觉信息和附带的文本描述信息,CRF更好地对图像进行区域分割。论文特别提到,CRF也被扩展到了连续版本 用于回归任务 ,并被应用于视听情感识别,这表明CRF不仅能做分类,也能预测连续值(如情感强度)。为了增强模型的表达能力,研究者在判别式模型中加入了隐状态,对CRF进行了扩展。
图模型的优势是,由于其链式或网格状结构天然适合于建模像素邻域关系(空间)或语音视频序列(时间),因此在视听语音识别 (AVSR) 和多模态情感识别这类时序任务中尤其流行。并且图的结构可以由人来设计,这意味着我们可以将对问题领域的先验知识直接编码到模型结构中,允许引入人类专家知识。第三,由于图的结构和变量依赖关系是明确的,这使得分析和理解模型的决策过程成为可能,相比于“黑箱”的神经网络,其可解释性要更强。
4.2.3 神经网络
论文特别强调了神经网络(尤其是RNN和LSTM)在融合时序多模态信息 方面的应用。稍微接触过一点深度学习的人都一定听过LSTM,这里我们不多介绍。如使用LSTM进行连续情感预测,首先用针对特定模态的LSTM(一个处理音频,一个处理面部表情)分别提取特征,然后再用一个顶层的LSTM来融合这两个LSTM的输出结果。这是一种典型的分层融合策略。
神经网络具有强大的数据学习能力,与非神经网络系统相比,它们通常表现出更好的性能,并且能够学习到其他方法难以处理的复杂决策边界。缺点是神经网络要想取得成功,通常需要大量的训练数据作为支撑,且其可解释性不强。
总的来讲,每种方法都有自己的优点和缺点,有的更适合于较小的数据集,有的在噪声环境下表现更好。近来神经网络已经成为处理多模态融合的一种非常流行的方法,然而图模型和多核学习仍然在使用,特别是在训练数据有限或模型可解释性重要的任务中。
多模态融合面临的挑战有:信号可能不是时间对齐的(可能是稠密的连续信号和稀疏的事件);很难建立利用补充信息而不仅仅是互补信息的模型;每种模态在不同时间点可能表现出不同类型和不同程度的噪声。
5. 共学习
与前一章讲的融合 不同,融合的目标是结合来自不同模态的特征来共同完成一个预测任务。而共学习的目标则更进一步,它旨在利用一个模态中的信息来帮助学习另一个模态的更好的表示。
共学习的核心动机是,1)在很多现实场景中,不同的模态包含的信息质量和抽象层次是不同的。例如:文本 vs. 视觉: 文本通常是高度抽象、干净且充满语义的。而对应的图像则是由大量低级的像素点构成的,充满了噪声和冗余信息。2)数据不平衡: 我们可能拥有大量的无标签图像,但只有少量的带有高质量文本描述的图像。
5.1 成对数据共学习(Parallel)
当拥有成对的多模态数据时(即每个样本都同时包含两种或多种模态,如图像和其对应的描述),我们可以采用两种主要的共学习算法来利用这些数据,从而更好地建模各个模态。这两种算法分别是协同训练和迁移学习。
5.1.1 协同训练
协同训练主要用于解决多模态问题中标记样本稀少的情况。它的目标是创造更多有标签的训练样本。基于已有的少量标记样本,为每个模态分别构建一个弱分类器。例如,一个基于图像的分类器和一个基于文本的分类器。让这两个弱分类器去预测大量未标记数据的标签。当一个分类器对某个未标记样本做出高置信度的预测时,就将这个样本连同预测的标签一起加入到另一个分类器的训练集中。通过这种方式,两个分类器互相为对方提供新的标记样本来引导学习。
论文明确指出,协同训练这个任务根据其定义,就必须依赖于成对数据 (parallel data),因为它依赖于多模态样本的重叠部分。为了处理不同模态之间可能产生的分歧,协同训练已被扩展,能够通过过滤掉不可靠的样本来增强鲁棒性。
5.1.2 迁移学习
如果说协同训练像两个互相帮助的学生,那么迁移学习更像一个“老师”模态将自己的知识迁移给“学生”模态。这种信息迁移在单模态和多模态方面都增强了模型性能。论文提到了多模态深度玻尔兹曼机和多模态自编码器作为实现此类迁移学习的代表性方法。
此前已有作者展示如何将一个基于音频的语音识别神经网络中的知识,迁移到一个基于图像的唇语读取神经网络中。 这种迁移学习带来了一个更好的视觉表示,最终得到的模型可以在测试时完全不需要音频信息,仅靠唇动图像就能进行识别。
5.2 非成对数据的共学习
传统的成对数据共学习要求数据有共享的实例(如同一张图像及其配对的标题),而非成对数据共学习放宽了这一要求,它只需要模态间共享类别或概念 即可。即当多模态数据不具备一一对应关系时,我们如何进行共学习。
论文将非成对数据的共学习分为了三大块进行阐述:迁移学习,概念基 grounding和 零样本学习。
5.2.1 迁移学习
在非成对数据上,迁移学习同样可行。它的目标是将一个数据丰富或干净的模态 中学到的表示信息,迁移到一个数据稀少或嘈杂的模态。这种迁移学习通常通过构建协同多模态表示来实现。如论文中提到有作者展示了如何利用一个在3D骨骼数据上训练的自编码器LSTM,来正则化一个基于彩色视频的LSTM。它们通过强制让两个LSTM的隐藏状态相似 来实现这一点,尽管彩色视频和3D骨骼数据可能不是严格成对的。这种方法改进原始的视频LSTM,并在动作识别任务上达到当时的最优性能 。
5.2.2 概念基 grounding
概念基 grounding 是指学习语义或概念的含义时,不只依赖于语言本身,还要依赖于其他模态,如视觉、声音甚至嗅觉。实现 grounding 的方法通常是在不同模态的表示之间找到一个共同的潜在空间(针对成对数据),或者分别学习单模态表示然后将它们拼接起来。多模态对齐(我们前面讲的)与 概念基 grounding 之间有很大的重叠,因为将视觉场景与其描述对齐的过程,本身就会导致更好的文本或视觉表示。
5.2.3 零样本学习
零样本学习(ZSL)指的是在没有明确见过任何一个类别的样本的情况下,识别出这个类别的能力。例如,在从未见过任何一张被标记为“猫”的图片的情况下,对一张包含猫的图片进行分类。有单模态ZSL(通过分析物体的组成部分或属性来识别未见过的类别。例如,通过音素来识别一个没听过的词,或者通过颜色、尺寸、形状等视觉属性来预测一个没见过的视觉类别)与多模态ZSL(通过次要模态帮助来识别主要模态中的对象,而这个对象在次要模态中是见过的)。论文明确指出,多模态ZSL根据其定义就是一个非成对数据问题,因为在不同模态中,“已见类别”的集合是不同的。如将图像特征映射到一个概念词空间,从而能够对已见和未见的类别进行分类。
总而言之, 在没有成对数据这一“奢侈”条件下的共学习策略,核心思路是找到一个“共同的桥梁”。这个桥梁可以是共享的概念(如“猫”这个类别)、共享的属性(如“红色”、“圆形”),或者是一个抽象的语义空间。通过迁移学习,可以将一个模态的优势(如文本的语义丰富性)赋予另一个模态;通过概念 grounding,可以为抽象的语言符号找到坚实的感知基础;通过零样本学习,可以利用这种跨模态的知识迁移,实现对从未见过的事物的认知,极大地扩展了模型的泛化能力。
5.3 混合数据共学习
在混合数据设定中,两个本身并没有直接成对关系的模态,通过一个共同的、共享的桥梁 被连接起来。论文将实现这种连接的方法分为了两大类:一是通过一个“枢轴”模态,二是通过一个相关的外部数据集。
5.3.1 “枢轴”模态
枢轴模态(或称“桥梁”模态)是作为中间媒介,学习那些原本互不关联的模态之间的协同表示。如机器学习中,当两种语言(如A和B)之间没有直接的平行语料库时,如果它们都与一种常见的枢轴语言(如英语C)有平行语料(即A-C和B-C),就可以利用C作为桥梁来学习A到B的翻译。
5.3.2 通过外部数据集
第二种,不依赖于一个共享的模态,而是依赖一个来自相似或相关任务的大型数据集,来提升一个只有有限标注数据的目标任务的性能。如图像分割中,这里的文本语料库与用于分割的图像数据是完全非成对的,但文本中包含的关于“世界是如何构成的”的先验知识,可以为分割模型提供有价值的约束和指导。
综上,多模态共学习允许一种模态影响另一种模态的训练,充分利用模态间的互补信息。值得注意的是,共学习是独立于任务的,可以用来创建更好的融合、翻译和对齐模型。这一挑战以协同训练、多模态表示学习、概念背景和零样本学习等算法为例,并在视觉分类、动作识别、视听语音识别和语义相似性估计等领域得到了广泛的应用。
三 、前景展望
多模态机器学习是一个充满活力的多学科领域,致力于构建能够处理并关联来自多种模态信息的智能模型。本文系统梳理了该领域的最新进展,并提出一个统一的技术分类框架,围绕多模态研究面临的五大核心挑战展开:表示学习、模态翻译、跨模态对齐、多模态融合以及协同学习。针对每一项挑战,我们进一步划分了子类别,以清晰呈现当前的研究脉络。
本综述重点关注17年左右近十年的研究成果。作者提出的分类框架不仅为研究人员系统理解现状提供了结构化的视角,也有助于识别尚未充分探索的关键问题。在总结各项技术挑战的同时,也展望了未来的研究方向与待解决的科学问题,让我们看见了多模态方向大有可为的发展空间。
(始于2025.10.20 完结于2025.11.1)
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐
所有评论(0)