多模态大模型:让机器打通视听言的感官

一、为何要打破单一模态的围墙
1、真实信息从来不是纯文字
人类认识世界靠的是眼睛看、耳朵听、双手触,文字只是其中一种编码。此前的模型往往只擅长单一模态,看懂图的开不了口,会聊天的读不懂画面。多模态大模型试图抹平这道隔阂,让系统在同一套能力下同时处理图像、声音与文本,更贴近人接收信息的方式。
文字只是人类认识世界的一种编码,眼睛看、耳朵听、双手触同样重要,单一模态模型天然存在感知盲区。
多感官输入,本就是人类认知的本来方式。
2、跨模态带来理解增益
当模型既能读图也能读字,两种信号会相互印证,理解往往比单看一种更牢固。例如结合画面与说明,模型对场景的把握更立体;借助语音语调,它也能捕捉文字之外的情绪。模态之间的互补,使智能从偏科走向全科。
结合画面与说明,模型对场景把握更立体;借助语音语调,它还能捕捉文字之外的情绪,模态互补使智能更全科。
模态互补,让理解比单看一种更立体。
二、它是如何把不同信号捏合在一起的
1、统一表示是核心一步
要让模型同时处理图、文、声,关键在于把它们投射到同一套可比较的表示空间。无论输入是像素、波形还是词语,都转化为统一形态的表示单元,模型便能像处理文字一样处理其余模态。这一步统一,是后续所有跨模态推理得以发生的基础。
无论输入是像素、波形还是词语,都转化为统一形态的表示单元,模型便能像处理文字一样处理其余模态。
统一表示,是跨模态推理发生的前提。
2、对齐与融合的训练艺术
训练时,模型需要学会把图中的猫与猫这个字对应起来,理解不同模态指向同一事物。通过对齐与融合的反复磨合,它逐渐建立起跨模态的关联,既能据图生文,也能依文找图,甚至把语音、视频都纳入同一套理解框架之中。
从图中的猫对应猫这个字起步,模型经对齐与融合的磨合,逐渐建立跨模态关联,既能据图生文也能依文找图。
对齐训练,让不同模态指向同一事物。

三、能解锁哪些新体验
1、更自然的人机交互
用户不再只能打字,可以拍照提问、语音描述、上传视频求分析,系统都能接住并给出贴切回应。这种多通道的交流,降低了使用门槛,也让求助变得像与人对话一样自然。交互方式的丰富,正在悄悄改变人们调用智能的习惯。
用户可拍照提问、语音描述、上传视频求分析,多通道交流降低门槛,让求助像与人对话一样自然。
多通道交互,正在改变人们使用智能的习惯。
2、内容创作的跨界助手
多模态模型可把一段文字变成配图思路,也能为画面配写解说,或把口述整理成带结构的文稿。它在不同媒介间架起桥梁,让创作者在文字、图像与声音之间自由穿梭,把原本割裂的生产环节串联成顺畅的流水线。
它把文字、图像与声音串成顺畅流水线,让创作者在媒介之间自由穿梭,把原本割裂的生产环节连成一体。
媒介之间的桥梁,让创作流程顺畅贯通。

四、技术上的难与巧
1、异构数据的尺度差异
图像、文本、音频的数据形态与体量差异巨大,如何让它们在训练中均衡发力,是绕不开的难题。某一模态过强可能压制其余,导致整体失衡。合理的采样与损失设计,犹如调配多种食材的火候,决定最终味道是否协调。
某一模态过强可能压制其余导致整体失衡,合理的采样与损失设计,犹如调配食材火候,决定最终味道是否协调。
均衡发力,决定多模态系统的最终协调。
2、标注与对齐的成本
教模型理解跨模态对应关系,往往需要成对的图文、音文数据,而高质量配对并不易得。研究者用大规模弱标注与自监督方式缓解这一压力,让模型从海量未精细标注的数据中自行归纳关联,以降低对昂贵人工配对的依赖。
高质量配对并不易得,研究者用大规模弱标注与自监督缓解压力,让模型从海量数据自行归纳跨模态关联。
弱标注自监督,缓解昂贵配对的压力。

五、走向更统一的感知智能
1、从感知到生成的闭环
先进的多模态系统不止于看懂,还能造出,可依据理解反向生成图像、语音或视频。感知与生成的结合,让机器在输入输出两端都更完整,也让人与智能体的协作更具创造性,而非停留于单向的问答。
感知与生成结合,让机器在输入输出两端都更完整,也让人与智能体的协作更具创造性,而非停留于单向问答。
感知加生成,输入输出两端更完整。
2、通向具身与世界的连接
当多模态能力进一步与行动体结合,机器便能用视觉导航、用语言受令、用动作反馈,真正嵌入物理世界。这条从会看会听到能做的延伸,预示着感知智能即将走出屏幕,成为可与环境互动的伙伴。
当多模态与行动体结合,机器能用视觉导航、用语言受令、用动作反馈,真正嵌入物理世界成为可互动伙伴。
走出屏幕,感知智能终将嵌入真实世界。

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)