摘要

本周系统学习了强化学习基础理论与多模态模型核心技术。深入掌握了强化学习的核心概念,包括马尔可夫决策过程、价值函数、策略优化等基础理论;精读多模态大模型论文,重点研究了视觉标记器与视觉编码器的技术差异与协同机制,明确了视觉标记器的图像分块与向量化功能,以及视觉编码器的高级语义特征提取作用。通过理论梳理与论文精读,构建了从强化学习基础到多模态视觉处理的完整知识框架。

Abstract

This week systematically studied the fundamental theories of reinforcement learning and core technologies of multimodal models. Gained in-depth understanding of reinforcement learning’s core concepts, including Markov decision processes, value functions, and policy optimization. Conducted intensive reading of multimodal large model papers, focusing on the technical distinctions and collaborative mechanisms between vision tokenizers and vision encoders, clarifying the image patching and vectorization functions of vision tokenizers, and the high-level semantic feature extraction role of vision encoders. Through theoretical梳理 and paper intensive reading, established a complete knowledge framework from reinforcement learning fundamentals to multimodal visual processing.

1、强化学习

本周系统学习了强化学习的基础部分,总结汇总了笔记:强化学习(RL)入门基础

2、多模态学习

精读论文 TOWARDS SEMANTIC EQUIVALENCE OF TOKENIZATION IN MULTIMODAL LLM
笔记地址:
《Towards Semantic Equivalence of Tokenization in Multimodal LLM》笔记 - 学AI的小勇的文章 - 知乎

2.2 MLLM的视觉编码器和视觉标记器

2.2.1 Vision Tokenizer

视觉标记器的主要功能是将原始图像转换成一个个“标记”(tokens),这些tokens是模型可以处理的输入表示。具体来说,视觉标记器会将图像分解成若干个小的“patches”(图像块),然后将这些图像块转化为向量,成为一种离散化的表示。

工作原理

  • 图像分割:首先,图像被分割成小块(patches)。每个patch可能是16x16像素或者其他大小,具体根据模型设定来决定。

  • 向量化:每个patch会被转换为一个向量,这个向量是一个固定维度的特征表示。这样,图像的每个部分就有了一个表示,模型可以处理这些表示。

  • 位置编码(Positional Encoding):为了保持图像中不同位置的信息,标记器还会给每个patch添加一个位置编码,表示该patch在图像中的位置。

举例

  • 在**Vision Transformer(ViT)**中,视觉标记器将图像切割成若干个小块,每个块被展平并转化为向量,最终形成一个token序列,输入到Transformer模型中。

总结

  • 视觉标记器的关键任务是将图像转化为tokens。它的输出是一个表示图像的离散化序列(tokens),该序列可以输入到后续的深度学习模型中进行处理。

2.2.2 Vision Encoder

作用
视觉编码器的主要功能是对输入的视觉数据(例如图像或视频)进行特征提取和表示学习。它将图像的低级信息(如颜色、形状、边缘等)转化为高级的语义特征表示。这些特征表示通常是一个高维的向量,捕捉了图像中物体、场景以及其他关键信息。

工作原理
特征提取:视觉编码器通过多个层级的神经网络(例如CNN、Transformer)来提取图像中的信息。这些层级会逐渐从低级的图像像素信息提取到更抽象、更高级的特征表示。

表示学习:编码器会将图像信息转化为一个固定维度的向量(即“embedding”)。这个向量就是图像的“语义”表示,包含了该图像的关键信息。

举例
ResNet是一个经典的视觉编码器,通过卷积神经网络(CNN)来提取图像的特征。

ViT(Vision Transformer)中的编码器部分会对通过视觉标记器得到的tokens进行处理,最终提取图像的高级特征表示。

总结
视觉编码器的任务是将图像的低级信息转化为高级语义表示,通常是一个向量,这个表示能够捕捉图像中的关键信息。视觉编码器是模型理解图像的核心模块。

2.2.3 区别

视觉标记器 (Vision Tokenizer)视觉编码器 (Vision Encoder)
主要任务将图像分解成多个patch(小块),并将它们转化为tokens(标记)。从图像的tokens中提取高层次的语义特征表示。
输入原始图像数据(例如RGB图像)。视觉标记器输出的tokens或图像的原始像素数据。
输出图像的tokens表示,通常是多个小块的特征向量。图像的高维特征向量(embedding),用来表示图像的语义信息。
具体实现方式通过图像分割和展平来生成tokens,并可能添加位置编码(例如ViT中的patch)。通过CNN(如ResNet)或Transformer(如ViT)提取图像的语义信息。
作用准备图像数据,生成可以输入到深度学习模型的token序列。处理视觉数据,生成能够表示图像内容的高级特征表示(embedding)。

总结

这周主要学习了强化学习的基本入门知识,进行了巩固,下周计划选择一个强化学习框架,对代码进行实战学习。精读了一篇多模态领域的论文,其提出了一个vision tokenization,然后我又去巩固了一下vision tokenizer和vision encode。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐