刷短视频的时候,总能看到那种AI生成的美女。

光影细腻,发丝根根分明,眼神里甚至带着情绪。评论区永远有人惊叹:"这跟照片有什么区别?""AI已经这么恐怖了吗?"

每次看到这种评论,我都想隔空喊一句:兄弟,你被骗了。

AI不仅不懂艺术,它甚至是个"盲人"。它压根不知道"美女"俩字是什么意思,不知道眼睛长在鼻子上面还是下面,更不知道什么叫"好看"。

那它是怎么画出来的?

答案会让你大跌眼镜:它只是在玩一场极其无聊的"像素消消乐"。

01. 先复习一下:文字AI是"接龙大神"

要理解AI怎么画画,得先从"文字AI怎么说话"说起。

你还记得上一期我们聊过的吗?ChatGPT这类东西,本质上就是个超级输入法。你打"床前明月",它接"光"。你问"怎么减肥",它接"少吃多动"。

它说的每一个字都是"蒙"的,只不过蒙得准。

那好,现在问题来了——如果给AI的任务不是"接下一个字",而是"接下一张图"呢?

这就变成了AI画画。

你给它一句"一只戴着墨镜的柴犬",它要干的事,跟你手机输入法干的事,底层逻辑一模一样:根据上文,补全下文。

只不过它的"下文"不是文字,是几百万个像素点的颜色数值

02. 先有雪花,后有画

这里有个反直觉的地方。

你以为AI画画是"从空白画布开始,一笔一笔勾勒"?就像人类画家那样,先打草稿,再上色,再细化?

完全不是。

AI画画,是从一团完全的雪花噪点开始的——就是老式电视机没信号时那种"滋啦滋啦"的雪花屏。

对,你没听错。AI拿到你的提示词之后,做的第一件事是:生成一张纯随机的马赛克雪花图。

然后,它开始玩"反向消消乐"。它拿着你的文字提示词当"攻略",一步一步地把雪花里的"噪点"消掉。每一轮消一点,每一轮消一点……经过几十轮,那团混沌的雪花,竟然慢慢长出了耳朵、鼻子、墨镜,最终变成一只活灵活现的柴犬。

这个过程叫"去噪",学名"扩散模型"。

你可以想象你在玩一个极端无聊的手机游戏:屏幕上全是乱码,你每次划一下,乱码就清晰一点点。划几百下之后,乱码变成了一张照片。

AI干的就是这事儿,只不过它划得比你快几万倍。

03. "墨镜"在AI脑子里长啥样?

那问题来了:AI怎么知道"墨镜"对应的是黑色块,"柴犬"对应的是毛茸茸的棕色块?

这就要回到我们反复念叨的那个概念:高维空间嵌入(Embedding)。

在AI的"字典"里,"墨镜"这个词不是一个词,而是一个坐标——一个几千维空间里的点。

这个点周围有什么?有"黑色"的坐标,有"圆形"的坐标,有"戴在脸上"的坐标。这些坐标都是从几十亿张图文配对里"挤"出来的。

更夸张的是,图片本身也是坐标

AI把"戴着墨镜的柴犬"这张图的每一个像素,也映射到这个空间里。在训练的时候,它被喂了几十亿张"文字+图片"的对子——"狗"配一张狗图,"夕阳"配一张夕阳图,"赛博朋克"配一堆赛博朋克图。

经过这种训练,AI的坐标系里形成了一个恐怖的能力:你给它一个文字坐标,它能在图片坐标区里找到最匹配的那片区域。

这就好比你有一个超级巨大的图书馆,每本书都有编号。你告诉管理员"我要一本关于狗和墨镜的书",管理员不用理解书的内容,只需要查编号索引,就能把那本书薅出来。

AI画画,就是在它的"编号系统"里做检索和重组。它不懂狗,但它知道"狗"的编号附近都是毛茸茸的东西。

04. 追光灯怎么打?

再来一个灵魂拷问:如果你输入的提示词是"一个穿红裙子的女孩在雨中奔跑",里面有"红裙子""女孩""雨""奔跑"四个关键要素,AI怎么分配注意力?哪个更重要?

这就轮到注意力机制(Attention)出场了。

你可以把它想象成一个"追光灯操作员"。AI在处理这句提示词的时候,追光灯在不同词之间来回扫射:

  • 扫到"红裙子" → 给图片中央区域施压:"给我变红!"
  • 扫到"雨" → 给全图施压:"给我变灰蓝,加模糊线条!"
  • 扫到"奔跑" → 给腿部位置施压:"给我加动态模糊!"

这个过程是同时发生的,而且是几十层同时进行。每一层都在执行不同的"灯光指令"。第一层可能只管"颜色",第二层只管"形状",第三层只管"纹理"……

最终,所有的"灯光压力"叠加在一起,硬生生把一团雪花"压"成了一幅画。

05. 那些藏在背后的"旋钮"

你可能已经猜到了——跟文字AI一样,绘画AI背后也有几十亿个"旋钮"(参数)。

文字AI的旋钮拧出来的是"下一个字的概率",绘画AI的旋钮拧出来的是"下一个像素的颜色值"

如果你问我,这两者谁更难?

我会说绘画AI更惨。

文字AI猜一个字,只需要算一个概率。绘画AI猜一张图(比如1024×1024分辨率),需要同时猜超过一百万个像素的颜色。每个像素有RGB三个通道,也就是要猜三百万个数值

这就好比让你蒙着眼睛,去拧一台拥有十亿个旋钮的收音机。你的任务不是让它出声,而是让杂音恰好组成《蒙娜丽莎》。

这就是AI的训练过程:一遍又一遍地"加噪→去噪",拧动那些旋钮,直到雪花变成名画。

训练数据是啥?是几十亿张从网上扒来的图——名画、自拍、电影截图、表情包……不管好坏,通通喂进去。AI不需要理解"这幅画好不好看",它只需要记住:在这张图里,这个像素旁边,大概率是那个颜色。

它不懂构图,不懂配色,不懂光影,它只是把几十亿张图的"像素邻居关系"硬背了下来。

06. 所以,这是不是人类的想象力?

说到这儿,你可能有点沮丧——原来AI画画这么"笨",纯粹是数学游戏。

但你有没有想过一个问题:人类的想象力,本质上是不是也是这套东西?

你听到"独角兽"这个词,脑子里瞬间浮现出那个画面——马的身体,角的螺旋,彩虹色的鬃毛。

你见过马,见过角,见过彩虹。你从来没亲眼见过独角兽,但你的大脑自动组合了这些见过的元素,生成了一张你从未见过的"假图"。

这个过程,跟AI把"马"的坐标和"角"的坐标叠加,有什么区别?

区别可能只有一个:你有肉身,你有被火烧过的痛觉,你有摔跤后的眩晕感,你有活了二三十年积累的"具身经验"。

AI没有。它的"想象力"建立在纯文本和纯像素之上,没有汗水的咸味,没有心跳的加速。

但抛开这些感官体验,在"把旧元素组合成新画面"这件事上,你跟AI干的活儿,底层逻辑一模一样。

所以,别再用"AI没有想象力"来安慰自己了。

它可能真的没有"想象"这种主观体验,但它产出的结果,已经让大多数人类画师感到后背发凉。

当一台没有眼睛的机器,能把你脑子里模模糊糊的梦,渲染成一张高清大图甩在你面前时——

你该追问的不是"AI怎么做到的",而是:

"我这个每天在脑海里放电影的'我',该不会也是个高级点的扩散模型吧?"

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐