本文整理自小宇宙播客《#667.李飞飞:利用人工智能提升你的智力与丰富人性》,通过 Ai好记 转录整理,以下为精炼整理后的内容。

刷到 Huberman Lab 对谈李飞飞这期节目时,我的第一反应是收藏吃灰。两个小时,讲人工智能、计算机视觉和人类智能,信息密度太高,听不完。顺手用 Ai好记 把链接丢进去做了总结,精华速览把对话切成视觉与 AI 起源、机器击败人类、AI 的极限、医疗应用、教育、具身 AI 几条主线,几分钟就抓住了脉络。

但真正让我停下来反复想的,是这句话:关键不在于深不深,而在于数据可不可及。那些最个人化的情感和直觉,因为从未被上传,AI 永远无法触及。想了两天,决定整理成笔记分享出来。


先给结论

- 视觉是智能的基石,5.4 亿年前的感光催生寒武纪大爆发,也启发了神经网络

- 2012 年 ImageNet、神经网络、GPU 汇聚开启现代人工智能,2016 年机器在 1000 类物体识别上击败人类

- AI 学不会的不是深奥,而是从未上传的个人化体验,数据可及性决定一切


视觉是智能的基石:从寒武纪到 ImageNet

李飞飞把视觉看作智能的基石,从进化和计算机视觉两条路径看。

5.4 亿年前,简单海洋动物第一次感光。感知改变了它们与外部世界的关系,约 1000 万年后就是寒武纪大爆发。今天人脑一半的皮层活动与视觉相关,儿童发育也是先有视觉后有语言。

光有进化这条线还不够,真正敲开 AI 大门的,是神经科学。1950 年代 Hubel 和 Wiesel 发现视觉细胞有层级结构,神经网络算法正是从这里偷师。李飞飞补上数据一环:她研究认知神经科学文献,发现儿童到 6 岁能学会成千上万种物体类别,靠的是海量视觉输入,于是主导 ImageNet,收集 1500 万张图像。我读到这段时挺感慨,原来最基础的「看」,串联起了进化、神经科学和 AI 三条线。


机器击败人类的时刻:AI 与人类的学习路径不同

ImageNet 挑战的任务是从 1000 类物体里识别主要物体。斯坦福博士生测出人类错误率约 4%,随机猜对概率只有千分之一。

2012 年神经网络把错误率降到 10% 几,虽没达到人类水平,但研究社区知道这是拐点。到 2016 年,算法在命名 1000 个物体上击败了人类。

同样是认猫,人和机器的路子完全不一样。孩子见过三只猫,就能认出书后探出的猫尾巴是猫,AI 却要海量数据。李飞飞坦言,这种小样本学习机制至今是未解之谜——我自己听的时候也觉得,人类大脑这个「见几面就学会」的能力,确实还是黑盒。

视频生成也一样。2023 年视频进入训练数据,2024 年 1 月 Sora 发布,打开了视频生成闸门。算法不知道猫腿肌肉结构,只是看过海量猫视频,从统计里学会猫动起来的样子。


AI 的边界:关键不在深不深,而在数据可不可及

谈到 AI 的极限,李飞飞说,互联网是人类行为最大规模的集合,文字、图像、视频、音乐都在上面。但乡愁、毕加索的某个念头、一只杯子唤起的情感记忆——这些从未被上传过,AI 没有途径获取。这就是题眼:关键不在于深不深,而在于数据可不可及。

AlphaGo 第 37 手常被当作 AI 创造力的证据,李飞飞认可但提醒那是特殊创造力:围棋有清晰的数学规则,AI 靠算力和记忆能做人类大师没想到的事。对解法尚未被发明的难题,她猜想要人和 AI 并肩工作。

但最根本的分歧,藏在动机和情感里。ChatGPT 不同模式背后是不同目标函数,对人类叫紧迫感,对机器只是数学。机器说「对不起」基于模式匹配,朋友说这句话带着共情,完全是两回事。


AI 增强人类:脑机接口与医疗人机协作

李飞飞反复强调,AI 是增强而非取代人类的工具。她设想用细电极发网非侵入读取脑活动,让 AI 接触到连你都没意识到的内在状态。今天已能做到的,是让 AI 学习你的写作模式,帮你成为更好的沟通者。

医疗是最直观的例子。Huberman 自己就吃过亏:AI 帮他分清眩晕和低血压,而此前连耳鼻喉科专家都判断错了方向。

李飞飞父亲做肝脏手术由达芬奇机器人辅助,失血量比典型手术少 10 倍。但她提醒,AI 从模式中学习,像肝脏这种个体差异大的器官,全球手术数据可能都不够训练靠谱算法。听完这段我最大的感受是:人机协作,远好过任何一方单干。


教育、AI 伦理与具身 AI:下一个前沿

谈到教育,她担心的不是 AI 太强,而是人变懒。最坏的结果是工具夺走年轻一代的学习动机和能动性;另一重危险是借防作弊之名把工具从学生手里夺走。理想路径是保住动机,用 AI 做更深入的学习。提示词的精确度正成为关键技能,她希望从幼儿园开始教,这本质上是苏格拉底式提问的现代版——我听完有点惭愧,自己写提示词时从没想过这一层。

比起技术,她更担心治理。2018 年她回到斯坦福创办以人为本人工智能研究所(HAI),搭多方共治框架:职业规范、AI 伦理教育、法律监管缺一不可,反对少数产业人士决定所有人的未来。

在具身 AI 上,她把目光投向了语言之外的天地。埃迪·张博士帮闭锁综合征患者通过 iPad 重新与世界互动,Waymo 会为行人停下来,细节里藏着善意。她希望未来 30 年机器人协助护理、救灾、照顾独居老人,做成大白那样人性化的设计。她的 World Labs 2024 年创立,目标是解锁空间智能,生成创作者、机器人训练、建筑设计能用的 3D、4D 世界——这也是我接下来会持续关注的方向。


常见问题

如果你只记住了三件事,下面把几个高频问题整理如下:

李飞飞为什么说视觉是智能的基石?

她从进化与计算机视觉两条路径论证:5.4 亿年前动物首次感光催生了寒武纪大爆发,今天人脑一半皮层活动与视觉相关,而 Hubel/Wiesel 的视觉层级研究直接启发了神经网络算法。

ImageNet 挑战中,机器什么时候击败了人类?

人类在 1000 类物体识别上错误率约 4%,2012 年神经网络把错误率降到 10% 几成为拐点,2016 年算法在命名 1000 个物体上首次超越人类。

李飞飞认为 AI 学不会的是什么?

不是多深奥的知识,而是从未被上传到互联网的高度个人化体验,比如乡愁、某个瞬间的情绪、一只杯子唤起的情感记忆。她的原话是,关键不在于深不深,而在于数据可不可及。

World Labs 是做什么的?

李飞飞 2024 年创立的公司,聚焦空间智能,生成对创作者、机器人训练、建筑设计都有用的 3D、4D 世界,被视为语言智能之后的下一个前沿。

具身 AI 未来会用在哪些地方?

李飞飞设想机器人协助护理、救灾、照顾独居老人,用多形态、人性化设计(比如大白式)融入社会,同时强调人类应保有共同设计这个未来的自主权。


以上内容由 Ai好记 转录整理。Ai好记 是一款音视频转图文笔记的 AI 学习助手,支持 B站、抖音、小宇宙等平台链接及本地音视频文件,转入后自动生成精华速览、思维导图和结构化笔记,帮助你把几小时的视频内容变成可搜索、可复习的图文笔记。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐