图片

前沿技术探索:TVA智能体(简称TVA)

TVA智能体(亦称“AI智能体视觉”)是依托Transformer架构与“因式智能体”理论构建的新型工业视觉系统,也是当前最具代表性的具身视觉技术之一。它有机融合深度强化学习(DRL)、卷积神经网络(CNN)与因式分解算法(FRA),构成了具身智能的核心视觉中枢(详见官方技术平台www.tianyance.cn)。作为具身智能颇具前瞻性的系统级框架,TVA凭借其非结构化环境动态感知与理解能力,实现了“感知-推理-决策-操作-反馈”的闭环控制,完成从“看见”到“看懂并行动”的科学机器学习(SciML)范式突破,从而为解决具身智能中感知与决策的深度耦合,提供了性能卓越的底层算法架构。这一革命性突破不仅使其成为制造业与物流业的“视检专家”(作为“类人智眼”的初级形态),更为智能机器人运动控制提供了高鲁棒性的视觉理解支撑(作为“原生小脑”的中级形态),并最终演进为具身智能系统的核心引擎与能力基座(作为“原生大脑”的高级形态)。

新一代具身智能范式:TVA-World

为了让机器获得一种有足够适应性与实用性的世界表示,并把“理解”真正变成“行动”,TVA智能体进一步与物理世界模型(World Model)深度融合,催生出新一代具身智能范式——TVA-World。该范式并非模块的简单拼接,而是一套在数据流、特征流和控制流层面深度交织的系统级通用架构:以TVA为“感知-执行中枢”,以遵循物理法则的世界模型为“物理推演与认知中枢”,构建出一个既能“看见”表象又能“理解”本质的通用物理智能体系。通过“实时感知-虚拟推演-精准执行”的毫秒级闭环,TVA-World架构有效解决了传统AI缺乏因果理解、泛化能力弱及交互延迟高等难题,使得机器可以从像素构成的世界里,进一步理解隐藏在其中的几何特征与物理属性,推动具身智能技术在视觉检测、智慧物流、智能制造等领域实现了从“计算机视觉”(看像素)到“计算机物理”(懂规律)的历史性跨越。

摘要:李飞飞博士指出,当前AI虽在语言能力上取得突破,但在空间理解与物理推理上仍存短板。她提出“世界模型”与“空间智能”是通往AGI的关键,强调AI发展需回归人类认知本质。未来,通过构建可交互、可推理的数字世界,AI将赋能机器人、科学发现与创意产业,推动技术迈向真正具身智能的新纪元。

过去几年,AI行业发展迅猛:大模型层出不穷,产品不断迭代,话题焦点从成本转向AGI……整个行业狂飙突进,却很少有人停下来思考:人类到底需要怎样的AI?

近日,“AI教母”李飞飞博士发表了一篇重磅文章《从语言到世界:空间智能是AI的下一个前沿》,将“World Models”(世界模型)这一问题推至台前,在业内引发强烈反响。随后,她在接受科技播客Lenny's Podcast的采访中谈到,当前的AI仍存在局限,“世界模型”与“空间智能”将是未来的发展方向。她还回顾了AI从“寒冬”走向繁荣的历程,并对机器人技术的未来发展发表了看法。

PART ONE

AI未来的走向取决于人类

01

李飞飞表示,人类对AI的最早研究可以追溯至20世纪40年代的艾伦·图灵,他提出了“机器能否思考”这一划时代命题。然而,人类对于这一领域的真正研究始于上世纪五六十年代。

1956年的达特茅斯会议上,斯坦福大学的约翰·麦卡锡教授首次提出了“人工智能”(AI)这一概念,它标志着人类开始系统性地探索如何让计算机程序模拟人类认知能力。

在AI发展的早期阶段(1950-1980年代),研究的重点在于逻辑系统、神经网络。直到20世纪末,随着计算机编程与统计学习的融合,机器学习时代正式开启。

这一转变带来了根本性的认知突破,即纯粹基于规则的程序难以实现真正的智能,研究者意识到,要让机器从数据中自主学习模式,关键在于使机器获得“泛化”能力。例如,机器不仅要能识别训练时见过的三只猫,更要能辨认出未来遇见的任何猫。这种从有限样本推及无限场景的学习机制,正是人类与动物智能的基础,也成为驱动现代AI发展的关键。

李飞飞指出,自己作为第一代机器学习研究者,大约在2000年左右开始研究AI。其职业生涯与现代AI的诞生来自于两个关键选择:一是选择视觉智能作为研究方向,二是认识到大数据对智能发展的决定性作用。

她强调,之所以选择从视觉这个角度切入AI领域,是因为人类是高度依赖视觉的生物。同一个物体在图像中有各种各样的变化,识别物体这一行为本身非常困难,因此,要让计算机能够理解成千上万种物体,就必须给机器提供大量的图像信息。

正是基于这一认知,李飞飞在博士阶段就确立了以“物体识别”作为研究方向,并催生了ImageNet项目。2006年,她着手构建一个图像数据库,从互联网上整理了1500万张图像,覆盖2.2万个类别。

转折发生在2012年,当多伦多大学的杰夫·辛顿教授研究团队将ImageNet的海量数据与神经网络模型、英伟达的GPU相结合,在ImageNet挑战赛中实现突破性进展时,现代AI终于诞生:大数据、神经网络和算力三大要素的融合,开启了深度学习的新纪元。

然而大部分人对AI的接受没有那么早,2015年、2016年左右,许多公司仍因顾虑而回避使用“AI”一词,直到2017年左右,才有公司称自己是“AI公司”。直到三年前ChatGPT问世,大部分人才开始关注到AI。

她指出,过去的二十年里,她一直提醒学生,AI虽然被称为“人工智能”,但实际上一点也不“人工”。当前AI在语言能力上虽取得长足进步,但在空间理解、物理推理等构建真实世界认知的方面,仍存在结构性短板。

她强调,AI并非“虚假”的智能,它源于人类的智慧,并由人类创造,其未来走向最终也取决于人类自身。她坚信从长远来看,AI的发展对于人类文明是利大于弊,但同时也是一把“双刃剑”,成败的关键取决于人类能否做出正确的选择。

关于AI的未来,李飞飞表示,AI是一项承载了70年人类文明的“技术”,是几代人智慧的结晶,其未来的走向,特别是AI的开发、部署与应用的每一个环节,人类都必须秉持高度的责任感。这不仅关乎技术进步,更因为它将深远地影响每一个人、整个社会乃至子孙后代。

PART TWO

距离AGI有多远?

02

目前的AI技术距离真正的AGI有多远呢?李飞飞表示,AI与AGI间并没有本质界限,这只是一个文字游戏,“AGI更像是一个营销术语,而非科学概念”。 

尽管通过扩大数据规模、增加算力与优化模型结构能够持续提升AI的技能水平,但当前的AI技术距离实现真正的AGI仍有漫长道路,人类仍需进行根本性的创新。

她强调,AI作为人类文明中最年轻的科技领域之一,仍处于探索期。目前的AI在许多基础认知任务上仍显不足。例如,你给大模型观看一段办公室视频,让它数出其中的办公椅数量,这对幼儿轻而易举,对于现有的AI模型却是个难题。

更不用说达到牛顿式的科学洞察力:通过观察天体运行,便归纳出万事万物的运动规律——这种抽象推理能力与创造性思维,完全超出了当前AI的能力范围。即便人类为AI提供了远多于牛顿时代的观测数据,它也无法独立推算出经典力学定律。

在情感认知层面,AI同样存在局限。它无法像人类的老师那样,在与学生的对话中敏锐感知到学生的学习动力、情绪波动或人生困惑。尽管现有的聊天机器人已经表现卓越,但距离真正的情感共鸣与深度理解仍有巨大的提升空间。创新之路,才刚刚启程。

PART THREE

空间智能是下一个前沿阵地

03

图片

李飞飞表示,“我一直在思考如何推动AI的发展,过去几年大语言模型的密集涌现,确实令人振奋。早在2020年底GPT-2发布时,尽管公众尚未意识到大模型的潜力,但我们研究者已清晰看到了技术变革的曙光。

那时我正担任斯坦福大学HAI的联合主任,我与Percy Liang、Chris Manning等自然语言处理领域的同事进行了深度探讨,我们都坚信这项技术将至关重要。为此,斯坦福HAI成立了全球首个系统研究基础模型的中心,我也很荣幸能与他们共同撰写该领域的首篇奠基性论文。这些经历给了我巨大的启发。

然而,我的研究基础在于视觉智能。这让我始终关注着语言之外的广阔天地——人类依靠空间直觉和物理理解所能完成的无数任务,其实远远超越了语言的范畴。试想在一个混乱的救援现场:无论是火灾、事故还是灾难,人们自发组织施救、控制险情、扑灭火焰,依靠的多是行动本能,是对物体、环境和人类处境的本能理解。语言虽参与其中,却无法直接扑灭大火——这种行动中的智能究竟是什么?这始终是我探索的核心。”

通过在机器人领域的持续研究,李飞飞逐渐意识到:连接语言与具身智能、贯通视觉理解与行动决策的关键,正是建立在世界模型之上的空间智能。这或许就是下一个需要突破的方向。

关于空间智能,她表示,自2022年起,基于在机器人与计算机视觉领域的积累,关于空间智能的构想逐渐成形。2024年,她在World Labs的TED讲台上进一步阐述了这一愿景,并清楚地意识到:希望汇聚全球顶尖人才,共同将这一构想转化为现实——这也正是她们创立“World Labs”公司的初衷。公司名中的“世界”二字,代表了她们对世界模型与空间智能未来方向的坚定信念。

世界模型的核心,在于允许任何人通过图像或文字等提示,自由创造出想象中的任何世界,并与之深度互动——无论是行走探索、拾取物品还是重塑环境。更重要的是,它还能支持在这个世界中进行逻辑推理。

例如,一个机器人能够利用世界模型来自主规划路径,完成诸如整理厨房这类需要理解物理规则的任务。所以,世界模型本质上是构建可创造、可交互、可推理的数字世界的基石。

机器人技术正成为AI研究与全球科技界的下一个焦点,而世界模型正是实现机器人在现实世界中有效行动的关键——它赋予AI理解世界运行规律的能力。当然,其意义远不止于机器人。世界建模与空间智能是实现具身智能的核心环节。而人类作为具身主体,未来也将从世界模型与空间智能中获得巨大赋能,机器人只是其中之一。

这项技术一旦成熟将带来广泛突破:每个人或许都能拥有帮助自己处理日常事务、应对灾害的机器人助手:游戏产业将被重塑,无限可生成的动态世界将成为可能;从机械、建筑到家居布局,以及整个创意与设计领域都将获得改变,甚至科学发现的方式也将被改变。

她以DNA双螺旋结构的发现为例,补充说,虽然富兰克林的X射线衍射图只是一张二维影像,而沃森与克里克却通过它完成了关键的三维空间推理,从而揭示了高度立体的DNA分子结构。这一认知飞跃正是空间智能的体现。未来,由AI增强的空间智能,有望在更多科学领域催化这样的突破性洞察。

说明:图片来源于网络。相关信息仅供参考,不构成投资建议。市场有风险,投资须谨慎。

(附)具身智能算法突破(TVA-VLA)

为了将复杂动作拆成可以验证、组合和重新排列的原子技能(atomic skills),TVA智能体与VLA(Vision-Language-Action)模型进行深度耦合,并通过“感知-决策解耦迭代”的双引擎机制实现高效协同与突破。其中,TVA作为感知前置引擎,主要负责高精度视觉特征提取、数据降噪与特征压缩,为决策层提供高质量输入并降低算力负荷;VLA则作为决策执行引擎,专注于语义理解、任务规划与动作生成。两者通过双向反馈闭环,实现了感知精度与决策效率的协同优化与自主迭代,突破了传统具身智能系统“感知粗糙、决策僵化、迭代低效”的产业化瓶颈。TVA-VLA架构不仅成功应用于强光环境降噪、边缘端轻量化推理、精密装配微状态感知及故障自愈等复杂场景,还支持模块化升级与跨场景适配(如工业分拣、家庭服务);结合硬件抽象层实现的“一次开发多机部署”以及数据飞轮机制,显著提升了具身智能系统的鲁棒性与产业化落地可行性。

重磅预告:本专栏将独家连载系列丛书《AI智能体视觉技术与应用》部分精华内容,该书是世界首套系统阐述“因式智能体”视觉理论与实践的专著,特邀美国 TypeOne 公司首席科学家、斯坦福大学博士 Bohan 担任技术顾问。Bohan先生师从世界模型开创者、“AI教母”李飞飞教授,学术引用量在近四年内突破万次,是全球AI与机器人视觉领域的标杆性人物(www.type-one.com)。全书严格遵循“基础—原理—实操—进阶—赋能—未来”的六步进阶逻辑,致力于引入“类人智眼”新范式,系统破解从数字世界到物理世界“最后一公里”的世界级难题。该书精彩内容将优先在本专栏陆续发布,其纸质专著亦将正式出版。敬请关注!

版权声明:本文系作者原创首发于 CSDN 的技术类文章,受《中华人民共和国著作权法》保护,转载或商用敬请注明出处。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐