Token价格腰斩、AI公司半年报集体预喜:当“能力商品化”走到尽头,“表现力差异化”为何成了新战场?
AI有了"身体"又降了"身价":当Gemini Robotics 2学会全身控制、GPT-5.6砍价80%,表现力为何成了最后一块拼图?
一天之内,AI的"脑"和"身"同时进化
2026年7月31日,三件事在同一天发生,恰好拼出了AI发展的一个完整截面。
第一件:Google DeepMind发布Gemini Robotics 2,首次实现对人形机器人的全身控制——不只是挥挥手、抓抓东西,而是从行走到下蹲、从取物到避障的完整身体协调。同步发布的Gemini Robotics ER 2充当"推理系统",能在机器人执行任务时同步规划后续步骤,还能通过连续视频流实时追踪进度、发现错误并就地修正。
第二件:OpenAI宣布GPT-5.6系列大幅降价。入门级Luna模型价格直降80%——输入每百万Token仅0.2美元,输出1.2美元。中端Terra降价20%,旗舰Sol则新增Fast模式,速度提升2.5倍。更引人注目的是,GPT-5.6 Sol已经能通过Codex自主重写生产环境的GPU内核,使服务成本降低20%、Token生成效率提升15%。AI开始给自己"打工"了。
第三件:据央视报道,全球最大开源AI模型平台2026年春季报告显示,中国研发的开源模型下载量占全球总量41%,累计突破100亿次,超越美国位居世界第一。主流大模型调用榜单前六位全部来自中国团队。
三件事看似各自独立,但放在一起看,它们共同指向一个结构性变化:AI的"大脑"正在被快速商品化(价格战+开源),AI的"身体"正在加速成形(机器人全身控制),而连接大脑与终端用户的"表现层"——让AI能够以自然、可信、富有感染力的方式呈现自己——却仍然是一个巨大的缺口。
Gemini Robotics 2:从"上半身"到"全身"的质变
谷歌这次发布的核心突破,在于将机器人控制从"上半身"扩展到了"全身"。
此前的机器人AI模型主要控制机械臂和上半身动作,比如抓取物体、按按钮。而Gemini Robotics 2能够将摄像头画面和自然语言指令直接转换为机器人电机控制指令,实现对整个人形机器人的协调控制——行走、下蹲、操控物体,一气呵成。
在预录演示中,DeepMind用Gemini Robotics 2操控Apptronik公司的Apollo机器人完成了一系列任务:穿过房间、拿起洒水壶、放到架子上,同时自主避开路径上的障碍物。这意味着机器人不再只是"定点操作",而是具备了在真实物理空间中移动和交互的能力。
更具突破性的是Gemini Robotics ER 2——它充当机器人的"推理大脑"。相比前代ER 1.6只能处理离散画面,ER 2能够分析连续视频流,实时追踪任务进度。在任务进度分类测试中准确率为57.4%,在关键时刻定位(Moment-Finding)测试中准确率达91.3%,平均时间误差仅0.96秒。
这意味着什么?机器人可以在执行任务时同步推理下一步——打破了传统机器人"停下来-想一想-再动"的串行模式。如果某个步骤出错,它可以就地修正,而不必从头重启整个工作流。此外,ER 2还能原生调用Google Search或开发者自定义函数,并接入Gemini Live API的双向流式端点,为延迟敏感的机器人任务提供支持。
在灵巧性方面,系统在"拧下灯泡"任务中成功率达到92%,但在扎垃圾袋、封Ziplock密封袋等更复杂的精细操作中,成功率仍然较低。这提醒我们:全身控制是一个里程碑,但离真正的"通用机器人灵活性"还有距离。
谷歌还展示了多机器人协作能力——ER 2可以协调多个机器人共同完成同一目标,而Gemini Robotics 2和ER 2既可以协同工作,也可以独立运行。这为未来的机器人集群应用打开了想象空间。
GPT-5.6降价:当"智能"开始按斤卖
OpenAI这次降价的激进程度超出多数人预期。
Luna模型的输入价格从每百万Token 1美元砍到0.2美元,输出从6美元砍到1.2美元——直接削掉八成。Terra从2.5/15美元降至2/12美元,降了两成。Sol维持5/30美元不变,但新增Fast模式:最高2.5倍速度,价格翻倍,智能水平不变。
在第三方机构Artificial Analysis Intelligence Index v4.1的评测中,降价后的Luna在智能指数超过50分的同时,单次任务成本仅约0.05美元——性价比全面超过DeepSeek V4 Pro。在Agents' Last Exam评测中,Luna甚至反超了Anthropic最贵的Fable 5模型,而执行单个任务的成本只有对方的约1%。
但比降价本身更值得深思的是背后的故事:GPT-5.6 Sol已经能自主优化自己的推理系统。通过Codex接入生产推理栈后,Sol重写了GPU内核、设计并执行了数百项实验、监控训练过程并主动介入问题修复。最终实现服务成本降低20%、Token生成效率提升15%以上。
这是一种全新的范式——AI不再只是被优化的对象,而是成为优化者本身。"模型越强、优化越快"的正向循环正在形成。而降价只是这个循环的外在表现:效率提升的收益被直接传递给了开发者。
这背后还有一股不可忽视的力量:中国开源模型的竞争压力。月之暗面的Kimi K3、DeepSeek V4等国产模型以极高性价比持续分流海外中小开发者客户,倒逼OpenAI不得不在入门级市场跟进降价。中国开源模型下载量突破100亿次、占全球41%——这组数据不是空洞的口号,而是实打实的市场影响力。过去12个月中,国产模型有9个月保持全球开源规模上限,迭代节奏持续领跑。
当智能越来越便宜,竞争的逻辑就必然发生转移。
结构性缺口:AI有了"脑"和"身","脸"在哪里?
把三件事放在一起,AI的竞争格局呈现出三层结构:
第一层——"大脑"层(推理能力):正在被快速商品化。GPT-5.6 Luna 80%的降幅、中国开源模型100亿次下载、Kimi K3在情感智能基准逼近闭源顶尖——都在说明同一件事:纯粹的"推理智能"正在从稀缺品变成基础设施。当输入每百万Token只要0.2美元时,"谁更聪明"已经不再是竞争的焦点,"谁更便宜"才是。
第二层——"身体"层(物理交互):正在加速成形。Gemini Robotics 2的全身控制、ER 2的同步推理、多机器人协作——谷歌正在用十年机器人战略的积累,把AI从屏幕里搬到物理世界。当机器人能行走、能避障、能拧灯泡,AI与物理世界的交互能力正在从"实验"走向"可用"。
第三层——"表现"层(人机呈现):仍然是最大的缺口。
什么是"表现层"?简单说,就是AI以什么样的面貌出现在终端用户面前。不是API返回的文本,不是冷冰冰的对话框,而是有声音、有表情、有口型、有情感的"数字人"形象。
这层的缺口为什么重要?因为无论AI的大脑多聪明、身体多灵活,最终与普通用户交互的界面,绝大多数情况下仍然是屏幕上的一个"脸"。而这个"脸"目前的状态,远远落后于大脑和身体的发展。
传统数字人方案大多采用"级联式"架构:先生成视频画面,再单独录制或合成声音,最后拼在一起。这种方式的致命问题是——声音和画面是两个独立生成的产物,在时间轴上必然存在微小的错位。观众可能说不清哪里不对,但潜意识会感知到"假"。这种"恐怖谷"效应,是数字人内容难以被广泛接受的核心障碍。
解决这个问题的技术路线叫"联合生成"——即同时生成声音、口型和表情,三者从同一个模型中一体输出,在时间轴上天然同步。国内已经有少数团队在探索这个方向,试图将人物表演的声、形、戏三个维度合为一体。
这并非简单的工程拼接。联合生成要求模型在同一推理过程中同时输出音频波形、视觉帧和面部运动参数,这对模型的架构设计和训练数据质量提出了远高于级联式方案的要求。但一旦实现,其产出的自然度和可信度将从根本上超越"先生成再拼接"的方案。
从"能用"到"会演":AI的下一个竞争维度
回到7月31日这三件事。
Gemini Robotics 2告诉我们,AI正在获得"身体"——可以在物理空间中行动、交互、协作。GPT-5.6降价告诉我们,AI的"大脑"正在变得极其廉价——智能正在从奢侈品变成水电煤。中国开源模型的崛起则说明,这场变革不再是某一家公司的独角戏,而是全球性的结构性趋势。
但三件事都没有触及的那个维度,恰恰是离终端用户最近的——AI如何"表演"。
推理能力可以靠API调用,物理交互可以靠机器人,但当一个普通用户打开手机、想要看到一个"人"在屏幕里对他说话时,那个"人"是否自然、是否可信、是否有感染力——这取决于表现层的成熟度。
一些专注于人物表演方向的数字人工具已经能做到"一张图加一段指令,同时输出声音、口型和表情"——这种联合生成的方式,使得声音的起伏与嘴型的张合、表情的变化在时间上严格一致,从根本上消除了级联式方案中无法避免的错位感。
这背后是一个更深层的产业逻辑:当推理能力被商品化、物理交互逐步成熟,AI竞争的下一个变量将不再是"谁的参数更大"或"谁的价格更低",而是"谁能让用户感觉到真实"。表现力——这个长期被工程优先级排在推理和感知之后的维度——正在从"锦上添花"变成"决胜关键"。
那些早期布局了联合生成方向的技术团队,或许正在悄然占据下一个体验缺口。就像2023年没有人预料到推理成本会降到今天的水平一样,表现层的技术突破,可能比所有人预想的来得更快。
结语
7月31日的三个信号——机器人全身控制、模型价格暴跌、开源登顶全球——共同勾勒出AI产业的一个清晰趋势:基础设施层正在快速成熟,竞争重心正在上移。
当"脑"足够便宜、"身"足够灵活,下一个被攻克的山头,是让AI学会"表演"——在屏幕上、在视频中,以一个可信的、有温度的、声形合一的"人"的形象,出现在每一个用户面前。
这不是锦上添花,而是AI从"工具"走向"伙伴"的最后一道关卡。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)