图片

一、开场:先泼一盆冷水

WAIC 2026,上海。具身智能首次独立成馆,200 多家企业、300 多台真机扎堆亮相。

所有人都在喊"具身智能是下一个浪潮"。

所有人都在喊"工业大模型要接管质检"。

但很少有人问一句:在这张牌桌上,机器视觉坐的是主角席,还是正被悄悄收进配角名单?

我们做了 20 年机器视觉,看过太多"改写行业"的叙事,也看过太多产线里真正决定良率的,还是那双"眼睛"。

所以这篇文章,想把这个被热词盖住的问题,重新摆到桌面上。

图片

二、先拆清楚:"终极形态"到底长什么样

具身智能拆开看,就三块——

身体:机械臂、移动平台、轮足底盘。负责动。

大脑:决策、规划、任务分解。负责想。

眼睛:感知、定位、识别。负责看。

工业大模型解决的,是"大脑"的老毛病。过去产线要写死坐标,换一个型号就得重调一遍。大模型带来的是泛化:少样本、零样本学习,语义级理解。

换成大白话——你不用再说"检测坐标 X=120、Y=340",而是说"把那个歪了的垫片捡出来",一句话机器就懂了。

但机器视觉现在的位置很微妙:它既是"眼睛",也承担了部分"大脑"。

检测算法 = 识别 + 判定。看到缺陷,还要判断"这是不是缺陷、要不要踢掉"。这部分能力,大模型至今没法直接替换。

图片

▲ VisionBank AI 软件检测界面——视觉系统如何同时完成"看"与"判"。

三、我们的判断:机器视觉不会消失,但会沉到底层

一个反直觉的结论:视觉不会是"终极形态"本身,但会是所有具身 / 大模型方案的标配器官。

打个比方。手机摄像头。

它从不被叫做"终极手机"。但没了它,手机就是一块砖。

视觉在工业里,就是那个角色。

产线是最诚实的考场。我们 20 年经验、8200+ 客户、50000+ 套设备在线,汽车 10+ 案例、3C 20+ 案例、机械 16+ 案例——这些数字背后,是视觉早就成了产线的"标准器官",不是什么新来的配角。

说白了,当具身机器人喊着"我要有大脑"冲进工厂,它第一件事,还是得先装上靠谱的"眼睛"。

视觉的纵深,比外界想象得深。国内首家自研的双远心镜头,把畸变压到了 0.1% 以下;VisionBank AI 平台上的 200+ 种检测工具,是千万次产线验证攒下来的家底。再往细看,随便举几个技术细节——

动态旋转中心,解决装配空间受限时机械臂怎么精准对位;

区块自定义,让阵列型产品(像 miniLED)能做分区检测、精准定位故障点;

深度通用 OCR,不用调参、不用训练、不用登录字体库就能认字;

虚拟图像单元,把多台相机的视野拼成一张统一坐标图,跨相机也能做几何计算。

这些不是"大模型一句话"能替代的底层硬功夫。它们是视觉作为基础设施的技术护城河。

图片▲ 产线检测工位实拍图——现场设备、相机与光源组成的实景检测单元。

四、但要警惕:别把"大模型 + 具身"神话成终点

工业现场要的是确定性。

0 漏检。可追溯。今天检出来,明天还得检得出来。

大模型擅长泛化,却不擅长"说到做到"。它给你一个"大概率对"的答案,但产线要的是"必须对"。公开数据里,质检机器人单件检测能做到 5 秒以内、亚微米精度——听着漂亮,可工厂真正在乎的是:这一万件里,有没有那一个被放过的缺陷。

真正能落地的"终极形态",从来不是单点突破,而是三者耦合:可信赖的视觉 + 可控的模型 + 能动的身体。

在这个耦合里,谁最不容易被替代?

是视觉。

因为"看准"这件事,容错率最低、标准化最难、积累最慢。身体可以换形态,大脑可以换模型,但"眼睛"的可靠性和标准,才是那个锚点。

五、所以,我们给出明确判断

机器视觉的终极形态,不是"被大模型吞掉"。

而是:变成更底层的、标准化的感知基础设施,上面再长出自适应的大脑。

谁掌握了"眼睛"的标准和可靠性,谁就握住了具身时代的门票。

这不是悲观,也不是护短。是 20 年产线教会我们的事:浪潮会换名字,但工厂永远需要先看清,再动手。

图片


Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐