近日,TsingtaoAI正式完成与某上市公司的“具身智能机器人设备技术实施项目”全流程交付。

本项目依托TsingtaoAI自主研发的VLA多模态具身智能平台,打通了“DeepSeek-R1 指令推理 + Qwen-VL-Max 空间感知 + 3D视觉定位 + 6自由度机械臂精准控制”的物理闭环,为教育科研团队构建了一套可复现、高鲁棒、工程化的具身智能实训与研发底层框架。

一、 项目背景:破局具身智能“软硬脱节”与科研落地痛点

随着以VLA为代表的大模型技术迅速演进,人工智能正从纯粹的文本与图像对话,迈向能够理解三维物理空间并进行复杂机械操纵的“具身智能”新阶段。然而,在高校与高科技企业研发团队的实际落地中,普遍面临着三大关键梗阻:

  1. 端到端闭环搭建难:传统机器人编程依赖固定的PLC或C++脚本,缺乏对自然语言意图的泛化理解;而通用大模型缺乏对物理环境深度坐标与机械臂逆运动学(IK)的精准解算能力。

  2. 感知与抓取精度不足:普通2D视觉受光照、反光及阴影干扰严重,无法在复杂或不规则桌面场景下输出稳定可靠的3D空间点云与目标姿态。

  3. 实训研发缺乏真实底座:教学与科研往往停留在纯仿真环境(Sim),一旦转移至真实物理场景(Real),极易因手眼标定误差、传感器噪声和动力学差异导致任务失败。

该上市公司在智能系统与行业应用方向的重要布局支撑,深耕企业级AI与知识图谱应用。为快速推动其教育科研团队在具身智能前沿领域的实验研发与场景验证,该公司选择引入TsingtaoAI的技术实施服务,打造一套符合高工业标准、具备高度扩展能力的具身智能实训与PoC实验底座。

二、 实施细节:多模态VLA架构与软硬件全栈集成

在本次技术实施中,TsingtaoAI资深工程师完成了从底层硬件物理组装、接口联调、手眼标定,到上层大模型Agent任务编排与底层控制算法的全面部署:

【语音/文本输入】
      ↓ 
【DeepSeek-R1】—— 意图解析与ReAct逻辑任务分解(动作序列规划)
      ↓ 
【Qwen-VL-Max】—— 3D视觉空间标定与JSON坐标解析(Gemini 336L RGB-D点云)
      ↓ 
【逆运动学解算 (IK)】—— 像素坐标向机械臂关节角度及末端位姿转换
      ↓ 
【6轴协作机械臂执行】—— 触觉/力反馈实时修正与动态抓取/摆放

1.多模态感知与高精度视觉定位(Perception)

硬件层面集成了奥比中光旗舰级3D深度相机 Gemini 336L(搭载MX6800芯片,具备主被动红外融合成像能力,有效消除白炽灯及桌面反光干扰)与 Femto Bolt,提供高达 1280×800@30fps 的深度数据。系统通过三维点云构建与空间语义标定,将桌面物理坐标精准映射至算法模型中。

2.双大模型大脑与Agent任务规划(Decision & Reasoning)

方案创新性地采用了 “DeepSeek-R1 + Qwen-VL-Max” 双大脑架构:

  • DeepSeek-R1 负责自然语言指令解析与ReAct逻辑任务规划(如将“沏茶”分解为取杯、接水、注水、奉茶等子步骤);

  • Qwen-VL-Max 则负责多模态视觉问答与目标物体的JSON格式坐标标定(包含起始点与终点像素及空间位置)。

3.高自由度机械臂与闭环控制(Execution & Control)

三、 交付成果:从底层源码到全流程实训生态

按照项目技术实施合同约定,TsingtaoAI已于2026年7月完成现场安装调试与全流程测试,并向该公司团队交付了高标准的全套工程成果:

交付模块 核心内容与技术指标 工程应用价值
硬件与系统底座 全套协同调试完成的6轴协作机械臂、Gemini 336L 3D深度相机、Jetson Nano边缘计算节点及气动吸泵套件。 开箱即用,提供高稳定性、支持7×24小时连续运行的物理实验环境。
全套演示源码 提供 agent_go.py、手眼标定模块、PyOrbbecSDK接口、OpenCV/Open3D点云处理及VLA Agent调优脚本(Python 3.10代码,注释规范,无后门程序)。 二次开发无缝接入,科研团队可直接修改Agent逻辑或替换自定义模型。
技术与教学文档 系统部署报告、操作与维护手册、API接口文档、实验指导书(涵盖环境搭建、语音交互、3D物体抓取、多模态推理等)。 降低后续团队成员与学生的学习门槛,实现科研成果的高效传承。
国产化生态认证 方案具备华为昇腾技术认证(基于昇思MindSpore框架完成与昇腾算力互兼容性测试,证书编号:A202411H0282)。 确保技术栈在自主可控国产化计算平台上的安全与顺畅演进。

四、 落地价值:赋能工业、农业与应用型高校实训

本次实施成果的落地,展示了TsingtaoAI在具身智能领域从“算法研发”到“工程交付”的专业能力。该系统架构不仅能够满足该上市公司科研团队的算法验证需求,其模块化的设计更具备极强的场景迁移能力:

  • 工业智能分拣:结合 YOLOv6 与 DeepSeek-Vision 融合算法,快速识别表面复杂、形状各异的电子元件或零件,实现自适应抓取与摆放。

  • 商业与服务场景:示范案例中已实现复杂的“机器人沏茶倒茶”全流程,展现了对柔性物体与液体容器的毫米级轨迹控制与多阶段任务编排。

  • 高校学科建设:方案全面适配自动化、人工智能、计算机科学、机械电子等多个相关专业,支持基于PBL(项目式学习)的“感知-推理-执行-优化”全闭环实训教学。


关于TsingtaoAI

TsingtaoAI志在成为全球领先的具身智能训练基础设施与数据服务提供商。公司专注于破解具身智能规模化落地的“虚实鸿沟”与“数据匮乏”难题,打造基于Sim2Real双向闭环的通用机器人技能仿真基础设施。

核心产品与技术
  • VeyForge 具身数据合成平台:实现从文本、图像或 CAD 秒级生成携带完整 PhysX 物理属性的 Robot-Ready 3D 资产,解决传统仿真“能看不能训”的卡点。

  • 机器人技能仿真学习平台:建立“仿真预训练—真机测试—数据回传—仿真校准”的双向闭环迭代机制,将 Sim2Real 实体迁移成功率提升至 80% 以上,全面适配宇树、智元等四足、人形与轮式机器人。

资质与合作

公司获评国家高新技术企业与北京市“创新型”中小企业,深度融入华为昇腾等国产算力生态,已为华油能源、居家康养及20+所高校等30余家标杆客户提供具身/机器人场景落地服务。获得千万元天使轮融资、长三角算力算法大赛冠军、山东省人社厅数字工程师大赛二等奖、宁波AI大赛二等奖等荣誉或奖项。

以Robot-Ready数据飞轮,赋能物理AI规模化落地。

🌐 官方网站www.tsingtaoai.com

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐