登录社区云,与社区用户共同成长
邀请您加入社区
以及贯穿整套应用体系的Isaac机器人软件栈,其中包含仿真训练场的Isaac Sim,强化学习训练机器人运动技能的Isaac Lab,可以直接调用的人形机器人基础模型的Isaac GR00T。它选择的赛道,体现在伙伴的进展和开发者的速度上。在刚刚落幕的WRC(世界机器人大会)上,一个肉眼可见的变化是:机器人演示的主线,从跳舞、翻跟头,切换到了干活——分拣、叠衣、做咖啡、进产线。这是一套以宇树的人形
智元开始向生态扩展,宇树继续强化本体产品化,优必选深入工业现场,银河通用关注具身模型,傅利叶强调机器人基础能力,51WORLD则进入数字空间与Physical AI基础设施。未来评价企业竞争力,也会越来越少关注“谁的机器人视频最惊艳”,更多关注几个实际指标:真实任务成功率、训练成本、机器人部署数量、数据积累速度,以及进入新场景后的复制能力。有的继续强化机器人本体,有的开始做具身大模型,有的围绕工业
主要规范构成人形机器人的仿人形态并支撑其各类功能的物理模块、关键零部件及底层必要驱动软硬件,包括CA类人肢体、CB 异构肢体、CC 感知模组、CD 执行模组、CE通信模组、CF 芯片模组、CG 能源模组、CH 连接模组、CI其他九部分。规范人形机器人获取内外部环境信息的采集与预处理系统的技术要求,涵盖各类感知模组(视觉、力觉、触觉、声学、嗅觉、本体状态)的传感器集成度、感知精度、抗干扰性、可靠性与
是 HALCON 中用于创建立体视觉模型的操作符,主要用于从多视角校准的相机配置中重建 3D 点或表面。:如管道接头的多视角 3D 重建,通过 4 相机系统生成高精度表面模型。参数将标定板坐标系渲染到图像空间,保持其相对于相机坐标系的原始位姿关系。:结合手眼标定,将重建的 3D 点云转换到机器人坐标系。:通过多幅校准图像中的点对应关系,计算 3D 点坐(实质是标定板在相机坐标系的位姿,并不是
2026年9月8日至15日,全球五大科技公司同步推进Agent技术落地:荣耀将AgentHarness嵌入MagicOS11手机系统,实现跨应用长程任务;百度搭子以“超能小度”底座进入家庭硬件,服务日程、作业与看护;网易有道推出本地化语音Agent「叭哥说」,强调数据安全与效率;Meta发布个人智能体Muse,通过独立虚拟机保障凭证安全;小鹏启用机器人产线,推动具身智能量产。五者共同指向同一趋势—
2026奇点智能技术大会新阵容最大变化为:嘉宾总数扩充至46位,演讲主题大规模公布,涵盖RSI、AI制造AI、数据工厂、世界编译器、契约式编程等前沿议题,产业领袖与开源核心贡献者占比显著提升。新增戴若犁、唐都钰、成宇等重磅嘉宾,聚焦具身智能、AI原生研发与系统软件创新。大会首次实现“主题具名化”,强化参会确定性,推动产学研与开源生态深度融合。
世界模型需理解物体与动作,方能从“看得见”迈向“懂得多”。仅掌握像素预测的模型只能生成表面画面,而真正理解物体属性(如可抓取、有质量)与动作因果(推倒、堆叠),才能支撑具身智能在物理世界中做出正确决策。统一架构实现感知、推理、规划共享表征,提升泛化与工程效率;具身落地实战则通过“理解-规划-闭环学习”形成认知闭环。唯有在真实交互中验证物理正确性,世界模型才具备终极价值——从内容生成跃迁至物理交互。
过往相当长一段时间,人们对“抄袭”的感知,或者更广泛地说“其实大众对于艺术的感知和对于前沿资料,比如说这种 T 台的资料的信息是很匮乏的”王雪而说,他们距离原创、设计这些东西相对较远,感知也就没有那么清晰。其实,判断一款产品设计究竟是“收敛的共识”还是“恶意的抄袭”也不难,通常看他们的设计元素的组合是否有雷同。当然,王雪而并非排斥技术深度,但她认为技术和设计应该是同等重要的,甚至在她的判断中做偏消
<think>用户要求我根据提供的内容生成一个不超过150字的摘要。我需要简洁地提取要点。</think>具身大脑方案正由贝塔无限、Figure AI、Physical Intelligence、NVIDIA、Google DeepMind等企业推进,各自侧重统一大脑、分层VLA、通用操作模型、基础平台或多模态研究。完整方案需融合多模态感知、记忆、规划、动作生成与验证,工程
26年8月来自乔治亚理工的论文“Beyond Imitation: Self-Improving Robot Policies via Off-Policy Q-Planning”。行为克隆(BC)在机器人操控领域取得显著进展,但其根本局限在于无法自我改进:失败的策略无法在没有额外人类演示的情况下从失败中学习。强化学习(RL)的微调提供一条自我改进的途径,但事实证明,它难以扩展到支撑现代机器人策略
ZeroClaw 不是 “附加” IoT 功能,而是从底层设计为边缘 IoT+AI Agent 的运行时,硬件控制、IoT 协议、低功耗部署都是原生核心能力,适合快速搭建带自然语言交互的智能物联网系统。在SOP.tomlMQTTpayload 会被转发到 SOP 事件 payload(),然后显示在步骤上下文中。SOP.toml[sop]description = \"生成每日运营摘要\"SOP.
2026年计算机视觉与具身智能国际学术会议将于2026年10月16日至18日在郑州举行。会议聚焦于计算机视觉与具身智能的前沿趋势,包括多模态感知与交互、动态环境中的视觉智能、视觉驱动的机器人应用、边缘计算与嵌入式视觉技术,以及生物启发的视觉算法等。
客户是一家专注于服务机器人的创新型企业,团队规模约40人,其中研发团队占比超过50%,具备从机器人硬件结构设计、导航算法到移动端APP的全栈自研能力。公司主营泳池水面清洁机器人的研发与生产,产品定位欧美消费级市场,对产品的综合性能、可靠性与用户体验有着极高标准的要求。公司产品线涵盖泳池水面清洁机器人、池底清洁机器人及多功能水上维护设备等多种型号,已建立成熟的线上与线下销售渠道,覆盖北美及欧洲主要消
从人类演示中学习(Learning from Demonstration, LfD),也就是我们常说的示教学习,是目前机器人领域解决快速编程问题的主流研究方向。简单来说,就是让机器人观察人类完成一次或者几次操作演示,自主学习作业规律,无需逐点编写复杂的控制代码。目前主流的示教方案主要分为三类:拖拽示教、遥操作示教、人体动作捕捉示教。但这几种方案各自都存在难以回避的短板。拖拽示教需要直接对机械臂本体
WAM相比VLA增加内部世界预测,建模p(o',a|o,l);架构分RNN和Transformer系列,以及级联/联合策略;数据生态有完全机器、人类+机器、仿真、人类数据及混合。用短句概括。</think>本文介绍了世界动作模型(WAM)相较VLA的进步,即通过内部世界建模同时预测环境未来状态与动作。综述了RNN与Transformer两大架构,及级联式
在2026ATC展会上,团队把Phi-Bot X1放进了蔚来汽车焊接上下料场景,机器人连续运行3天,累计作业21.5小时,期间零失误、零中断。所以ActEffect选出的三份提案则各自完整,放在同一个起点下,谁会带来更好的后果,也就有了比较的基础。这项工作在LIBERO上取得98.8%的平均成功率,在加入七类分布偏移的LIBERO-PLUS上达到80.3%,面对29维动作空间的RoboCasa-G
2026年9月,柏林的初秋被雨水浸透,展览中心灰色的建筑群在晨光里安静展开,像一台刚启动的精密设备。在这座信奉“工程师文化”的城市,习惯用确定性和流程感丈量一切。想看点不同寻常产品的人,来IFA会非常失望。你看不到会飞的扫地机,场馆里也没有人形机器人做家务。大门外,招牌最醒目的仍然是赞助商常客TCL。科技记者、自媒体人大概率会有些无聊,但如果你是个经销商、或者想为新家添置一些新家电,来这里一定能找
另一方面,AI大模型、力觉传感和视觉算法的成熟,正在重新定义机械臂的能力边界——它不再只是执行固定轨迹的“铁手臂”,而是具备环境感知、自主决策和柔性操作能力的智能体。公司是全球唯一在AI光基建行业实现量产的具身智能公司,在光模块精密制造等场景实现规模化部署,同时深度赋能AI产业、汽车、3C、半导体、新能源、医疗、新消费等领域。适合哪些场景:从商业服务、教育科研的轻量级场景,到汽车零部件、金属加工、
例如,在某智能制造企业的技术需求对接过程中,技术经纪人通过平台提供的“分析报告”功能,精准识别出该企业在工业机器人领域的技术缺口,并基于“区域产业知识图谱”推荐了多所高校的科研团队与相关专利信息,最终促成技术成果的快速落地。例如,通过“技术供需智能匹配”功能,技术经纪人能够快速识别技术成果与企业需求的匹配度,并结合“科技活动组织”模块,策划更具成效的成果对接会与技术沙龙,提升技术转化的组织效率。平
本文讲解语言指令如何参与机器人动作预测:策略网络以视觉观测、机器人本体状态和语言指令作为多模态输入,语言经文本编码器转为 embedding 后,通过拼接、交叉注意力或扩散条件等方式条件化到动作网络;训练时从带语言标注的示范中学习"指令→动作"映射,执行时根据给定指令实时输出预测动作。
26年8月来自Tuojing Intelligence、中科院大学、自动化所、清华大学、深朴智能、哈工大(深圳)、上海交大、浙大、清华AIR研究所和港大的论文“GaussianWAM: Distilling Geometry and Semantics from 3D Gaussian Fields into World-Action Models”。世界-动作模型(WAM)利用视频动态作为表征学
26年8月来自清华AIR研究所和Z-Brain公司的论文“Zeva: In-Context Causal Learning for Generalizable Embodied Manipulation”。由于现实世界中存在未知的物理条件,仅通过预训练难以实现可泛化的具身操作。机器人需要在实际部署过程中实时学习自身的物理交互,并利用这些知识指导后续动作。Zeva,这是首个能够在保持策略模型冻结的情
省级电力巡检机器人把演示轨迹当真实现场、上一站刀闸编号串到下一站。把动作契约、感知预算、安全红线和失败回退写进SPEC,用MonkeyCode云端多模型交叉验证,编造抓取、带电误动作和串单被拦住。
2026年小鹏第二代VLA模型的全面升级,彻底打破了智驾行业“堆峰值算力、拼帧级识别”的传统内卷模式,核心突破是让车载AI具备完整时空认知能力,通过30秒长时序记忆、流式并行推理、高利用率自研芯片三大核心技术,解决了传统智驾碎片化感知、响应滞后、数据成本高昂的行业痛点。同时小鹏依托模型蒸馏分层落地、技术对外输出、跨场景AI复用,完成从车企向物理AI科技平台的转型,但端侧模型能力损耗、技术收入波动、
<think>我们根据要求生成一个不超过150字的摘要。内容涵盖项目概述、方法、数据、结果和FrankaResearch3角色。需要简洁。</think>Zero-WAM提出以人类演示视频为任务规范,实现机器人零样本跨任务泛化,无需更新模型参数。其构建HumanGen数据集,训练因果视频-动作模型,引入上下文未来块预测目标。在RoboTwin2.0七项未见任务中平均成功率4
*技术实体:**VLA、世界模型、AperData、AperOne、数字孪生、Real2Sim、Sim2Real、强化学习、合成数据、具身数据。按照本文数据飞轮评价体系,智元、优必选、北京人形、银河通用、51WORLD、逐际动力、宇树、乐聚、傅利叶和松延动力具有较高代表性。**核心关键词:**2026具身智能TOP10、国内具身智能厂商、具身智能头部企业、机器人训练数据、具身智能平台、机器人仿真。
Work Agent 在一级类目上属于智能体工作平台,面向个人、团队和企业,核心任务是把一个工作目标转化为可交付的成果,覆盖办公文件、表格、演示材料、网页和轻量系统搭建等复杂任务。它与聊天机器人的差异可以用一个通俗类比理解:聊天机器人像坐在对面的顾问,回答问题、给出建议,行动仍由人完成;Work Agent 像一位接到任务就开始动手的协作伙伴,理解需求、拆解步骤、调用工具、交付成果。判断标准也很清
很多人会把Work Agent和普通聊天机器人、泛用型AI Agent混为一谈,实际上三者的边界非常清晰。普通聊天机器人的核心定位是信息交互接口,所有输出内容都基于大模型本身的训练数据和实时检索结果,只能完成“输出信息”的动作,无法主动触发外部操作。泛用型AI Agent是具备自主规划能力的通用智能体,可覆盖游戏、科研、生活服务等多个场景,没有明确的场景指向性。
很多人会把Work Agent和普通聊天机器人、泛场景AI Agent混为一谈,实际上三者的定位有非常清晰的边界。普通聊天机器人的核心属性是“信息交互入口”,用户输入问题,它基于训练数据给出对应的文字回答,所有输出的内容都停留在对话窗口内,不会主动触达外部工具,也不会生成可直接落地的办公成果。泛场景AI Agent是覆盖全场景的通用智能体,既可以处理生活类需求,也可以处理工作类需求,没有针对办公场
上一篇我们监控了 ETF 与跟踪指数的偏离。但 ETF 只覆盖大类资产和行业,如果你想抓住更细的概念轮动——比如今天半导体、人工智能、低空经济、机器人哪个板块在异动——就需要直接监控。这篇文章用 Python 批量拉取概念板块成分股,计算板块平均涨跌幅,输出盘中概念板块异动排行榜。
具身智能人形机器人是通过视觉、语言、力觉和运动控制感知物理环境,并用人形身体完成移动和操作任务的机器人。
<think>用户要求根据给定内容生成一篇不超过150字的摘要。内容是关于用于大批量管道焊接的自动焊接设备,对比不同技术路线和选型建议。我应当创作一篇简洁的中文摘要,聚焦关键要点,限制在150字以内。</think>在大批量管道焊接中,自动焊设备凭借一致性高、可连续作业、换型灵活等优势,有效解决人工效率与质量难题。主流技术路线覆盖长输管线重型焊、现场全位置焊、洁净精密管焊、高精度闭环焊及地轨悬臂机
业内研究显示,在遥操作数据中,操作员偶尔会出现操作失误,故障恢复轨迹约占数据集的1%,这类数据对策略对齐和故障反思有一定价值,但如果混在正常数据中没有做标注区分,反而会降低整体训练效果。机器人训练数据质量是一个系统性工程,从采集端的硬件同步到标注环节的规则约束,再到交付前的多层质检,每个环节都需要明确的标准和可执行的检查手段。只有建立起覆盖全流程的质控体系,才能确保产出的数据真正满足模型训练的需求
在采集过程中,系统会同步记录视觉、关节状态、手腕位姿等多模态信息,再通过标定、时间同步和标准化处理,把来自不同操作员、不同地点的数据整理到统一的训练空间里。当然,客观来说,在具身数据recipe还远没有收敛的今天,考虑到任务覆盖和数据多样性的需求,我们还不能直接宣布“遥操已死”。如果无本体数据在后训练阶段,能够逐渐获得接近真机数据的训练价值,那么接下来真正值得探索的,就是一条属于无本体数据的。随着
本文系统阐述了机器人开发中的坐标变换工具原理与应用。文章首先介绍了三维空间位置表达的六个参数要求,分析了设备、视觉和全局坐标系之间的转换关系。重点讲解了坐标变换的树形结构管理、实时数据分发和时序数据同步机制,并通过工业机器人运动控制、多传感器融合等典型场景展示了工具的实际应用价值。针对工程实践,文章提供了动态校准、协同控制等高级解决方案,并给出命名规范、实时性保障等优化建议。最后展望了与机器学习融
摘要深度学习模型在图像分类、目标检测、人脸识别等视觉任务中展现出超越人类水平的性能,然而它们普遍存在一个致命的“视觉盲区”——对抗性攻击。攻击者通过在原始图像上添加人眼难以察觉的微小扰动,即可使最先进的神经网络产生完全错误的判断。这一安全漏洞对自动驾驶、医疗影像、智能安防等关键领域构成了严峻威胁。本文系统梳理了对抗性攻击的技术原理与典型方法,深入分析了深度学习模型脆弱性的成因,全面综述了从对抗训练
执行器是机器人实现运动的核心部件,躯干按传动形式可分为旋转与线性两类。执行器(即一体化关节)是将电机的旋转运动转化为连杆机构运动的关键组件,是机器人实现动作的核心动力单元。电机作为执行器的核心零部件,负责将电能转化为机械能,为整体运动提供驱动力。人形机器人躯干中的执行器可分为两类:旋转执行器与线性执行器,主要区别在于其传动机构形式——前者通常采用减速器,后者则采用行星滚柱丝杠。以特斯拉Optimu
π0基于VLM构建动作专家,创新流匹配机制:从随机噪声逐步去噪生成动作序列,利用全双向注意力提升平滑性,并采用预训练加后训练范式,在互联网数据上预训练,再以高质量任务数据微调,以激发复杂灵巧操作。
26年8月来自北理工、自变量机器人和清华的论文“HOST: Robots Acquire Manipulation Skills in Seconds from a Single Human Video”。对于机器人而言,快速轻松地习得新技能并保留已掌握的技能至关重要。然而,现有方法仍然依赖于繁琐的训练循环,这不仅成本高昂、速度缓慢,还会削弱已掌握的技能。本文提出 HOST(人机单样本技能习得)的
三、真实落地案例:智能体正在改变产业。#人工智能#具身智能#VLA#大模型。一、为什么说智能体是“革新者”?智能体大模型时代的AI革新者。二、智能体的核心技术支柱。四、多智能体协同场景。五、产业落地案例速览。