登录社区云,与社区用户共同成长
邀请您加入社区
Cosmos-Predict2.5是统一Text2World、Image2World、Video2World的流式视频世界模型,经2亿视频训练并引入强化学习优化,较前代在质量和指令对齐上显著提升。配套Cosmos-Reason1文本编码器增强控制,并通过Cosmos-Transfer2.5支持多模态控制,以及动作条件生成,为机器人仿真提供可靠方案。
26年8月来自Tuojing Intelligence、中科院大学、自动化所、清华大学、深朴智能、哈工大(深圳)、上海交大、浙大、清华AIR研究所和港大的论文“GaussianWAM: Distilling Geometry and Semantics from 3D Gaussian Fields into World-Action Models”。世界-动作模型(WAM)利用视频动态作为表征学
ForceVLA2提出双层级力-位混合控制框架,将力觉主动融入VLA模型。其长时推理通过力提示驱动任务分解,短时闭环利用力信号直接调节动作生成,并设计跨尺度MoE动态选择视觉/状态/力主导模态。
数据质量控制是众包模式能否实现规模化的关键瓶颈,需要在采集协议设计、数据校验流程、异常检测算法等方面投入持续的技术攻关。工程实践中,将Ego数据与遥操作数据做混合训练是一种较为普遍的做法:用遥操数据保证基础精度,用Ego数据扩充规模和多样性,效果优于单一数据源方案。数据竞争的关键不在于采集规模的绝对值,而在于数据质量的稳定性、任务覆盖的完整性,以及迭代闭环的效率。但对于需要反复迭代和大量试错的任务
第二,长线7×24小时连续流式运算下累积漂移无法抑制,开源SLAM依靠回环检测修正漂移,而边海防沿线摄像机点位固定,不存在机器人移动过程中的回环路径,回环机制失效以后误差持续累积,三维地图随时间逐步扭曲失真,这是开源纯视觉SLAM无法落地长线边防最核心的拦路虎;边海防实战迫切需要新一代国产化纯视觉SLAM体系:基于固定摄像机连续视频流,不依赖激光雷达、惯导、地面控制点集群,在野外边缘节点本地完成二
26年8月来自Perception AI公司的论文“Isaac 0.5: Percepts Scale Control”。Isaac 0.5 是一个拥有 360 亿个参数的开放权重具身基础模型,它将视频感知、具身视觉推理和机器人控制统一到一个稀疏骨干网络中。所有输出都来自同一个共享表示:该模型通过一个基于骨干网络状态的专用 Flow 专家,输出语言和接地输出、离散的 FAST 动作token以及连
以海康机器人的MV-CS020-10GM为例,MV是海康工业相机的固定开头,CS代表系列,020表示两百万像素,10代表帧率,G表示千兆网口也就是GIGE接口,M表示黑白相机,如果是C则代表彩色。CS接口的相机如果接C接口的镜头,中间需要加一个五毫米厚的转接环。相机输出的触发信号是开关信号,可以用来控制报警灯、光源或者PLC等外部设备,输出线路的最大输出电流一般有二十五毫安的限制,需要驱动更大电流
<think>我们只需要根据内容生成摘要,不超过150字。需要概括Cosmos 3的核心功能、架构、训练数据、以及Q&A中的关键点。注意简洁。</think>Cosmos 3是NVIDIA推出的全模态世界基础模型,统一文本、图像、视频、音频与动作,支持场景理解、音视频生成、正/逆动力学推演及策略控制,并配套轻量化Edge版本。基于约百万小时视频训练,采用双塔架构与统一时间编码,旨在突破物理AI数据
World Labs Atlas 已经把图像、相机位姿、深度、视频和显式 3D 输出统一到一个空间上下文中,并展示了机器人 Real-to-Sim。工程上,3D Gaussian Splat 通常负责高保真视觉,碰撞网格负责物理接触;要进一步形成机器人训练环境,还需要尺度标定、任务对象资产化、刚体/关节属性、传感器、成功条件、数据采集和评测链路。
26年8月来自人大、星源智(XYZ Embodied AI)、数据工程知识工程重点实验室、数据库商务智能研究中心、深圳高级技术研究中心和清华AIR研究所的论文“JEPA-WAM: Learning Vision-Language-Action Policies with Joint-Embedding World Modeling”。鲁棒的机器人控制受益于对状态转换的显式建模,但视频生成的世界-动
学界把物理放进模型的方式越来越多,物理推理正从加分项变成物理AI 能力的分水岭。谁能让基座模型 物理AI 从更普适的数据里习得物理常识,谁的理解上限就更高——而理解上限,决定泛化的天花板。人类生活的世界天然携带物理常识,模型学到的不是某台机器人的动作,而是物理世界通用的规律。2024年11月,深度机智提出物理AI 人类学习路线,让机器人从人类数据中学习,先理解物理世界的运作规律,再执行具体任务。这
这篇综述是在工业制造场景中“落地”的最佳指南——它告诉你,你的技术栈恰好是工业5.0时代人机协作最需要的关键能力,而你要做的是把技术模块,嵌入到“感知→理解→决策→执行”的HRC技术闭环中。
为什么目标明明识别对了,机器人却还是走偏、抓空甚至撞墙?
第二届智能控制与电气工程国际学术会议(IC-ICEE 2026)将于2026年10月9-11日在中国天津召开会议。大会将聚焦于推动智能控制与电气工程领域的创新与发展,关注如何通过先进技术应对全球能源和自动化挑战。随着智能技术的快速发展,电气工程正朝着更高效、更智能和更可持续的方向演进。本次会议将展示最新的研究和应用,包括智能电网、可再生能源技术、机器人控制、深度学习在自动化中的应用等。
电冷器自动叠片机工作站,通过工业机器人与视觉检测系统的协同作业,实现了两款不同主板与翅片等子零件的自动上料、视觉检测与自动堆叠,覆盖从零件抓取到成品输出的完整作业流程。
【空间计算 & 多源融合感知算法专家(人体姿态/动捕方向)】坐标苏州,3-5年经验。【 端侧智能 / 医疗影像 / 牙科AI算法工程师】坐标深圳/桂林,3年+经验。【具身智能 · 3DGS 高精度定位与重建算法专家】坐标北京,1-3年经验。
mmNorm方法解决毫米波雷达视觉遮挡下3D形状感知问题,通过法向量估计和物理一致性重建,达到高精度。语言简洁,控制字数。</think>毫米波雷达可穿透遮挡物但带宽受限,传统点云法深度误差大。mmNorm提出从镜面回波中估计表面法向量,建立相对符号距离函数生成候选表面,再经回波仿真验证,突破深度分辨率限制。实验显示其中位3D F-score达96%,纸板遮挡下误差仅增0.04cm,为机器人非视距
Toshiba E5876RE-P2K是东芝X射线图像增强器,属多角度探测器备件,用于将X射线转换为可见光并增强信号,兼容多种医疗影像系统。产品多为二手或库存剩余,建议使用前检测。主要应用于医疗X射线成像、设备翻新及维修备件替换,在二手备件市场有一定需求,是设备维护中的关键部件。
其4K视频处理能力、大电流USB设计、工业级硬件规格,使其在工业自动化、数据中心、安防调度、医疗影像等领域具备良好的工程适配性。在数据中心、工业控制、广播电视等场景中,将计算机的键盘、视频和鼠标(KVM)信号延长到远端操作,是一个经典的系统集成需求。数字无延时传输:区别于部分采用IP压缩方案的延长器,UVO-3DU(AS)采用数字基带传输,不引入编码压缩延时,保证实时性要求高的场景(如工业操控、游
26年8月来自人民大学、阿里千问、上海科技大学、北京BIGAI和北航的论文“Ego2Robot: Scalable Robot Data Synthesis from Egocentric Human Data”。学习可泛化的机器人操作策略需要大规模且多样化的演示数据。以人类为中心的操作视频提供丰富的场景和任务多样性,先前的研究表明,将此类视频重定向并渲染成机器人格式的数据可以在小规模下产生有效的
26年8月来自蚂蚁集团Robbyant和港科技大学的论文“Zero-WAM: In-Context World-Action Modeling from Human Videos for Open-Ended Task Generalization”。零样本跨任务泛化,即策略必须执行训练过程中从未见过的操作任务,仍然是机器人学习的核心挑战。在大语言模型中,只需在上下文中指定新任务,即可执行该任务,
本数据集专注于珊瑚礁生态系统健康状况的视觉监测,服务于海洋生态保护、气候变化影响评估及珊瑚礁修复工程。数据涵盖四种珊瑚状态,适配水下机器人巡检、珊瑚礁普查及白化事件预警等应用。
你每天打开手机、刷短视频、用导航、听智能音箱——背后都有人工智能在默默干活。但很多人对人工智能的理解,还停留在"会聊天的机器人"这个层面。今天我们用一篇文章,把支撑现代人工智能的讲清楚。
其中,行为识别主要解决“宠物在做什么”,情绪识别进一步判断“宠物可能处于什么状态”,动作分析模型负责从连续图像或视频中提取行为特征,而情绪模组则是将这些算法能力封装后提供给摄像头、项圈、机器人等产品调用。因此,宠物行为识别和宠物动作分析模型是理解宠物状态的基础,宠物情绪识别则进一步向状态判断延伸,而宠物情绪模组则负责把这些能力真正嵌入智能硬件和软件产品。从技术演进来看,宠物AI正在经历一个明显变化
具身智能已经从概念落地进入算法验证的核心阶段,不同于纯文本大模型训练可以依托公开语料,具身智能要求大模型在物理环境中完成感知、决策、执行全链路闭环,训练过程需要大量高质量的人机交互示教数据支撑,数据质量直接决定了模型的泛化能力和任务落地效果。很多高校科研团队早期会选择自研简易采集设备,但往往会遇到数据格式不统一、同步精度不足、采集流程低效等问题,浪费了大量科研时间。结合当前具身智能研究的实际需求,
随着YOLO向多任务、开放词汇、端到端推理和边缘部署持续演进,实时视觉的竞争焦点已从单帧精度转向完整系统的确定性。本文基于大牛直播SDK(SmartMediaKit),系统分析视频接入、低延迟解码、原始帧输出、YOLO推理、目标跟踪、规则判断、事件录像与平台联动,并结合工业视觉、机器人、无人机、GB28181安防和运营商场景,探讨端边云协同、数据闭环及模型插件化的工程价值。
具身智能绕不开的技术栈,8月最新技术栈~~
本文是「具身智能落地实战」系列的收官篇。序号主题核心内容01硬件全景拆解四大系统、传感器、执行器、计算平台02VLA 模型深度解析视觉-语言-动作大模型、架构、训练、推理03SLAM 技术全解定位与建图、激光/视觉 SLAM、多传感器融合04Sim-to-Real 全链路仿真、域随机化、迁移学习、真实微调05端到端学习 vs 分层架构两种范式对比、混合架构、工程实践06占据栅格网络3D 场景表示、
不依赖预设地图、不依赖静态模型、不依赖外置定位设备,基于纯视觉实时重建的真实物理空间,持续输出可量化的空间计算结果,为越界预警、聚集研判、轨迹追踪、距离测算、区域态势分析提供实时算力支撑,让数字空间从“看得见”升级为“算得准、判得出、预得到”。全面兼容所有行业通用RGB摄像设备,包含固定监控、车载相机、无人机航拍、手持终端、巡检机器人设备,无需硬件改造、无需设备标定、无需新增传感设备,100%利旧
2026 年 8 月,北京的机器人展馆里,最容易被拍到的是动作。机器人走路,搬箱,握手,踢球,跑步。视频里,它们像是已经快要进入生活。展台旁,观众举着手机,投资人看着脚步,客户问交付时间,媒体问什么时候进厂。但如果你去问一家具身智能公司的市场负责人,这个行业最难讲的是什么,答案往往不是“机器人还不够聪明”。产品说还没定型。研发说你们不懂。销售说客户不能公开。老板说要有声量。投资人说要讲空间。客户说
2026 年 8 月,北京亦庄的机器人展馆里,很难再找到一个冷清的展台。人形机器人走路、搬箱、握手、跑步。投资人站在围栏外看动作稳定性,客户问交付周期,媒体问产品什么时候进厂。几天后,第二届世界人形机器人运动会在北京举行,机器人跑步、踢球、格斗、接力。行业用一种更直观的方式证明:具身智能已经不只是论文、demo 和融资故事。但在 WRC 期间的另一场小聚里,讨论的主题不在展台中央。那天晚上,聚深会
8 月的北京,机器人很红。在 2026 世界机器人大会上,人形机器人走路、搬箱子、握手、打招呼。另一边,第二届世界人形机器人运动会也在北京举行,机器人跑步、踢球、格斗、接力。很多人第一次发现,机器人不再只是科幻片里的东西,它们真的开始出现在展馆、赛场和工厂门口。但如果你站在展台旁边多看一会儿,会发现另一件事。观众看到的是机器人“会不会动”。工程师看的是机器人“会不会摔”。客户问的是机器人“能不能买
2026 年 8 月,北京亦庄的机器人展馆里,最容易被拍到的是机器人的身体。它们走路、搬箱、握手、踢球、跑步,有时也停顿、摇晃、摔倒。几天后,第二届世界人形机器人运动会在北京举行,机器人被放进赛道、球场和对抗场景里。这个行业用一种更直观的方式向外界证明:具身智能已经不只是实验室里的论文、视频里的 demo 和融资材料里的想象力。但在 WRC 期间的一场小聚里,我们聊的不是机器人怎么走路,而是一家公
具身智能是一个需要乐观主义者的行业。如果只看今天的失败率、成本、交付难度和场景复杂度,很容易得出悲观结论。但真正重要的技术产业,往往都不是在完美时才开始。新能源汽车早期也被质疑续航、成本、补能和安全;智能手机早期也经历过性能、生态和网络的瓶颈;云计算、AI、大模型也都经历过从概念到基础设施的漫长周期。机器人也会经历这个过程。所以,创始人不该因为产品还不完美就停止讲未来。但也不该因为未来足够大,就忽
2026 年 8 月,北京亦庄的机器人展馆里,最容易被拍到的,仍然是机器人“像人”的部分。它们走路、搬箱、握手、踢球、跑步。几天后,第二届世界人形机器人运动会在北京举行,机器人被放进赛道、球场和对抗场景里。对公众来说,这是一个足够直观的时刻:机器人终于从视频里走出来,进入了展馆、赛场和真实人群。这是具身智能从“技术叙事”走向“产品叙事”的转折。过去两年,人形机器人行业的主线是技术展示:谁的本体更稳
这轮争论的背景,是全行业从"拼融资"转向"比落地"。回看 2026 年 8 月的这一周,具身智能完成了某种成人礼:它有了自己的第一股,有了创纪录的融资,有了能打水漂一样激起全场欢呼的乒乓球对局,也有了上市公司董事长当众泼下的冷水。具身智能的产出是物理世界里的一次抓取、一次行走、一次递杯子——错了,碎的是杯子,磨损的是价值 6000 美元一只的灵巧手。而对站在河对岸的资本来说,8 月的这一周已经足够
🏆 本文收录于 《YOLOv9实战:从入门到深度优化》 专栏。该专栏系统复现并深度梳理全网主流 YOLOv9 改进方法与工程实战案例,覆盖分类、目标检测、实例分割、多目标追踪、关键点检测、旋转目标检测等多个方向,坚持 持续更新 + 深度解析 + 工程验证。
2026 年 AI 热点:多模态大模型让同一模型看懂图片、听懂语音、读懂文字。本文用产品经理阿May的故事讲透三大机制:模态编码、模态对齐、跨模态生成,以及它为何成顶流——手机识屏、智能座舱、具身智能、端侧多模态落地。最后用免费云端 AI 平台 MonkeyCode 体验:内置 GLM/Kimi/MiniMax/Qwen/DeepSeek 多模型一键切换,对比"看图准不准、听音稳不稳",云端沙箱跑
26年6月来自上海交大、东方理工、腾讯、清华和中关村学院的论文“ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?”。世界-动作模型(WAM)通常依赖视频生成来连接视觉世界建模和机器人控制。然而,基于视频的WAM面临三个相互关联的限制:密集的多帧未来标记使得推理成本高昂;完整的视
占据栅格网络是 3D 空间感知的新范式,它让机器人从「平面避障」走向「三维感知」,从「知道哪里有障碍物」走向「知道障碍物的三维形状和语义」。核心要点回顾:演进路径:从 2D 占据栅格(平面、简单)→ 3D 点云(三维、稀疏)→ 占据栅格网络(三维、体素化、有状态),空间表示不断进化核心技术:体素化与占据预测、单目/多目占据预测、多传感器融合、语义占据、时序占据与动态物体处理工程挑战。
抓取姿态估计的目标,是给定一个物体点云或深度图,输出一组可行的抓取位姿。AnyGrasp 将抓取建模为 6 自由度刚体变换,即三维位置加上三维旋转,用 SE(3) 群表示。与平面抓取相比,6 自由度抓取允许夹爪从任意方向接近物体,显著提升了对杂乱堆叠场景的适应能力。具体而言,一个抓取姿态由夹爪中心位置、接近方向和夹爪开合方向共同决定。AnyGrasp 在点级别进行密集预测,即对输入点云中的每个点,
实验室数据与工业产线数据之间的差异,本质上是源域与目标域之间的系统性分布偏移。这种偏移体现在环境复杂度、操作行为特征、数据分布形态、成本结构和质量标准五个维度,无法通过算法层面的优化完全弥补。工业级训练数据的采集必须在目标域(真实工厂)中进行,同时通过自动化的质量管控Pipeline在保留真实噪声的前提下保证数据有效性。Ego+UMI融合采集解决多视角信息获取问题,VLM直出Pipeline解决动
端到端学习和分层架构是机器人控制的两条技术路线,各有优劣,未来将深度融合。核心要点回顾:分层架构:分而治之,模块接力。优势是可解释、安全、成熟、数据需求低;劣势是泛化差、信息损失、开发成本高、长尾覆盖难。适用于结构化工业场景。端到端学习:一个网络,直通到底。优势是泛化强、信息完整、开发简洁、支持自然语言交互;劣势是不可解释、不安全、数据需求大、推理延迟高。适用于非结构化、多样任务场景。融合趋势。
移动机器人导航是机器人学中最基础也最关键的能力之一。无论是仓储物流中的自主搬运车、灾难救援中的探测机器人,还是家庭服务场景中的扫地机器人,都需要在复杂环境中找到一条安全可行的路径到达目标位置。传统的导航方法,如动态窗口法(DWA)和时间弹性带(TEB),虽然在工程实践中被广泛使用,但它们严重依赖预先构建的精确地图,一旦环境发生变化或地图不可用,导航性能就会急剧下降。近年来,深度强化学习(DRL)为
EfficientNet在机器人工程中的应用摘要: EfficientNet系列(B0-B7)凭借复合缩放理论和MBConv模块,成为机器人视觉的高效分类引擎。其优势在于平衡嵌入式算力(如Jetson系列)与分类精度,通过深度/宽度/分辨率协同优化,实现毫秒级实时推理。机器人典型应用包括工业物料分类(B0精度99%+)、服务机器人环境识别(5.3M参数/≤5W功耗)等。部署时需进行INT8量化、剪