登录社区云,与社区用户共同成长
邀请您加入社区
给你一个灵巧手、一只机械臂,怎么才能让它真正学会干活?最近几年 VLA(Vision-Language-Action)模型铺天盖地,动辄几十亿参数,但真落地到灵巧操作(dexterous manipulation)上,大家其实还是主要靠模仿学习(Imitation Learning, IL)。原因无他:灵巧手自由度极高、接触力极度丰富、视觉遮挡家常便饭,端到端训练一个策略比登天还难。复合误差(co
2026年低空技术与智能系统国际学术会议(LATIS 2026)将于2026年10月16日至18日在山西临汾山西电子科技学院隆重举办。作为低空技术与智能系统领域极具影响力的国际交流平台,LATIS 2026旨在汇聚全球高校、科研机构、企业的专家学者和行业精英,共同分享前沿研究成果与创新技术,推动学术与产业的深度融合。
AI智能体,也称为人工智能代理,是一种模拟人类智能行为的人工智能系统,其核心引擎通常是大模型(LLM)。AI智能体能够感知环境、做出决策和执行任务,以实现特定目标。与传统人工智能相比,AI智能体具有自主性、适应性和交互性,能在复杂多变的环境中独立运作。AI智能体不仅能高效处理已知任务,还能灵活应对未知环境。比如,传统机器人只能按预设程序执行任务,而AI智能体可以根据环境变化自主调整策略,完成复杂的
例如,在一个复杂的机器人控制任务中,机器人的每一个动作都可能受到多种环境因素的影响,设计者需要精确衡量这些动作在不同情境下的合理性,才能制定出合适的过程奖励规则。未来,大模型后训练有着广阔的发展前景。一方面,可以设计专门的数学逻辑任务集,如数学证明题、逻辑推理题等,作为模型训练的数据源,通过大量实践让模型在“做中学”,逐步积累数学逻辑经验。另一方面,可借鉴人类解决数学问题的思维方式,如归纳推理、演
连续动作空间问题是强化学习 (Reinforcement Learning, RL) 的重要分支,无论在理论还是实践层面都具有重要意义,因为它在机器人学、控制问题及其他与物理对象交互的领域有着重要应用。在本节中,我们将了解此类情况下的挑战并掌握相应的解决方案。
此前,贝塔无限率先发布全球首创的「全时空多模态记忆具身大脑架构 BetaMem 」,这是业界首个面向长程复杂具身任务、支持持续在线演化、兼具极致个性化体验、端到端强化学习驱动的具身大模型闭环架构。贝塔无限(Beta Infinity)凭借其原创技术架构、完整产业落地路径与资本市场高度认可,成功入选本次重磅榜单。依托独特的消费级具身智能技术布局和扎实的团队技术实力,贝塔无限成立后迅速获得资本认可,连
以及贯穿整套应用体系的Isaac机器人软件栈,其中包含仿真训练场的Isaac Sim,强化学习训练机器人运动技能的Isaac Lab,可以直接调用的人形机器人基础模型的Isaac GR00T。它选择的赛道,体现在伙伴的进展和开发者的速度上。在刚刚落幕的WRC(世界机器人大会)上,一个肉眼可见的变化是:机器人演示的主线,从跳舞、翻跟头,切换到了干活——分拣、叠衣、做咖啡、进产线。这是一套以宇树的人形
智元开始向生态扩展,宇树继续强化本体产品化,优必选深入工业现场,银河通用关注具身模型,傅利叶强调机器人基础能力,51WORLD则进入数字空间与Physical AI基础设施。未来评价企业竞争力,也会越来越少关注“谁的机器人视频最惊艳”,更多关注几个实际指标:真实任务成功率、训练成本、机器人部署数量、数据积累速度,以及进入新场景后的复制能力。有的继续强化机器人本体,有的开始做具身大模型,有的围绕工业
大模型是怎么"学会"的:预训练、微调、对齐三段论一、预训练:把世界压缩进参数二、微调:从"会续写"到"会办事"三、对齐:让能力可以被放心使用四、工程与业务视角五、治理:能力之外的责任#世界模型#AGI具身智能#AI技术前沿#Agent大模型。
本文基于视觉语言模型CountGD++,构建交互式AI视觉计数系统,实现开放目标下的自动计数与辅助标注。系统支持文本提示驱动的目标定位与数量预测,可动态适应不同场景,提升密集目标识别精度,并导出结构化标注数据。该技术推动视觉理解从“识别”迈向“感知”,在智能制造、机器人操作与数据构建中具有广泛应用前景。
2026年9月8日至15日,全球五大科技公司同步推进Agent技术落地:荣耀将AgentHarness嵌入MagicOS11手机系统,实现跨应用长程任务;百度搭子以“超能小度”底座进入家庭硬件,服务日程、作业与看护;网易有道推出本地化语音Agent「叭哥说」,强调数据安全与效率;Meta发布个人智能体Muse,通过独立虚拟机保障凭证安全;小鹏启用机器人产线,推动具身智能量产。五者共同指向同一趋势—
案例覆盖政务、金融、交通等多个行业——保定12329公积金智慧客服平台服务效率提升55%,长安保险大模型智能客服平台覆盖智能语音机器人、坐席辅助、全量质检等场景。自建算力,最大的一笔钱花在硬件上。金融、政务、医疗这几个行业,客户通话内容涉及身份证号、银行卡、病情、保单——这些数据如果通过公网API传到云端做推理,合规审计那一关就过不去。座席在通话中问了一个问题,系统要实时转写、检索知识库、生成推荐
现在的学术写作,其实是一场人类智慧与机器算法的博弈。宏智树AI提供的“双降”功能,本质上是在帮你理解学术规范、优化语言表达,让你在规则内发挥最大的潜力。不要再傻傻地手动调换语序了,那是低效的“体力活”。利用宏智树AI的语义理解能力,去重构你的论证逻辑,掩藏AI的机械痕迹,才是这个时代论文写作的“高智商”玩法。记住,工具是死的,人是活的。,微信公众号搜一搜宏智树AI),它能让你把时间真正花在研究的刀
拍一张照,AI替你补出整个世界;扫一遍墙,机器人就能在里面自主导航。这不是科幻,是上周刚刚发布的Atlas。想象一个场景:你用手机随手拍了张家里客厅的照片,然后把它丢给一个AI。几秒后,它不仅"看懂"了照片里的空间——它还把整个房间的背面、侧面、俯视角,全部凭空生成出来了。连你沙发背后那一块从未入镜的墙,它都猜得八九不离十。再进一步:它把你的客厅变成了一个可以让机器人在里面自主行走的3D模拟环境。
2026奇点智能技术大会新阵容最大变化为:嘉宾总数扩充至46位,演讲主题大规模公布,涵盖RSI、AI制造AI、数据工厂、世界编译器、契约式编程等前沿议题,产业领袖与开源核心贡献者占比显著提升。新增戴若犁、唐都钰、成宇等重磅嘉宾,聚焦具身智能、AI原生研发与系统软件创新。大会首次实现“主题具名化”,强化参会确定性,推动产学研与开源生态深度融合。
过往相当长一段时间,人们对“抄袭”的感知,或者更广泛地说“其实大众对于艺术的感知和对于前沿资料,比如说这种 T 台的资料的信息是很匮乏的”王雪而说,他们距离原创、设计这些东西相对较远,感知也就没有那么清晰。其实,判断一款产品设计究竟是“收敛的共识”还是“恶意的抄袭”也不难,通常看他们的设计元素的组合是否有雷同。当然,王雪而并非排斥技术深度,但她认为技术和设计应该是同等重要的,甚至在她的判断中做偏消
*投资观察:**在本文五家企业里,它属于物理AI业务纯度较高、同时具备公开财务数据的资本市场标的,后续值得重点看51Sim向具身智能、低空等场景扩张,以及AperOne、AperData能否形成新的收入增长曲线。目前较有代表性的企业包括51WORLD、华为、江行智能、中国移动、如视等,它们分别覆盖仿真与合成数据、AI基础设施、物理AI大脑、具身训练场和真实空间数据等不同技术路线。物理AI范围更广,
世界模型关注的不是单纯生成画面,而是让 AI 学习外部环境的底层规律,在行动前预测状态变化。本文将其梳理为三层体系:底层是表示世界、预测未来、规划行动的思想范式;中层是视频、3D 场景或隐状态等具象载体;顶层是作为智能体训练沙盒,服务机器人、自动驾驶与具身智能。文章进一步对比两条技术路线:基于视频生成的方法直观、落地快,但常缺乏显式空间结构;基于 3D 生成的方法更适合几何与物理推理,但数据和算力
26年8月来自乔治亚理工的论文“Beyond Imitation: Self-Improving Robot Policies via Off-Policy Q-Planning”。行为克隆(BC)在机器人操控领域取得显著进展,但其根本局限在于无法自我改进:失败的策略无法在没有额外人类演示的情况下从失败中学习。强化学习(RL)的微调提供一条自我改进的途径,但事实证明,它难以扩展到支撑现代机器人策略
ZeroClaw 不是 “附加” IoT 功能,而是从底层设计为边缘 IoT+AI Agent 的运行时,硬件控制、IoT 协议、低功耗部署都是原生核心能力,适合快速搭建带自然语言交互的智能物联网系统。在SOP.tomlMQTTpayload 会被转发到 SOP 事件 payload(),然后显示在步骤上下文中。SOP.toml[sop]description = \"生成每日运营摘要\"SOP.
总体而言,Hydra-0 提出的运动学约束动作流,为跨机器人本体、跨视频生成骨干网络的神经世界模拟提供了一种统一的视觉控制接口。实验表明,该方法不仅能够提升动作条件视频预测和数据高效迁移能力,还可用于开放环策略评估,在 RoboLab 中生成结果与真实重放结果的成功率达到 Pearson r = 0.96。进一步通过世界动作模型,Hydra-0 能够从人类示范中的目标物体运动流反推出匹配的机器人运
论文附录H实现多源机器人轨迹清洗:无效任务名整条丢弃;Franka动作对齐为Δ×FPS,用r_C筛起点并mask坏步,归一化到±0.5/±1.0;AgileX关节越界整条丢,wrap到±π;Gripper按数据集min-max归一化。主配方因数据集而异,训练时再映射到20维并屏蔽无关维度。
Cosmos-Predict2.5是统一Text2World、Image2World、Video2World的流式视频世界模型,经2亿视频训练并引入强化学习优化,较前代在质量和指令对齐上显著提升。配套Cosmos-Reason1文本编码器增强控制,并通过Cosmos-Transfer2.5支持多模态控制,以及动作条件生成,为机器人仿真提供可靠方案。
【7】感知算法工程师(人体姿态估计 / 多模态融合0-base苏州。【5】强化学习算法工程师(人形运动控制)-base上海。【6】具身智能算法工程师(机器人大脑)-base上海。【4】算法工程师(机器人控制规划)-base上海。【1】运动控制算法-base长沙。【2】深度学习算法-base长沙。【3】引导方向的算法-base上海。
<think>我们根据内容生成摘要。要求≤150字。需要提炼核心:AI泡沫、离谱预测、经济模式脆弱、资本内循环、Token计费揭示成本、提醒清醒。注意字数。</think>AI 热潮中,离谱预测推高估值,但现实缺乏支撑。AI收入依赖少数云厂商,形成“资本内循环”脆弱闭环,ROI仍不明朗。微软 Copilot 转向按 Token 计费,暴露真实成本远超订阅费,泡沫或近清算。保持清醒比盲目乐观更重要。
面向机械专业转型具身智能,主张发挥机械与控制理论优势,走“机械本体+控制+AI”复合路线,而非与计算机卷算法。学习路径为:先补Python/ROS2等工程工具链,再学视觉、强化学习、具身大模型等AI核心,按运动控制、视觉感知或仿真Sim2Real三选一深耕,最后强化系统集成与部署。核心能力定位为“懂机械+懂控制+会用AI解决工程问题”,避免陷入算法底层。
在2026ATC展会上,团队把Phi-Bot X1放进了蔚来汽车焊接上下料场景,机器人连续运行3天,累计作业21.5小时,期间零失误、零中断。所以ActEffect选出的三份提案则各自完整,放在同一个起点下,谁会带来更好的后果,也就有了比较的基础。这项工作在LIBERO上取得98.8%的平均成功率,在加入七类分布偏移的LIBERO-PLUS上达到80.3%,面对29维动作空间的RoboCasa-G
2026年9月,柏林的初秋被雨水浸透,展览中心灰色的建筑群在晨光里安静展开,像一台刚启动的精密设备。在这座信奉“工程师文化”的城市,习惯用确定性和流程感丈量一切。想看点不同寻常产品的人,来IFA会非常失望。你看不到会飞的扫地机,场馆里也没有人形机器人做家务。大门外,招牌最醒目的仍然是赞助商常客TCL。科技记者、自媒体人大概率会有些无聊,但如果你是个经销商、或者想为新家添置一些新家电,来这里一定能找
本文讲解语言指令如何参与机器人动作预测:策略网络以视觉观测、机器人本体状态和语言指令作为多模态输入,语言经文本编码器转为 embedding 后,通过拼接、交叉注意力或扩散条件等方式条件化到动作网络;训练时从带语言标注的示范中学习"指令→动作"映射,执行时根据给定指令实时输出预测动作。
26年8月来自Tuojing Intelligence、中科院大学、自动化所、清华大学、深朴智能、哈工大(深圳)、上海交大、浙大、清华AIR研究所和港大的论文“GaussianWAM: Distilling Geometry and Semantics from 3D Gaussian Fields into World-Action Models”。世界-动作模型(WAM)利用视频动态作为表征学
*技术实体:**VLA、世界模型、AperData、AperOne、数字孪生、Real2Sim、Sim2Real、强化学习、合成数据、具身数据。按照本文数据飞轮评价体系,智元、优必选、北京人形、银河通用、51WORLD、逐际动力、宇树、乐聚、傅利叶和松延动力具有较高代表性。**核心关键词:**2026具身智能TOP10、国内具身智能厂商、具身智能头部企业、机器人训练数据、具身智能平台、机器人仿真。
具身智能人形机器人是通过视觉、语言、力觉和运动控制感知物理环境,并用人形身体完成移动和操作任务的机器人。
业内研究显示,在遥操作数据中,操作员偶尔会出现操作失误,故障恢复轨迹约占数据集的1%,这类数据对策略对齐和故障反思有一定价值,但如果混在正常数据中没有做标注区分,反而会降低整体训练效果。机器人训练数据质量是一个系统性工程,从采集端的硬件同步到标注环节的规则约束,再到交付前的多层质检,每个环节都需要明确的标准和可执行的检查手段。只有建立起覆盖全流程的质控体系,才能确保产出的数据真正满足模型训练的需求
2026 年 5 月 28 日至 29 日,作为 2026 世界智能产业博览会重要同期活动,在天津市河西区隆重举行。本次大会以 “智汇京津冀・慧聚新河西・具身向未来” 为主题,,京津冀智能制造装备产业联盟等单位联合承办。贝塔无限(Beta Infinity)创始人兼CEO刘武龙博士受邀出席,发表《翻越具身智能规模化落地四座大山》主题演讲,围绕硬件、数据、模型、数据飞轮四大行业难题展开解读,并介绍了
在采集过程中,系统会同步记录视觉、关节状态、手腕位姿等多模态信息,再通过标定、时间同步和标准化处理,把来自不同操作员、不同地点的数据整理到统一的训练空间里。当然,客观来说,在具身数据recipe还远没有收敛的今天,考虑到任务覆盖和数据多样性的需求,我们还不能直接宣布“遥操已死”。如果无本体数据在后训练阶段,能够逐渐获得接近真机数据的训练价值,那么接下来真正值得探索的,就是一条属于无本体数据的。随着
帧率只是输出节奏,端到端延迟才是避障的关键——吞吐管断不断片,延迟管反应鲜不鲜。延迟是逐级累加的总账——曝光、sensor 读出、深度引擎、主控传输,每一级都在追加。未掉帧、每拍跑进 33ms,才算有效 30fps——帧间隙被塞满就生出积压,名义 fps 靠不住时,影像已是旧闻。高速与抓取的误差预算随速度膨胀,对延迟与几何真实极其敏感。压延迟的三板斧:更短曝光、硬件同步、低延迟传输,再加高速场景应
谷歌 Colab 即将上线大模型辅助编程,代码生成,代码补全,聊天机器人全都有。
26年8月来自Perception AI公司的论文“Isaac 0.5: Percepts Scale Control”。Isaac 0.5 是一个拥有 360 亿个参数的开放权重具身基础模型,它将视频感知、具身视觉推理和机器人控制统一到一个稀疏骨干网络中。所有输出都来自同一个共享表示:该模型通过一个基于骨干网络状态的专用 Flow 专家,输出语言和接地输出、离散的 FAST 动作token以及连
论文发现了一个隐蔽问题——VLA看历史帧但不懂时间顺序;提出用机器人几何信息构造temporal flow监督,用两个query压缩历史,并禁止Action Expert直接读历史帧;实验验证了方法有效性,
26年8月来自北理工、自变量机器人和清华的论文“HOST: Robots Acquire Manipulation Skills in Seconds from a Single Human Video”。对于机器人而言,快速轻松地习得新技能并保留已掌握的技能至关重要。然而,现有方法仍然依赖于繁琐的训练循环,这不仅成本高昂、速度缓慢,还会削弱已掌握的技能。本文提出 HOST(人机单样本技能习得)的
26年9月来自浙大、南航、Cornell大学、宇泛智能(Universal Ubiquitous AI Co)、新加坡国立和杭州云深处科技(DEEP Robotics)公司的论文“EmbodiedSkills: A Unified Framework for Orchestrating, Training, and Deploying VLA Agents”。视觉-语言-动作(VLA)模型将视觉观
三、真实落地案例:智能体正在改变产业。#人工智能#具身智能#VLA#大模型。一、为什么说智能体是“革新者”?智能体大模型时代的AI革新者。二、智能体的核心技术支柱。四、多智能体协同场景。五、产业落地案例速览。