登录社区云,与社区用户共同成长
邀请您加入社区
本文分享用于具身智能、自动驾驶及车内监控等场景的视频数据集,涵盖驾驶员疲劳、分心、吸烟等行为,适用于人类行为识别、视频理解与多模态模型训练。部分数据已公开,可通过Hugging Face下载,支持定制化数据生成,欢迎联系chan@vwu.ai获取更多需求支持。
数据分析师的终极价值,从来不是扮演一个冷冰冰的“报错机器人”,而是做一名理性的商业领航员。当真实数据与领导直觉发生碰撞时,往往正是企业战略出现盲区的关键时刻。学会用严密的统计切片去印证直觉的局部、揭示全局的落差,你才能把一次充满危机的挑战,转化为赢得管理层深度信任的绝佳契机。
在工业安防监控、智能巡检机器人以及车载行车记录仪中,目标检测(如 YOLO 系列模型)通常配置为固定的输入分辨率(例如 $640 \times 640$ 像素)。当视频画面中仅有静态空旷的背景,或者仅需检测近处的大型车辆时,系统依然在每一帧上无差别地执行数以百亿次的庞大卷积运算,造成了严重的电能浪费与设备发热。而在需要精准捕捉远端百米之外微小行人或工业仪表细小刻度时,$640 \times 640
近两年随着大模型与小型舵机驱动技术的发展,各种形态的"AI 桌面陪伴机器人"如雨后春笋般涌现。厂商宣传片里通常展示着极度可爱的外表:圆滚滚的机身、灵动的电子墨水大眼睛、跟着音乐节奏摇头晃脑、号称是"数字时代的桌面宠物伴侣"。但买回来放在办公桌上两周后,很多产品就会迅速沦为昂贵的"塑料摆件":机械动作噪音刺耳、对话逻辑千篇一律、除了逢年过节机械性地说两句吉祥话,根本无法融入开发者的真实工作流,甚至在
随着智能体(Autonomous Agent)架构从简单的无状态对话向具备持续演进能力的“具身智能”演进,记忆机制(Memory System)成为了智能体保持个性、积累经验与完成长周期复杂任务的核心基石。通常,Agent 的记忆系统由两部分构成:短期记忆(基于当前会话滑动窗口与摘要缓冲区)和长期记忆(基于向量数据库与关系数据库的持久化检索存储)。。
在探索 AI 辅助代码审查(Code Review)时,很多团队搭建的 CI 流程往往止步于“在 PR 评论区贴一段建议代码”。这种体验对于开发者来说依然存在不小的摩擦:开发者在网页上看到了机器人的建议,必须在本地打开编辑器、找到对应的文件和行号、把代码手动复制粘贴进去、运行git add和git commit、最后再git push。如果一次 PR 产生了 5 处细微修复建议,这种机械操作会让人
本文基于视觉语言模型CountGD++,构建交互式AI视觉计数系统,实现开放目标下的自动计数与辅助标注。系统支持文本提示驱动的目标定位与数量预测,可动态适应不同场景,提升密集目标识别精度,并导出结构化标注数据。该技术推动视觉理解从“识别”迈向“感知”,在智能制造、机器人操作与数据构建中具有广泛应用前景。
宇树科技发布世界-动作大模型UnifoLM-X2-1.0,人形机器人实现无遥控全自主搏击。本文拆解"瞬时规划"技术原理、世界模型如何赋予机器人预测能力,以及搏击演示背后的产业信号——机器人正从实验室走向真实场景。
在互联网 C 端消费级产品中,最经典的北极星指标(North Star Metric)通常是日活跃用户数(DAU)、月活跃用户数(MAU)或用户单日使用时长。产品经理的全部工作重心,就是通过各种消息红点推送、趣味运营活动、签到领积分等机制,把用户尽可能长时间地留在屏幕前。盲目追踪 DAU 会导致团队去开发大量诸如“社区互动”、“个性化头像装扮”、“闲聊机器人”等对企业客户毫无商业价值的鸡肋功能。在
检索增强生成(RAG)架构通过在推理时外挂专属知识库,有效缓解了大语言模型的幻觉问题,并在企业问答、客服机器人和研发知识库中广泛落地。然而,随着外部知识库成为决策输入的核心来源,知识库投毒(Knowledge Base Poisoning)正成为企业级大模型应用最致命的威胁之一。
李飞飞团队发布新一代多模态世界模型Atlas:用"新视角预测"取代"预测下一个Token",从零训练打通视频生成、3D重建与时空模拟。两段手机视频即可搭建机器人仿真训练场,AI正从"看懂世界"迈向"理解空间",空间智能或成下一代AI主战场。
26年8月来自Tuojing Intelligence、中科院大学、自动化所、清华大学、深朴智能、哈工大(深圳)、上海交大、浙大、清华AIR研究所和港大的论文“GaussianWAM: Distilling Geometry and Semantics from 3D Gaussian Fields into World-Action Models”。世界-动作模型(WAM)利用视频动态作为表征学
26年8月来自清华AIR研究所和Z-Brain公司的论文“Zeva: In-Context Causal Learning for Generalizable Embodied Manipulation”。由于现实世界中存在未知的物理条件,仅通过预训练难以实现可泛化的具身操作。机器人需要在实际部署过程中实时学习自身的物理交互,并利用这些知识指导后续动作。Zeva,这是首个能够在保持策略模型冻结的情
26年8月来自Perception AI公司的论文“Isaac 0.5: Percepts Scale Control”。Isaac 0.5 是一个拥有 360 亿个参数的开放权重具身基础模型,它将视频感知、具身视觉推理和机器人控制统一到一个稀疏骨干网络中。所有输出都来自同一个共享表示:该模型通过一个基于骨干网络状态的专用 Flow 专家,输出语言和接地输出、离散的 FAST 动作token以及连
26年8月来自北理工、自变量机器人和清华的论文“HOST: Robots Acquire Manipulation Skills in Seconds from a Single Human Video”。对于机器人而言,快速轻松地习得新技能并保留已掌握的技能至关重要。然而,现有方法仍然依赖于繁琐的训练循环,这不仅成本高昂、速度缓慢,还会削弱已掌握的技能。本文提出 HOST(人机单样本技能习得)的
26年9月来自浙大、南航、Cornell大学、宇泛智能(Universal Ubiquitous AI Co)、新加坡国立和杭州云深处科技(DEEP Robotics)公司的论文“EmbodiedSkills: A Unified Framework for Orchestrating, Training, and Deploying VLA Agents”。视觉-语言-动作(VLA)模型将视觉观
在开源社区治理中,Stale Bot(休眠 Issue 自动清理机器人)是一个极具争议的存在。配置不当的 Stale Bot 常常会激怒社区贡献者:用户认认真真提了一个包含完整复现堆栈的重大 Bug,维护者因为忙碌三周没有回复,机器人突然跳出来留下一句冰冷的“由于长时间没有活动,此 Issue 即将被关闭”,并在 7 天后无情锁帖。这种行为被社区广泛批评为“维护者为了粉饰 Issue 解决率数据而
在数仓的元数据字典里,标准字段名叫如果大模型的后端仅仅依赖静态的 DDL 字段名做精确匹配,或者指望在 Prompt 里把几百个业务黑话全部罗列出来,系统在遇到业务提问时就会频频触发意图解析失败,或者把“出单金额”错误地映射成了“有效支付订单金额(Net Pay)”。构建一套,是让 ChatBI 从“机械死板的问答机器人”进化为“懂业务行话的老分析师”的核心关键。
26年7月来自Sunday Robotics的博客文章“ACT-2 Preview: Generalizing Reliability:The final step towards fully autonomous home robot deployment“:https://www.sunday.ai/blog/act-2-preview 。
26年7月来自Sunday Robotics的博客文章“ACT-2 Preview: Generalizing Reliability:The final step towards fully autonomous home robot deployment“:https://www.sunday.ai/blog/act-2-preview 。
随着大模型能力从文本对话逐步走向实体行动,具身智能已经成为人工智能领域重要的研究方向。机器人基础模型、世界模型、多模态对齐、强化学习等研究,正在打通实验室理论与真实产业场景之间的壁垒。面向该交叉领域的学术交流需求,二轮征稿现已启动。会议由湖南信息学院、湖南科技大学主办,沈阳航空航天大学、浙江海洋大学海天智能物联网实验室、佛山市人工智能学会协办,将于 2026 年 10 月 23 日‑25 日于长沙
本文深入浅出地介绍了Agent的价值与运作机制,强调Agent的核心在于将目标转化为可验证的行动,而非简单的聊天机器人。文章详细解析了Agent的构成要素,包括模型推理、运行框架Harness、工具调用、状态与上下文管理、工作流与护栏控制,以及评估和监控等关键模块。同时,探讨了Agent与Workflow的区别、Agent Loop的运行原理、状态管理、上下文工程、检索与事实 grounding、
26年8月来自人大、星源智(XYZ Embodied AI)、数据工程知识工程重点实验室、数据库商务智能研究中心、深圳高级技术研究中心和清华AIR研究所的论文“JEPA-WAM: Learning Vision-Language-Action Policies with Joint-Embedding World Modeling”。鲁棒的机器人控制受益于对状态转换的显式建模,但视频生成的世界-动
随着开源项目或企业核心微服务单体仓库(Monorepo)的规模扩大,维护者往往会陷入无尽的“工单分拣(Triage)”泥潭中。每天涌入的大量 Issue 和 Pull Request(PR)如果依赖 Maintainer 手动打标签、判断所属子模块、并手动 @ 对应的模块负责人,不仅响应滞后,还会消耗核心研发人员大量的精力。构建一套,是开源项目迈向标准化运作和高效自治的关键一步。
从优必选到宇树:具身智能AI合规全景解析与申报攻略(附各地补贴汇总
前几章构建的 Agent 与世界的交互是轮流的:用户说完一句,Agent 想一段、调用几个工具,再回一句;在它思考的这段时间里,世界被默认为静止的。这个前提如此自然,以至于很少被当成一个假设写出来。然而真实环境不会等模型作出反应:邮件在思考时到达,用户在说话途中插话,页面在两次截图之间已经变了样。本文围绕模态和触发时机两个维度,对 Agent 交互架构的扩展进行技术分析,涵盖异步事件驱动、语音交互
为什么别人的 AI 测试是"聊天机器人",我们的 AI 测试是"流水线"?差别在流程设计。这篇文章把我们半年沉淀的 8 阶段 AI 测试流程完整拆给你看。
EgoVerse构建了1362小时、近8万段、覆盖1965项任务的双分部人类第一人称示教数据集,配合EgoDB系统与轻量采集管线,形成可持续演进的“活数据”生态。跨实验室、三机器人平台验证表明:人类数据可稳定提升机器人策略;数据对齐是规模化收益的前提;演示者与场景多样性分工不同;行为一致性影响迁移效率。
AI大模型应用开发工程师连接技术与用户,将大模型能力转化为实用产品。职责包括需求拆解、技术选型、开发对接、测试优化及持续迭代。薪资最高可达60k/月,市场认可度高,职业前景广阔。</think>AI大模型应用开发工程师连接技术与用户,将大模型能力转化为实用产品。职责包括需求拆解、技术选型、开发对接、测试优化及持续迭代。薪资最高可达60k/月,市场认可度高,职业前景广阔。
26年8月来自人民大学、阿里千问、上海科技大学、北京BIGAI和北航的论文“Ego2Robot: Scalable Robot Data Synthesis from Egocentric Human Data”。学习可泛化的机器人操作策略需要大规模且多样化的演示数据。以人类为中心的操作视频提供丰富的场景和任务多样性,先前的研究表明,将此类视频重定向并渲染成机器人格式的数据可以在小规模下产生有效的
26年8月来自蚂蚁集团Robbyant和港科技大学的论文“Zero-WAM: In-Context World-Action Modeling from Human Videos for Open-Ended Task Generalization”。零样本跨任务泛化,即策略必须执行训练过程中从未见过的操作任务,仍然是机器人学习的核心挑战。在大语言模型中,只需在上下文中指定新任务,即可执行该任务,
26年7月来自英伟达、斯坦福和德州奥斯丁分校的论文“RoboTTT: Context Scaling for Robot Policies”。现有的机器人基础模型通常使用单步或短历史的视觉运动上下文。本文提出一种名为“测试时训练机器人策略”(RoboTTT)的机器人模型和训练方法,它将视觉运动上下文扩展到8K时间步,比现有最佳策略高出三个数量级,且不会增加推理延迟。在这种上下文长度下,解锁机器人的
26年6月来自乔治亚理工和清华的论文“EgoEngine: From Egocentric Human Videos to High-Fidelity Dexterous Robot Demonstrations”。灵巧操作受限于大规模机器人演示数据采集的成本。以人类视角拍摄的视频提供了丰富的操作行为数据,但直接将其用于机器人学习需要弥合两个差距:人类和机器人观察结果之间的视觉差距,以及人类运动和
26年8月来自dyna公司的博客“Dyna-2: A 1-Million-Hour Scaling Law for World-Action Models”:https://www.dyna.co/dyna-2。一个基于超过 100 万小时人类视频预训练的世界动作模型展示适用于人类和机器人评估的规模化规律,以及其背后的许多技术见解。
具身智能绕不开的技术栈,8月最新技术栈~~
26年8月Generalist AI发布GEN 1.5 “embodied foundation models as one-shot learner”: https://generalistai.com/blog/gen-1.5。人类拥有惊人的能力,仅凭一个或几个例子就能掌握新的物理技能。最新的机器人基础模型 GEN-1.5 也展现出这种能力的雏形:它无需梯度更新或微调,仅凭一个例子就能在几秒钟
如果把一个普通聊天机器人直接搬进心理健康教育场景,它很快会暴露出四个问题:第一,模型可能把一般情绪描述说成疾病;第二,模型可能编造并不存在的求助资源;第三,遇到高风险表达时,普通对话逻辑可能仍然继续生成;第四,日志、会话和画像如果没有最小化原则,会把高度敏感的信息当作普通业务数据长期保存。因此,本文从一个可运行的 Python 项目出发,把系统拆成“风险先行、知识约束、结构化生成、输出过滤、人工升
本地部署 聊天机器人
想象一下,你偶然发现了一份电影剧本,里面描述了一个人与他们的 AI 助手之间的对话场景。不过,剧本上 AI 的回应部分被撕掉了。现在,假设你有一台神奇的机器,它可以读取任何文本并预测下一个合理的单词。这样,你就可以利用这台机器来补全剧本–先输入已有的文本,让机器预测 AI 该如何回复的第一个词,然后不断重复这个过程,逐步生成完整的对话。这其实就是聊天机器人背后的原理。
MCP 协议 指的是 模型上下文协议 (Model Context Protocol)。 以下是关于 MCP 协议的一些关键信息:定义: MCP 是由 Anthropic 提出的一个开放标准,旨在标准化人工智能应用程序(如聊天机器人、IDE 助手或自定义代理)与外部工具、数据源和系统之间的连接方式。你可以将其理解为 AI 集成的 USB 接口。
本地部署的最大意义在于利用DeepSeek大模型的能力加上自己的知识库,可以训练出一个符合自己需求的大模型。想象下如果你是一个医生,有一堆科研资料。你想拥有一个大模型机器人,学习了你所有的资料。每当你想查科研资料找到答案的时候,自己问这个机器人就好了。省去了自己很多查找资料的时间
这是一篇教你如何开发基于 Graph RAG 的聊天机器人的快速指南,展示了如何通过 Langchain、Graph RAG 和 GPT-4o-mini 创建一个完全本地化运行的聊天机器人,为您的企业或个人使用而打造一个强大的聊天机器人。
本文主要从Why、What、How的角度,拆解目前主流的大模型应用开发框架LangChain,之后给到一个带RAG能力的聊天机器人(Chatbot)项目,来感受下LangChain在大模型应用开发方面的实战效果。
自2017年推出以来,Transformer已迅速成为在各种自然语言处理任务上实现最先进结果的主导架构。Transformers 已经被用来编写真实的新闻故事,改进谷歌搜索查询,甚至创造出讲笑话的聊天机器人。在本指南中,作者Lewis Tunstall、Leandro von Werra和Thomas Wolf(拥抱Transformers 的创始人之一)使用亲身实践的方法来教你Transform