登录社区云,与社区用户共同成长
邀请您加入社区
本文基于视觉语言模型CountGD++,构建交互式AI视觉计数系统,实现开放目标下的自动计数与辅助标注。系统支持文本提示驱动的目标定位与数量预测,可动态适应不同场景,提升密集目标识别精度,并导出结构化标注数据。该技术推动视觉理解从“识别”迈向“感知”,在智能制造、机器人操作与数据构建中具有广泛应用前景。
数据编织让我确认了自己做的事情在行业坐标系里的位置——SOP状态机就是车间里最小号的语义网,散装数据编织成Agent可直接消费的告警语义;数据运河让我看清了大基建和小场景的关系——运河是给大船修的,小厂的活路在码头,而且大基建正在替我们抬高市场的认知水位;具身智能让我看清了对手盘也看清了同行者——Scaling Law、模型母机、场景多样性,三句话背后是同一个事实:具体场景的活儿,永远缺人干;词元
具身智能机械臂手眼标定视觉抓取。听起来只有一句话,真做起来是感知、标定、运动规划、控制执行四座大山。这篇复盘记录我把一台七轴机械臂从"能通电"做到"能稳定抓取桌面物体"的完整过程——重点不讲代码,讲清楚。
mmNorm方法解决毫米波雷达视觉遮挡下3D形状感知问题,通过法向量估计和物理一致性重建,达到高精度。语言简洁,控制字数。</think>毫米波雷达可穿透遮挡物但带宽受限,传统点云法深度误差大。mmNorm提出从镜面回波中估计表面法向量,建立相对符号距离函数生成候选表面,再经回波仿真验证,突破深度分辨率限制。实验显示其中位3D F-score达96%,纸板遮挡下误差仅增0.04cm,为机器人非视距
本数据集专注于基准标记(Fiducial Marker)的视觉检测与识别,服务于机器视觉定位、增强现实及自动化校准。数据涵盖三种标准几何形状的标记图案,适配相机标定、位姿估计及机器人引导等应用。
本数据集专注于珊瑚礁生态系统健康状况的视觉监测,服务于海洋生态保护、气候变化影响评估及珊瑚礁修复工程。数据涵盖四种珊瑚状态,适配水下机器人巡检、珊瑚礁普查及白化事件预警等应用。
我们接下来按这条主线学ROS2只是贯穿其中的一套“机器人软件基础设施”。
本数据集采集了七类常用指令手势,以边界框形式标注手部区域及其对应语义,共包含约1900张高质量标注图像,专为静态手势的检测与分类模型训练、验证与测试设计。手势是人类最自然的非语言交互方式之一。随着智能设备与机器人的普及,基于视觉的手势识别因其无需佩戴额外传感器、成本低、交互自然,成为人机交互的重要技术路径。在车载环境中,手势控制可减少驾驶员视线偏移;在公共设备与医疗场景中,无接触操作可降低交叉感染
Visual-Inertial Odometry,视觉+IMU,根据摄像头看到的环境特征估运动。甚至可以不用先算速度,直接利用支撑脚位置。从里程计参考系看,机器人已经向前移动约2.3m,横向偏了0.1m,朝向转了5°。:实验室里的光学动作捕捉系统可以非常准确地给机器人世界位置。你现在再看“多传感器融合”这句话,应该不再只是一个抽象词了。这条假设就错了,于是 Leg Odometry 也会骗人。:用
🏆 本文收录于 《YOLOv9实战:从入门到深度优化》 专栏。该专栏系统复现并深度梳理全网主流 YOLOv9 改进方法与工程实战案例,覆盖分类、目标检测、实例分割、多目标追踪、关键点检测、旋转目标检测等多个方向,坚持 持续更新 + 深度解析 + 工程验证。
乱七八糟,所以状态同步在高级运控里非常重要。心跳和 Watchdog 经常一起出现。因为每一层需要的反应速度不一样。不需要每毫秒重新规划整条路径。因为相机本身就是几十 FPS。这就是工程和纯理论的巨大区别。还必须保证它不会把机器人弄坏。是底层控制循环最核心的三步。Snapshot,状态快照。永远执行最后一条危险命令。具体行为取决于机器人平台。
YOLO深海探测作业海洋生物目标检测数据集专为深海环境下的目标检测任务设计,结合其名称与类别特征可推断,该数据集主要用于水下机器人、无人潜航器等设备在深海探测过程中对特定海洋生物的识别与跟踪。数据集的应用场景可能包括生态监测、海底资源勘探及深海考古等领域,尤其适用于需要高精度实时检测的自动化系统。通过该数据集训练的模型能够辅助科研人员更高效地分析深海生物分布与行为模式,提升水下作业的智能化水平。
YOLO室内家居与户外自然环境多目标检测数据集是一个面向实际场景的通用目标检测数据集,其名称暗示了该数据集覆盖了室内和户外两种典型环境。从类别名称推测,数据集可能包含如家具、家电、人、车辆、植物、建筑结构等常见对象,适用于智能家庭、安防监控、机器人导航、增强现实等多个领域。该数据集的设计初衷可能是为了支持跨场景的目标检测任务,提升模型在复杂环境下的泛化能力,尤其适合需要同时处理室内与户外图像的应用
医疗影像是YOLO落地价值非常高的垂直领域,但也是对细节要求最苛刻的场景之一。从窗宽窗位的调整、锚框的重新聚类,到小目标检测层的添加、损失函数的优化,再到后处理的先验过滤,每一个细节都在影响最终的临床效果。它考验的不只是算法能力,更是对医疗场景的理解和对细节的把控。不要指望拿通用模型改改输入就能达到临床可用,沉下心把数据处理好、把结构改到位、把训练策略做扎实,一步一步优化,才能真正做出有实用价值的
现在正式进入动力学。
该数据集专为户外垃圾分拣场景设计,适用于智能垃圾分类、环境监测及自动化回收系统等实际应用。从名称和类别可推断,该数据集主要聚焦于城市或公共场所中的垃圾识别与分类任务,涵盖常见的可回收物与不可回收物,如塑料瓶、易拉罐、纸张、果皮、烟头、玻璃瓶和金属制品等。此类数据集可广泛应用于智能垃圾桶、环卫机器人、城市清洁管理平台等场景,为实现高效、精准的垃圾分拣提供数据支持。数据集包含10312张图片,覆盖7种
继续我们之前机器人运动控制学习1——基础概念的学习这三者就是运动学的主线。
基于改进CASCADE_RCNN的机器人目标检测研究
基于改进FPN的RetinaNet建筑工地机器人检测算法
该数据集名称为“YOLO工业实验室机械臂夹爪与底座目标检测数据集”,从名称可推断其主要用于工业自动化场景中的机械臂相关目标识别任务。数据集聚焦于机械臂系统中关键部件的检测,包括夹爪和底座等核心组件,适用于智能制造、机器人视觉引导、自动化装配等工业领域。在实际应用中,该数据集可用于训练模型以实现对机械臂操作过程中的关键部件进行实时定位与识别,从而提升设备运行的精准度与安全性。此外,也可作为工业视觉算
该数据集名称为“YOLO室内训练场橙色环形训练圈目标检测数据集”,从名称可推断其主要用于室内环境中对特定目标进行检测任务。结合“橙色环形训练圈”这一描述,可以推测该数据集可能服务于体育训练、机器人导航或自动化设备测试等场景。在这些应用中,检测系统需要准确识别出一个具有明确颜色和形状特征的目标,以实现定位、追踪或交互功能。此数据集适合用于验证和优化基于YOLO的实时目标检测模型在特定环境下的性能。数
YOLO住宅区街道垃圾桶目标检测数据集聚焦于城市环境中常见的垃圾收集设施,旨在为智能城市管理、环境监控及自动化巡检提供基础数据支持。该数据集适用于需要识别和定位住宅区内垃圾桶位置的场景,如环卫机器人路径规划、智能垃圾分类系统开发以及城市基础设施管理平台构建。通过该数据集,可训练高效的检测模型,提升对复杂环境下垃圾桶的识别准确率与响应速度,具有较强的实用价值。数据集包含708张图像,覆盖多种光照条件
该数据集名称为“YOLO垃圾分类回收站可降解物/纸板/玻璃/金属/纸张/塑料目标检测数据集”,从名称可推断其主要用于垃圾分拣场景中的目标检测任务。数据集覆盖了垃圾回收站中常见的六类物品,适用于智能垃圾分类系统、环保监测设备、自动化回收机器人等实际应用场景。数据集的构建旨在支持基于深度学习的图像识别技术在垃圾分类领域的应用,提升垃圾处理效率与准确性,助力城市可持续发展。数据集包含10230张图片,涵
Axis内部posture_index跨度:约96 Hz↓MocapApi实际Avatar事件:约63 Hz↓MotionInput收到:全部记录↓GMR处理:与收到数量相等↓ZMQ发送:与生成数量相等↓MuJoCo接收:与ZMQ发送数量相等↓MuJoCo应用:与接收数量相等Axis内部姿态索引↓普通BVH/MocapApi Avatar事件进入我们程序之后,数量都能对上。GMRprotobufZ
来源 OXE-AugE: A Large-Scale Robot Augmentation of OXE for Scaling Cross-Embodiment Policy Learning(ICML 2026 Spotlight)作者 Guanhua Ji, Harsha Polavaram, Lawrence Yunliang Chen, Sandeep Bajamahal, Zehan
维特智能 RTK-982 助力四足机器人客户实现巡检场景厘米级定位与精准定向
MocapApi 函数问题核心通常就是:其中最需要警惕的是:事件本身和 Avatar 当前缓存姿态是否一一对应。当前程序大致执行:相关代码:[noitom_client.cpp](C:\\Users\\RX01296\\Desktop\\全身控制8_3\\gmr-master_PN_xsenscpp最终版\\gmr-master_PN\\cpp_noitom_g1\\src\\noitom_cli
GTC 2026 上,黄仁勋提出了“AI 五层蛋糕”应用层 → 智能体、数字孪生、机器人模型层 → LLM、多模态、MoE基础设施层 → DGX、NVL72、网络芯片层 → GPU、CPU (Grace)、DPU、NVSwitch能源层 → 数据中心供电、液冷、选址NVIDIA 正在每一层都拥有话语权。这不是传统的芯片公司定位,而是类似"AI 时代的 AWS + Intel + Windows"的
本文分享了田间杂草检测数据集,适用于YOLO系列深度学习分类检测任务。数据集包含4000张高质量标注图像,涵盖小麦、玉米、水稻等主要作物的田间场景,采用YOLO格式标注。详细介绍了数据集背景、采集过程、标注规范、数据结构及应用场景,包括智能农业机器人、精准农业研究等。该数据集有助于推动AI技术在精准农业领域的应用,为智能除草提供数据支持。
本方案推出协作机器人焊接系统,通过集成化接口模块实现焊接参数智能调控,有效应对焊工短缺问题。标准化焊接节点整合关键功能,兼容主流设备,通过统一界面简化操作流程,使不同水平人员都能高效完成焊接作业,特别适合小批量多样化生产场景。
🏆 本文收录于 《YOLOv26实战:从入门到深度优化》 专栏。该专栏系统复现并梳理全网各类 YOLOv26 改进与实战案例(当前已覆盖分类 / 检测 / 分割 / 追踪 / 关键点 / OBB 检测等方向),坚持持续更新 + 深度解析,质量分长期稳定在 97 分以上,可视为当前市面上 覆盖较全、更新较快、实战导向极强 的 YOLO 改进系列内容之一。
视觉识别技术解析:从基础原理到三大核心任务 视觉识别技术通过分析图像信息实现物体识别与理解,其核心包含三大任务:图像分类(判断物体类别)、目标检测(定位并识别多个物体)和图像分割(精确到像素级别的识别)。这些任务依赖于卷积神经网络(CNN)作为基础架构,通过卷积核提取特征、池化层压缩信息实现逐级抽象。为解决深层网络训练难题,ResNet引入残差连接;YOLO创新性地将检测任务转化为单次回归问题,实
包含:诞生背景、发展历史、深度定制解决的核心问题、与原生 ROS2 系统性对比。
Model Zoo 提供一套标准化模板流水线: 想快速验证硬件 → 下载预编译 bin 直接运行;想部署自己算法 → 复制仓库内 yaml、前后处理、推理代码模板,替换自己的 ONNX 重新编译。
3D感知技术的核心应用方向分析:机器人抓取(机械臂/仓储)最推荐(★★★★★),因其需求明确、精度要求适中且12FPS即可满足;工业检测(★★★★)商业化成熟,无人机视觉(★★★★)依赖实时3D数据;自动驾驶(★★★)因竞争激烈排名靠后。技术落地需平衡实用价值与实施难度,工业场景(分拣/质检)和农业检测(果实/植株)均为典型应用,其中机械臂抓取在价值明确性和技术适配性上表现最优。
表格项目test_resnet18.py(图片分类)本 MIPI-FCOS 检测代码图像来源本地图片 cv2.imreadMIPI CSI hobot_vio ISP 硬件采集格式转换CPU 执行 BGR→NV12ISP 直接输出 NV12,无 CPU 转换任务ImageNet1k 分类FCOS COCO 80 类目标检测模型输出单一路 logits15 路 tensor(cls/reg/cent
在当今人工智能和计算机视觉技术迅速发展的背景下,图像处理和目标检测与跟踪技术正广泛应用于安防监控、自动驾驶、智能家居及医疗影像等多个领域,成为推动现代科技进步的重要驱动力。本次会议旨在为全球的研究人员、工程师、学者及业界专家提供一个展示和讨论这些领域最新进展的平台,以促进相关领域的科学研究与技术创新。会议内容将涵盖从基础研究到实际应用的广泛主题,设有多种形式的互动环节,包括主题演讲、口头报告、海报
2026世界人工智能大会(WAIC2026)在上海落幕,释放三大产业信号:AI从参数比拼转向落地交付,国产算力加速自主可控,智能体与具身智能成为焦点。大会达成203.6亿元意向采购,华为、中科曙光等展示十万卡级算力集群,阶跃星辰、百度等推出智能体产品,智元机器人等实现工业场景落地。但行业仍需警惕估值泡沫、具身智能瓶颈及中美算力差距。AI正从实验室走向实际应用,务实落地成为关键。
本文介绍了一个专为智慧农业设计的黄瓜发育阶段数据集,包含约3700张高质量标注图像,采用YOLO格式标注发育中果实和成熟果实两类目标。数据集覆盖温室大棚等真实种植场景,包含完整发育阶段和多样化环境条件,具有精准标注和标准化组织特点。适用于采摘机器人视觉系统、温室智能巡检、产量预测等应用场景,以及农业计算机视觉、目标检测算法优化等研究方向。数据集已按训练集/验证集/测试集划分,可直接用于模型训练,为
该代码演示GPIO 异步硬件中断,实现两套 LED 独立逻辑并行运行主线程循环:BOARD15 引脚 LED1,每 2 秒自动闪烁,不阻塞;硬件中断回调:BOARD37 按键下降沿触发,自动执行blink函数,BOARD16 引脚 LED2 快速闪烁 5 次;自带软件消抖、Ctrl+C 优雅退出、GPIO 资源自动释放,基于地平线自研Hobot.GPIO库,API 兼容 RPi.GPIO。pyth
本文介绍了一个基于语义的向量检索系统构建方案,整合了TextGen文本处理工具、all-mpnet-base-v2嵌入模型和PostgreSQL的PGVector扩展。系统工作流程包括:通过TextGen预处理文本数据,使用all-mpnet-base-v2模型将文本转换为768维向量,并存储在PostgreSQL数据库中。检索时,用户查询同样被向量化,通过PGVector进行相似度搜索。实现语义
python运行Python 通过ctypes直接调用地平线提供的 C 语言后处理动态库手动对齐 C 结构体,将 BPU 推理输出 tensor 内存地址传递给 C 函数返回 JSON 字符串,包含所有目标框坐标、置信度、类别 ID优势:后处理在 C 中运行,性能远高于纯 Python 解析,避免占用 CPU。
底层系统基准:Ubuntu 22.04;重点关联你遇到的问题。表格RDK X5 第一个正式镜像;基础 VIO/MIPI 采集、BPU 推理、pyeasy_dnn 初代接口、TogetheROS.Bot 基础集成修复 MIPI 相机随机断流、BPU 内存泄漏;优化编码器帧率稳定性;修复 V4L2 控制参数 bug新增多路相机同步采集示例;优化 hbmem 零拷贝 Python 接口;升级模型库 YO
🏆 本文收录于专栏 《YOLOv11实战:从入门到深度优化》。本专栏围绕 YOLOv11 的改进、训练、部署与工程优化 展开,系统梳理并复现当前主流的 YOLOv11 实战案例与优化方案,内容目前已覆盖 分类、检测、分割、追踪、关键点、OBB 检测 等多个方向。
✅ USB 优势: 插上就能识别,直接 OpenCV 开发,不需要移植 sensor 驱动、修改设备树,适合快速验证算法思路。如果你需要:宽动态 HDR、硬件去噪、镜头畸变实时校正、自动曝光硬件调节,USB 相机只能使用摄像头内部简陋 ISP,图像质量上限低。没有 USB 总线调度延迟,适合移动机器人避障、高速工件检测;第三方陌生传感器需要移植驱动,开发周期长。硬件 HDR、降噪、畸变校正、曝光控