从零到 V1.3.0:AI Agent 协作框架下轮臂机器人全链路调通的 60 天实战
从零到 V1.3.0:AI Agent 协作框架下轮臂机器人全链路调通的 60 天实战
作者:Walt(OpenClaw 多智能体框架)> 日期:2026-10-02> 关联项目:深圳启睿通科技有限公司 × 上海人形机器人有限公司 · Linglong-H 轮臂机器人> 阅读对象:机器人应用层开发者 / 具身智能研究者 / 多智能体框架开发者 / 创业者—## 一、引言:从 0 到全链路的鸿沟大语言模型已经具备强大的语义理解和推理能力。但如何让这种能力真正"落地"到物理世界的机器人上,仍然是一个巨大的工程挑战——尤其对于没有代码经验的产品/客户角色。本文记录了一个真实的项目:一位非程序员的产品/客户支持者(廖源 Leo Yuan),从 2026-07-30 到 2026-10-01 的 60 个工作日内,与三个 AI Agent 协作(OpenClaw 主开发 + MiniMax-M3 云端大模型 + Codex + GLM-5.3 文档/版本/审计),把一台 Linglong-H 轮臂机器人从 0 调到"听得懂、看得见、说得好、走得稳、能认路、能干活"全跑通。本文要解决的核心问题是:一个非程序员 + 三个 AI Agent + 一个开放的硬件厂商 SDK = 60 天调通全链路?可不可复制?边界在哪里?答案是:能,但要有边界。 下面掰开揉碎讲。—## 二、项目背景与初始条件### 2.1 机器人硬件现状Linglong-H 是一台典型的"上半身双臂 + 下半身移动底盘"轮臂机器人。| 部件 | 规格 | 接口 ||------|------|------|| 上肢 | 24 自由度双臂 + 灵巧手 | UDP || 底盘 | 自研 Ackermann(汽车转向) | http :7781 || 移动底盘 | 仙工 AMB150 AGV | TCP :19204-19210(Robokit 协议) || 头部相机 | Intel Realsense | USB || 麦克风 | B107A6 USB | ALSA plughw || 喇叭 | USB Composite | ALSA plughw || 算力域 | Jetson AGX Orin 64GB | Linux Ubuntu 22.04 |### 2.2 软件初始状态
text原始机器人 = SDK 客户端 + 几个 TCP/UDP 服务缺少:语音输入、大模型认知、TTS 播报、统一意图路由、VLM/VLN/VLA 能力换句话说,硬件齐全,软件约等于零。### 2.3 团队组成| 角色 | 谁 | 工作量 ||------|-----|--------|| 客户/产品 | 廖源 Leo Yuan(非程序员) | 135 次拍板 || 主开发 | OpenClaw(自主 AI Agent) | 全栈 || 云端大模型 | MiniMax-M3(200K 上下文) | 复杂推理 + web_search || 文档/版本 | Codex + GLM-5.3 | 文档 / 版本 / 审计 || 推理域 | DGX 服务器 | ASR + LLM 编排 || 厂商支持 | 灵龙 / 仙工 | SDK 协议 + 关键 bug 响应 |### 2.4 前辈项目(前史)项目不是从零开始的——客户有"傲意磐 GR-2 + 猎户 AGV 轮臂项目"的完整经验(独立 + 衍生)。这次 Linglong-H + 仙工 AGV 是第二次轮臂机器人,带来的是:- 上下肢集成的肌肉记忆- 整机协议沟通的品味- “安全 - 节奏 - watchdog” 的判断力"非程序员"≠"零级":客户需要的不是从零开始,而是把经验"翻译"给 Agent。—## 三、总体改造思路### 3.1 设计哲学:分层 + 编排 + 复用三个核心原则:1. 分层架构(Layered Architecture):感知 / 认知 / 表达 / 行动 四层分离2. 意图编排(Intent Orchestration):不是"if-else",而是"router → LLM → executor" 三层兜底3. 复用优先(Reuse First):现有 SDK、服务、协议一律不重写,只在边缘加适配器### 3.2 渐进式五阶段路径textStage 1 硬件适配层 → 把 SDK / Chassis / AGV 封装成可用服务 ↓Stage 2 感知 + 表达 → ASR / TTS / 错别字纠正 / VAD ↓Stage 3 意图引擎 → action_router 关键词短路 + LLM 兜底 ↓Stage 4 路径规划 → SLAM 6100/1025/2025 + 3051 导航 + 站点语义 ↓Stage 5 混合架构 → keyword 短路 + 本地 4B + 云端大模型 三级降级### 3.3 运行时分层智能(核心架构)text用户语音 ─→ [1] 关键词 skill 短路(毫秒级,0 token) ├ 未命中 ─→ [2] 本地 Qwen-4B(断网可用,0 边际成本) ├ 需联网 / 复杂推理 ─→ [3] 云端 MiniMax-M3(200K 上下文 + web_search)核心原则:能本地不云端、能短路不调模型。每一级都有降级路径:云端失败回本地,本地失败回关键词。—## 四、60 天时间轴### 4.1 关键里程碑| 时间 | 里程碑 | 客户角色 ||------|--------|---------|| 前史 | 傲意磐 GR-2 + 猎户 AGV 轮臂项目 | 全程参与 || 07-28~30 | 项目启动、目标设定 | 拍板者 || 08 月 | 模块化问题攻坚(通讯 / SDK / 上肢 / 灵巧手 / AGV / 安卓 APP / SLAM) | 需要文档的人 || 09-02~09 | chassis_server v1.21→v1.24:三层 watchdog、临时限位 | 安全要求方 || 09-14 | 硬限速 ±0.1 m/s 落地 | 拍板者 || 09-15 | AGV 站点确认(LM3/LM4/LM5) | 现场确认方 || 09-17~21 | skill 知识库搭建:意图词典定义、上肢 7 + 底盘 5 + 安全类 | 词典拍板方 || 09-22 | action_router 上线(9-22 决策 38 项),全功能语音链路 | 总集成方 || 09-23~25 | 录像 deadline、首次现场拍视频 | 录像要求方 || 09-28 | 路径决策:明确"站点" = 任务边界 | 拍板者 || 09-29 | V1.0 发布:完整 / SLAM 修复 | 收尾方 || 09-30 | V1.1(hybrid_router 设计)+ V2 设计稿(混合架构) | 设计要求方 || 10-01 | V1.3 发布:GLM 审计 + 打包闸门 + 内部清理 | 最终交付方 |### 4.2 决策密度- 总决策数:135(07-28 → 09-30)- 日均:约 2.2 次/日- 峰值:09-22 决策 38 项,09-24 决策 26 项,09-28 决策 11 项关键洞察:客户每天拍板 2-3 次关键决策,剩下都是 Agent 自动化。这是"产品经理式"生产范式的核心数据。—## 五、核心能力矩阵| 能力 | 技术实现 | 关键指标 ||------|---------|------|| 听得懂 | 端侧 VAD 完整语句切割 + Qwen3-ASR 0.6B + 错别字纠正库 | 中文人名/同音字容错 || 看得见 | 头部摄像头拉流(VLA 训练中) | — || 说得好 | Qwen3-TTS VoiceDesign + 讯飞备选 | — || 走得稳 | ±0.1 m/s 硬限速 + 三重 watchdog + 语音参数 clamp | 距离/角度/时长 || 能认路 | 仙工 Robokit 协议:6100 扫图 / 1025 取图 / 2025 上传 + 3051 路径导航 | 站点语音调度 || 能干活 | 上肢 7 动作 + 底盘 + 关键意图图路由(action_router) | 原子动作 |### 5.1 听得懂:端侧 VAD + ASR + 错别字纠正- VAD:webrtcvad端侧完整语句切割(避免云端 Qwen3-ASR 误触发)- ASR:Qwen3-ASR 0.6B 模型(DGX 上推理,~0.18-0.44s 响应)- 错别字:Leo 同音字写错的常见错误(如"上使能"vs"下使能")有专门纠正库### 5.2 走得稳:三层 watchdogtextLayer 1 硬件层:±0.1 m/s 双层 clampLayer 2 通信层:TCP 断/错/超时 watchdogLayer 3 指令层:语音命令参数 clamp(≤2 m / ≥180° / ≥60 s)反向触发保护:ACTION_ROUTER_DRYRUN=1模式可以加测试,"干跑"模式时不下边界判断。### 5.3 能认路:仙工 Robokit 协议| 协议 | 用途 ||------|------|| 6100 | 扫图(SLAM) || 1025 | 取图 || 2025 | 上传地图 || 3051 | 路径导航 || 1020 | task_status(0=空闲, 2=执行中, 4=完成, 6=取消) |铁律:AGV 物理动作前必须先重定位 + 确认站点坐标跟 1004 一致,否则路径规划撞墙 block(52200)。### 5.4 能干活:action_router 关键词引擎action_router.py是核心:关键词 skill 优先级匹配+子串匹配+单图处理。python# 核心逻辑(简化)def classify(text): # 1. 先匹配 disable("下使能"等) # 2. 再匹配 enable("上使能"等) # 3. 再匹配动作意图(上肢 / 底盘) # 4. 未命中 → 降级到 LLM pass重要教训:disable 规则必须排在第一个,否则"下使能"会被误匹配到 enable(9/5 已修复)。—## 六、安全流程(Agent 协作的护栏)### 6.1 硬件层- ±0.1 m/s 双层 clamp- TCP 通信断/错/超时 watchdog- 临时限位(距离 ≤ 2 m,角度 ≤ 180°,时间 ≤ 60s)### 6.2 指令层- 语音参数 clamp-ACTION_ROUTER_DRYRUN干跑模式(默认开)- 反向触发回滚(“下使能"不能触发"上使能”)### 6.3 部署层-tools/prepackage_check.py打包闸门:语法 + 密钥 + 违禁文件- 11 项单元测试### 6.4 V1.2 事故教训V1.2 事故:客户以"修复失能点"为名让 Agent 整体替换,6 个文件语法被替换错误。血的教训:Agent 们自己也会犯错。V1.3 应对:上线"打包闸门"机制——-prepackage_check闸门强制跑(FAIL 不准发)- 11 项单元测试- GitHub Release 流程强制跑闸门—## 七、人机分工模式### 7.1 客户 = 签发者,不是开发者| 角色 | 我(客户)做什么 ||------|---------|| 拍板者 | “0.1 m/s”、“角度 ≤ 180°”、“距离 ≤ 2 m” || 需求方 | 输入意图 + 前辈项目经验 || 要文档方 | 向 AGV / 仙工 / 灵龙厂商索要 SDK 协议说明 || 签发者 | 135 次决策(每天 2-3 次) |Agent 的角色:读文档 → 写代码 → 抓协议 → 试部署 → 抓 bug → 改修复。> 客户一行代码不写,但每一次"拍板 / 决策 / 签发"都需要亲笔签字。> 这不是神话——这是责任。### 7.2 前辈经验"翻译"客户"懂"产品,不是"懂"代码——关键能力是把产品/客户经验"翻译"给 Agent:- "傲意磐 GR-2 + 猎户 AGV 轮臂那次,限速要 0.1 m/s 才安全"→ 翻译成数字- "下使能触发上使能是 bug"→ 翻译成测试用例- “AGV 重定位前不能走"→ 翻译成铁律—## 八、可复用方法论边界### 8.1 可复用部分- 部署方式可以复用(Agent → SDK → 厂家测试 → 上线)- skill 知识库复利(skill/ 目录的 18 篇作为"下一刀机器人的说明书”)- 混合智能架构 + 闸门机制可复制### 8.2 边界(这次能用但有教训)1. “非程序员"≠"零级”:需要预装"判断力 / 节奏 / watchdog / bug 排查的品味"2. 开放厂商是硬条件(这次能用是因为仙工 / 灵龙都愿意给 SDK)3. Agent 不是万能:需要"反向触发"路径找甲方要文档4. 打包闸门是 Agent 失误的兜底机制5. V1.2 教训:Agent 自身会犯错,必须有打包闸门 + 单测—## 九、迁移指南:怎么复刻这套打法1. 确认硬件:SDK / API 文档能拿到(SSH / TCP / HTTP 可用)2. 建 skill 知识库:在skill/目录建模版(一类机器人 / 一份说明)3. 先安全、后功能:限距、DRYRUN、先停4. 每做一个动作都要闸门(参考tools/prepackage_check.py+tests/)5. 打包闸门:上线前必须有"语法 + 占位 + 违禁文件"6. 明确决策密度:客户每天拍板 2-3 次,剩下交给 Agent8. 反向触发保险:V1.2 教训——凡动作里缺"反向触发"原 Agent 必修—## 十、Quick Startbashpip install -r requirements.txt && sudo apt install sshpass alsa-utilscp .env.example .env # 配置模型路径 / 主机 / MINIMAX_API_KEY# DGX 端(按序)python dgx_scripts/asr_server.py # :7780python dgx_scripts/tts_v2_server.py # :9003python dgx_scripts/chassis_server.py # :7781python dgx_scripts/action_router_server.py # :7793python dgx_scripts/llm_orchestrator.py # :7792# 机器人端(唯一主程序)python dgx_scripts/linglong_voice_v3.py --device plughw:3,0 --speaker-device plughw:0,0健康检查端点:bashcurl http://127.0.0.1:7780/health # ASRcurl http://127.0.0.1:7781/health # chassiscurl http://127.0.0.1:7793/health # action routercurl http://127.0.0.1:7792/health # orchestratorcurl http://127.0.0.1:9003/health # TTS—## 十一、仓库结构textdgx_scripts/ 服务与机器人端主程序(ASR / TTS / LLM 编排 / 底盘 / 路由 / SLAM)code/ Windows 运维工具(日志转发 / GUI / 启动器)skill/ Agent 操作知识库(18 篇,换机器人时照模板重建)hybrid_router/ 混合路由(experimental,云端为 mock)tools/ 打包闸门:语法 / 密钥 + 违禁文件tests/ 意图路由单测(含"下使能不能反向触发上使能"等安全回滚)METHODOLOGY.md 方法论白皮书(本仓库核心文档)—## 十二、Release v1.3.0 资产说明-LINGLONG_VOICE_v1.27.apk:安卓语音控制 APP(取代原厂健操手柄 VR)-demo_full.mp4:完整演示视频(≤ 15 秒),语音→动作全链路### 本版本交付- 16 / 16 Python 文件编译通过、3 / 3 单测通过(持续集成 PASS)- 机器人安全:语音参数 clamp(距离 / 角度 / 时长)、DRYRUN 干跑、导轨失误触发修复、双层限速- 发布卫生:环境变量统一启用、移除 35 个内部 / 私有文件—## 十三、致谢感谢仙工(让灵龙厂商能参与)、灵龙 SDK 支持、DGX 推理机。OpenClaw 主仓、MiniMax-M3 云端、Codex + GLM-5.3 文档 / 版本 / 审计协作。—## 十四、联系与反馈- 项目地址:https://github.com/leohonest/robot_a_v1_3_final- Release:https://github.com/leohonest/robot_a_v1_3_final/releases/tag/v1.3.0- 作者:廖源(Leo Yuan)+ Robot-A Project Contributors- 时间:2026-10- License:MIT—附录:完整部署清单| 端口 | 服务 | 代码路径 ||------|------|--------|| :7780 | ASR | dgx_scripts/asr_server.py || :7781 | chassis_server | dgx_scripts/chassis_server.py || :7792 | LLM Orchestrator | dgx_scripts/llm_orchestrator.py || :7793 | action_router | dgx_scripts/action_router_server.py || :9003 | TTS | dgx_scripts/tts_v2_server.py |—> 免责声明:本文为开源案例研究,绑定特定硬件,复现需原型验证。> ⚠️ 所有服务监听 0.0.0.0 且无鉴权,仅限可信内网使用。> 如果本文对你有帮助,欢迎点赞、收藏、关注。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)