基于小语言模型与边缘计算增强虚拟智能体:思考与记忆机制探索评测
基于小语言模型与边缘计算增强虚拟智能体:思考与记忆机制探索评测
arXiv:2608.13420v1
摘要
具身虚拟智能体需要在元宇宙、扩展现实等复杂虚拟环境中实现持久运行、自适应交互与环境感知,但在工程落地层面存在巨大技术与架构挑战。本文围绕认知具身智能体架构(CEAA) 展开研究,该框架专门用于落地感知、记忆、推理、规划、具身动作全套智能体组件。
结合当下边缘计算与轻量小语言模型(SLM)技术进展,本文聚焦CEAA两大核心模块:思考(Think)、记忆(Memory),验证SLM在边缘硬件上驱动两套核心认知流程的可行性。
基于NVIDIA Jetson Orin NX边缘设备搭建虚拟智能体边缘网关,采用不同参数量的Qwen2.5系列小模型完成全套对照仿真实验,从服务路由精度、记忆读写效果、推理延迟三大维度量化评测。
实验证明,SLM可在边缘硬件上局部运行,部分实现CEAA认知流程,支撑沉浸式虚拟世界中高实时、具备上下文感知的具身智能体交互开发。
关键词:具身智能体;虚拟智能体;小语言模型SLM;智能体记忆;智能体调度;边缘计算
1 研究背景与相关基础
1.1 虚拟具身智能体
XR、元宇宙技术革新了人机交互模式,用户可通过数字化身、数字孪生与虚拟空间、其他用户实时交互,虚拟智能体作为虚拟环境内可控智能实体,承担引导、教学、社交交互、训练辅助等功能,要求具备持久在线、动态自适应、实时响应三大特性。
现有虚拟智能体普遍依赖脚本、有限状态机、传统游戏符号AI,仅能完成预设行为;面对动态用户输入时自适应能力不足,视觉上实现“具身”,但认知交互能力存在明显短板。
智能体的完整智能能力包含感知、记忆、对话、规划、多模态行为输出,经典理论框架包括BDI、SOAR,近年大语言模型开始用于智能体认知层。
具身特性直接影响用户沉浸感与参与度,智能体评测维度包含任务完成率、对话流畅度、记忆召回准确率、推理延迟、错误率、鲁棒性等;当前核心痛点:感知/记忆/推理/动作实时融合、可靠上下文记忆、幻觉抑制、交互安全、用户隐私保护。
1.2 虚拟智能体的记忆与持久化机制
认知科学将记忆分为工作记忆(实时短时推理)与长时记忆(跨会话持久存储);面向LLM智能体的MIRIX记忆体系进一步细化6类专用记忆:
- 核心记忆:智能本体、用户长期固定信息;
- 情景记忆:带时间戳交互事件;
- 语义记忆:概念、实体、关系知识库;
- 过程记忆:任务流程、操作步骤;
- 资源记忆:文档、音视频等媒体文件;
- 安全知识库:账号、地址等敏感隐私数据。
完整记忆链路包含编码、存储、检索、复用四大环节,支撑跨会话身份、偏好、任务状态持久;现有生成式智能体虽可模拟社交行为,但长期时序推理、因果一致性、多会话记忆召回存在显著缺陷,虚拟场景下需要高可靠结构化记忆系统。
1.3 小语言模型(SLM)与边缘智能体AI
SLM为亿级至三十亿参数量轻量化Transformer模型,相比大LLM具备算力、显存、功耗、延迟四大优势,适配边缘硬件,可完成:意图识别、请求分类、服务路由、信息抽取、摘要、结构化输出、记忆读写判断等任务。
在虚拟智能体系统中,SLM不局限于对话生成,可作为轻量化认知调度中枢:解析用户输入、判定是否读写记忆、分发不同后端服务(3D生成、语音、纹理、代码、对话)。
局限:深度多步推理、长时序规划、海量事实储备、复杂抽象能力弱;开放模糊请求处理稳定性不足,复杂创意生成、多模态理解仍依赖大模型。
边缘智能体AI定义:推理、记忆、决策、工具调用在用户侧本地硬件完成,不上云。优势:交互低延迟、隐私本地留存、弱网可用;典型架构:本地SLM+向量/结构化记忆+工具调用网关+云兜底降级。
通过函数调用,SLM可输出标准化API指令,调度异构专用服务,无需单模型承载全部计算逻辑,是元宇宙轻量化智能体核心技术路线。
1.4 CEAA认知具身智能体架构
CEAA是一套面向实时3D虚拟世界、工程可落地的模块化智能体架构,弥补传统高层认知框架难以嵌入游戏引擎、底层符号AI缺少完整认知链路的缺陷,分为三层模块化结构:
- 用户与环境层:完整虚拟世界,包含用户、化身、虚拟物体、全局系统事件,记录全部交互状态;
- 知识层:黑板式共享知识库,统一存储环境事件、状态变更,供智能体全局读取;
- 智能体层:全部认知与行为核心组件,包含感知、记忆、思考、推理、规划、行为映射、具身执行模块。
核心两大模块:
- Memory记忆模块:存储情景、语义、用户偏好、历史行为,支撑跨会话自适应;
- Think思考模块:全局认知调度中枢,整合记忆信息,协调推理器、规划器,串联感知、决策、动作全链路。
本文核心目标:基于边缘SLM落地、评测CEAA的Think、Memory两大核心流程。
2 实验方法
本文基于自研SLM智能体调度网关,在边缘硬件上局部实现CEAA思考、记忆流程,搭建Unity虚拟化身交互测试环境,采用Qwen2.5 0.5B/1.5B/3B三款量化小模型做对照实验,从服务路由、结构化记忆读写两大任务量化模型精度与延迟权衡关系。
实验核心逻辑:SLM作为智能体认知大脑,接收用户自然语言输入,完成意图分类、服务路由分发、记忆存取判定;路由实验模拟10类虚拟世界通用后端服务,记忆实验模拟完整多轮事实写入-召回交互流程。
2.1 实验硬件与系统完整配置

实验平台基础
- 虚拟环境测试床:InterwovenXR(Unity引擎),支持虚拟博物馆、数字孪生、游戏开发等具身智能场景;
- 边缘计算硬件:NVIDIA Jetson Orin NX 8GB(资源受限边缘标准设备);
- 客户端:Unity引擎负责用户输入、虚拟化身渲染,轻量化不承载大模型推理;
- 边缘网关:独立部署,处理SLM推理、记忆管理、服务分发,客户端仅HTTP交互。
模型与推理配置
- 模型:Qwen2.5-Instruct 0.5B / 1.5B / 3B,GGUF Q4_K_M量化;
- 推理后端:llama.cpp本地部署;
- 上下文窗口:4096 token;
- 最大生成token:420;
- 采样参数:top-p、top-k使用llama.cpp默认值;
- 终止条件:模型结束符 / token上限截断。
记忆子系统完整栈
SLM + LangMem记忆框架 + SQLite结构化数据库
- 每轮交互自动存入SQLite会话记录;
- LangMem调用同一款SLM提取事实,携带会话ID、时间戳、元数据持久化;
- 重复事实自动更新,修正类信息保留新旧两条记录;
- 记忆读取时按相关性、时间筛选历史记录送入SLM生成回答。
路由服务列表(10类虚拟世界标准后端)
通用对话、代码辅助、游戏机制、游戏AI、3D模型生成、图转3D、动作生成、纹理生成、音效生成、语音合成
开源实验完整资源
全套系统提示词、路由模板、记忆指令、测试数据集:
https://github.com/AimiliosHadjiliasis/CEAA/tree/main/XRAG2026
2.2 路由评测实验设计
路由任务对应CEAA Think思考模块,衡量SLM全局调度、意图分类能力:
- 数据集:1000条均衡提示词,10类服务各100条,模拟协作游戏开发场景;人工校验去除歧义样本,每条绑定唯一真实路由标签;
- 实验模式:仅执行路由判定,不调用下游生成服务,隔离路由模块性能;
- 采集指标:预测路由、真实标签、分类准确率、宏精确率/召回/F1、JSON结构化输出合法性、超时率、端到端延迟(仅模型推理+解析,不含下游服务);
- 评价指标说明:宏平均均衡高低频服务,延迟包含请求传输、推理解码、结构化解析全流程。
2.3 记忆评测实验设计
记忆任务对应CEAA Memory记忆模块,完整评测“写入事实-跨轮召回”全链路:
- 数据集:250组交互对(125条事实写入、125条对应召回提问),覆盖:设计方案、人员职责、用户偏好、角色行为、任务更新、信息修正、实体关联;
- 评测流程:写入轮新增信息,读取轮使用不同措辞查询同一事实;
- 双重校验机制:ChatGPT 5.5初筛打分 + 作者盲审人工复核;
- 判定标准:正确=完整提取目标事实、无过时/无关信息;错误:遗漏、混淆实体、读取请求误判为写入、引入虚构内容;
- 统计指标:端到端召回准确率、记忆写入标签识别率、服务泄漏(记忆请求错分到生成服务)、全链路延迟(事实抽取+数据库读写+上下文拼接+回答生成)。
3 实验结果
3.1 路由模块评测结果
表1 三款模型路由整体指标
| 模型参数量 | 整体准确率 | 宏精确率 | 宏召回率 | 宏F1 | 平均延迟(ms) | 中位数延迟(ms) | P95延迟(ms) |
|---|---|---|---|---|---|---|---|
| 0.5B | 29.4% | 58.4% | 29.4% | 28.9% | 1504 | 1623 | 1810 |
| 1.5B | 85.4% | 88.9% | 85.4% | 84.3% | 3349 | 3519 | 3923 |
| 3.0B | 87.7% | 90.8% | 87.8% | 87.8% | 5067 | 5367 | 6159 |
规律:模型参数量越大路由精度越高,但延迟显著上升。0.5B极易混淆相似生成类服务;1.5B实现精度与延迟均衡;3B在3D、图像生成等难分类任务提升明显,但推理耗时提升50%以上。
表2 各细分路由单类识别准确率
| 服务类型 | 0.5B | 1.5B | 3.0B |
|---|---|---|---|
| coding_support代码辅助 | 13.5% | 90.4% | 96.4% |
| game_ai_guidance游戏AI | 47.3% | 78.6% | 76.5% |
| gameplay_mechanics游戏机制 | 5.8% | 85.7% | 78.6% |
| generation_3D 3D生成 | 0.0% | 75.5% | 80.9% |
| image_to_3D图转3D | 27.0% | 45.0% | 74.1% |
| motion_generation动作生成 | 24.6% | 97.6% | 99.5% |
| conversational_generator通用对话 | 10.2% | 85.6% | 72.9% |
| sound_generation音效生成 | 65.5% | 93.4% | 100.0% |
| text_to_speech语音合成 | 78.8% | 95.3% | 99.5% |
| texture_generation纹理生成 | 16.5% | 95.7% | 99.0% |
3.2 记忆模块评测结果
表3 三款模型记忆完整链路指标
| 模型参数量 | 端到端召回准确率 | 正确召回条数/125 | 记忆写入标签识别率 | 服务泄漏条数/250 | 平均延迟(ms) | 中位数延迟(ms) | P95延迟(ms) |
|—|—|—|—|—|—|—|
| 0.5B | 72.8% | 91 | 1.6% | 1 | 2025 | 1845 | 2385 |
| 1.5B | 78.4% | 98 | 5.6% | 7 | 3794 | 3582 |
| 3.0B | 93.6% | 117 | 63.2% | 8 | 9693 | 9175 | 14531 |
- 0.5B:简单事实召回尚可,无法区分修正信息、不能精准筛选细分记忆,几乎无法识别“写入记忆”类指令;延迟最低但可用性差。
- 1.5B:召回小幅提升,关联信息、简单修正处理改善,但任务更新、状态区分能力弱,大量记忆交互被误判为普通对话。
- 3B:召回大幅领先,可稳定处理事实、状态变更、信息修正;缺陷是部分查询请求误识别为写入操作,全链路延迟翻倍。
4 结果讨论
-
Think思考模块(服务路由)可行性
1.5B、3B SLM可稳定完成多类别意图识别、异构服务分发,契合工具调用、智能体调度相关研究结论;但语义近似服务易混淆,需要根据场景、延迟约束选型。 -
Memory记忆模块可行性
Qwen2.5-3B可可靠完成事实存储、跨会话召回、信息覆盖修正,与生成式智能体记忆研究结论一致;核心难点是区分“读取记忆”与“写入记忆”两种操作,模型容易混淆两类指令。 -
精度-延迟核心权衡
- 0.5B:极低延迟,路由、记忆修正任务完全不可用;
- 1.5B:路由任务最优平衡点,兼顾精度与实时交互;
- 3B:记忆类复杂任务最优,延迟大幅上升,高实时虚拟场景存在卡顿风险。
落地建议模块化混合部署:轻量0.5B/1.5B做实时调度路由,3B单独处理记忆、复杂上下文推理。
-
本文三大核心贡献
(1) 完整验证服务路由可落地CEAA Think模块、结构化读写可落地CEAA Memory模块,完成边缘硬件约束下的对照实验;
(2) 横向对比0.5B/1.5B/3B三类SLM在路由、记忆两大任务的精度、延迟权衡,给出场景化选型依据;
(3) 证明元宇宙虚拟智能体认知后端可本地边缘运行,无需依赖云端大模型,兼顾响应速度与本地隐私。 -
现存落地痛点
相似服务路由歧义、记忆读写指令区分困难、全链路延迟优化不足、真实线上多变用户输入泛化能力待验证。
5 结论、研究局限与未来工作
5.1 核心结论
本地部署的轻量SLM可在边缘硬件上部分实现CEAA架构的思考、记忆两大核心认知流程,支撑元宇宙具身虚拟智能体;模型参数量提升会同步提高路由、记忆任务准确率,但推理延迟显著增加,工程部署需根据交互实时性需求做分层模块化设计。
5.2 研究局限
- 实验为受控仿真数据集,未接入真实海量随机用户交互;
- 仅评测CEAA的Think、Memory模块,感知、具身动作、完整3D实时交互不在本次实验范围内;
- LLM作为人工评审存在潜在主观偏差,已增加人工盲审缓解;
- 仅测试Qwen2.5三款模型、单一Jetson边缘硬件,结论泛化到其他SLM、边缘设备受限;
- 延迟指标为整体汇总数据,未拆解提示词预处理、解码、数据库、网络各环节耗时;
- 未对比关键词路由、嵌入检索、专用微调SLM等替代调度方案,仅验证生成式SLM路线可行性。
5.3 未来研究方向
- 细分全链路延迟各阶段耗时,通过用户交互实验确定虚拟场景可接受延迟阈值;
- 对比嵌入检索、专用微调小模型、关键词规则等多种路由方案,量化优劣;
- 拓展记忆评测维度:情景记忆、空间记忆、程序流程记忆、用户偏好长期交互测试;
- 开展真人用户实验,评估边缘SLM智能体在真实元宇宙场景的沉浸感、交互体验;
- 混合模型分层调度架构研发:轻模型实时路由,大模型离线/后台处理记忆与复杂推理。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)