基于小语言模型与边缘计算增强虚拟智能体:思考与记忆机制探索评测

arXiv:2608.13420v1

摘要

具身虚拟智能体需要在元宇宙、扩展现实等复杂虚拟环境中实现持久运行、自适应交互与环境感知,但在工程落地层面存在巨大技术与架构挑战。本文围绕认知具身智能体架构(CEAA) 展开研究,该框架专门用于落地感知、记忆、推理、规划、具身动作全套智能体组件。
结合当下边缘计算与轻量小语言模型(SLM)技术进展,本文聚焦CEAA两大核心模块:思考(Think)记忆(Memory),验证SLM在边缘硬件上驱动两套核心认知流程的可行性。
基于NVIDIA Jetson Orin NX边缘设备搭建虚拟智能体边缘网关,采用不同参数量的Qwen2.5系列小模型完成全套对照仿真实验,从服务路由精度、记忆读写效果、推理延迟三大维度量化评测。
实验证明,SLM可在边缘硬件上局部运行,部分实现CEAA认知流程,支撑沉浸式虚拟世界中高实时、具备上下文感知的具身智能体交互开发。
关键词:具身智能体;虚拟智能体;小语言模型SLM;智能体记忆;智能体调度;边缘计算

1 研究背景与相关基础

1.1 虚拟具身智能体

XR、元宇宙技术革新了人机交互模式,用户可通过数字化身、数字孪生与虚拟空间、其他用户实时交互,虚拟智能体作为虚拟环境内可控智能实体,承担引导、教学、社交交互、训练辅助等功能,要求具备持久在线、动态自适应、实时响应三大特性。

现有虚拟智能体普遍依赖脚本、有限状态机、传统游戏符号AI,仅能完成预设行为;面对动态用户输入时自适应能力不足,视觉上实现“具身”,但认知交互能力存在明显短板。
智能体的完整智能能力包含感知、记忆、对话、规划、多模态行为输出,经典理论框架包括BDI、SOAR,近年大语言模型开始用于智能体认知层。
具身特性直接影响用户沉浸感与参与度,智能体评测维度包含任务完成率、对话流畅度、记忆召回准确率、推理延迟、错误率、鲁棒性等;当前核心痛点:感知/记忆/推理/动作实时融合、可靠上下文记忆、幻觉抑制、交互安全、用户隐私保护。

1.2 虚拟智能体的记忆与持久化机制

认知科学将记忆分为工作记忆(实时短时推理)与长时记忆(跨会话持久存储);面向LLM智能体的MIRIX记忆体系进一步细化6类专用记忆:

  1. 核心记忆:智能本体、用户长期固定信息;
  2. 情景记忆:带时间戳交互事件;
  3. 语义记忆:概念、实体、关系知识库;
  4. 过程记忆:任务流程、操作步骤;
  5. 资源记忆:文档、音视频等媒体文件;
  6. 安全知识库:账号、地址等敏感隐私数据。

完整记忆链路包含编码、存储、检索、复用四大环节,支撑跨会话身份、偏好、任务状态持久;现有生成式智能体虽可模拟社交行为,但长期时序推理、因果一致性、多会话记忆召回存在显著缺陷,虚拟场景下需要高可靠结构化记忆系统。

1.3 小语言模型(SLM)与边缘智能体AI

SLM为亿级至三十亿参数量轻量化Transformer模型,相比大LLM具备算力、显存、功耗、延迟四大优势,适配边缘硬件,可完成:意图识别、请求分类、服务路由、信息抽取、摘要、结构化输出、记忆读写判断等任务。

在虚拟智能体系统中,SLM不局限于对话生成,可作为轻量化认知调度中枢:解析用户输入、判定是否读写记忆、分发不同后端服务(3D生成、语音、纹理、代码、对话)。
局限:深度多步推理、长时序规划、海量事实储备、复杂抽象能力弱;开放模糊请求处理稳定性不足,复杂创意生成、多模态理解仍依赖大模型。

边缘智能体AI定义:推理、记忆、决策、工具调用在用户侧本地硬件完成,不上云。优势:交互低延迟、隐私本地留存、弱网可用;典型架构:本地SLM+向量/结构化记忆+工具调用网关+云兜底降级。
通过函数调用,SLM可输出标准化API指令,调度异构专用服务,无需单模型承载全部计算逻辑,是元宇宙轻量化智能体核心技术路线。

1.4 CEAA认知具身智能体架构

CEAA是一套面向实时3D虚拟世界、工程可落地的模块化智能体架构,弥补传统高层认知框架难以嵌入游戏引擎、底层符号AI缺少完整认知链路的缺陷,分为三层模块化结构:

  1. 用户与环境层:完整虚拟世界,包含用户、化身、虚拟物体、全局系统事件,记录全部交互状态;
  2. 知识层:黑板式共享知识库,统一存储环境事件、状态变更,供智能体全局读取;
  3. 智能体层:全部认知与行为核心组件,包含感知、记忆、思考、推理、规划、行为映射、具身执行模块。

核心两大模块:

  • Memory记忆模块:存储情景、语义、用户偏好、历史行为,支撑跨会话自适应;
  • Think思考模块:全局认知调度中枢,整合记忆信息,协调推理器、规划器,串联感知、决策、动作全链路。

本文核心目标:基于边缘SLM落地、评测CEAA的Think、Memory两大核心流程。

2 实验方法

本文基于自研SLM智能体调度网关,在边缘硬件上局部实现CEAA思考、记忆流程,搭建Unity虚拟化身交互测试环境,采用Qwen2.5 0.5B/1.5B/3B三款量化小模型做对照实验,从服务路由结构化记忆读写两大任务量化模型精度与延迟权衡关系。

实验核心逻辑:SLM作为智能体认知大脑,接收用户自然语言输入,完成意图分类、服务路由分发、记忆存取判定;路由实验模拟10类虚拟世界通用后端服务,记忆实验模拟完整多轮事实写入-召回交互流程。

2.1 实验硬件与系统完整配置

在这里插入图片描述

实验平台基础
  1. 虚拟环境测试床:InterwovenXR(Unity引擎),支持虚拟博物馆、数字孪生、游戏开发等具身智能场景;
  2. 边缘计算硬件:NVIDIA Jetson Orin NX 8GB(资源受限边缘标准设备);
  3. 客户端:Unity引擎负责用户输入、虚拟化身渲染,轻量化不承载大模型推理;
  4. 边缘网关:独立部署,处理SLM推理、记忆管理、服务分发,客户端仅HTTP交互。
模型与推理配置
  • 模型:Qwen2.5-Instruct 0.5B / 1.5B / 3B,GGUF Q4_K_M量化;
  • 推理后端:llama.cpp本地部署;
  • 上下文窗口:4096 token;
  • 最大生成token:420;
  • 采样参数:top-p、top-k使用llama.cpp默认值;
  • 终止条件:模型结束符 / token上限截断。
记忆子系统完整栈

SLM + LangMem记忆框架 + SQLite结构化数据库

  1. 每轮交互自动存入SQLite会话记录;
  2. LangMem调用同一款SLM提取事实,携带会话ID、时间戳、元数据持久化;
  3. 重复事实自动更新,修正类信息保留新旧两条记录;
  4. 记忆读取时按相关性、时间筛选历史记录送入SLM生成回答。
路由服务列表(10类虚拟世界标准后端)

通用对话、代码辅助、游戏机制、游戏AI、3D模型生成、图转3D、动作生成、纹理生成、音效生成、语音合成

开源实验完整资源

全套系统提示词、路由模板、记忆指令、测试数据集:
https://github.com/AimiliosHadjiliasis/CEAA/tree/main/XRAG2026

2.2 路由评测实验设计

路由任务对应CEAA Think思考模块,衡量SLM全局调度、意图分类能力:

  1. 数据集:1000条均衡提示词,10类服务各100条,模拟协作游戏开发场景;人工校验去除歧义样本,每条绑定唯一真实路由标签;
  2. 实验模式:仅执行路由判定,不调用下游生成服务,隔离路由模块性能;
  3. 采集指标:预测路由、真实标签、分类准确率、宏精确率/召回/F1、JSON结构化输出合法性、超时率、端到端延迟(仅模型推理+解析,不含下游服务);
  4. 评价指标说明:宏平均均衡高低频服务,延迟包含请求传输、推理解码、结构化解析全流程。

2.3 记忆评测实验设计

记忆任务对应CEAA Memory记忆模块,完整评测“写入事实-跨轮召回”全链路:

  1. 数据集:250组交互对(125条事实写入、125条对应召回提问),覆盖:设计方案、人员职责、用户偏好、角色行为、任务更新、信息修正、实体关联;
  2. 评测流程:写入轮新增信息,读取轮使用不同措辞查询同一事实;
  3. 双重校验机制:ChatGPT 5.5初筛打分 + 作者盲审人工复核;
  4. 判定标准:正确=完整提取目标事实、无过时/无关信息;错误:遗漏、混淆实体、读取请求误判为写入、引入虚构内容;
  5. 统计指标:端到端召回准确率、记忆写入标签识别率、服务泄漏(记忆请求错分到生成服务)、全链路延迟(事实抽取+数据库读写+上下文拼接+回答生成)。

3 实验结果

3.1 路由模块评测结果

表1 三款模型路由整体指标
模型参数量 整体准确率 宏精确率 宏召回率 宏F1 平均延迟(ms) 中位数延迟(ms) P95延迟(ms)
0.5B 29.4% 58.4% 29.4% 28.9% 1504 1623 1810
1.5B 85.4% 88.9% 85.4% 84.3% 3349 3519 3923
3.0B 87.7% 90.8% 87.8% 87.8% 5067 5367 6159

规律:模型参数量越大路由精度越高,但延迟显著上升。0.5B极易混淆相似生成类服务;1.5B实现精度与延迟均衡;3B在3D、图像生成等难分类任务提升明显,但推理耗时提升50%以上。

表2 各细分路由单类识别准确率
服务类型 0.5B 1.5B 3.0B
coding_support代码辅助 13.5% 90.4% 96.4%
game_ai_guidance游戏AI 47.3% 78.6% 76.5%
gameplay_mechanics游戏机制 5.8% 85.7% 78.6%
generation_3D 3D生成 0.0% 75.5% 80.9%
image_to_3D图转3D 27.0% 45.0% 74.1%
motion_generation动作生成 24.6% 97.6% 99.5%
conversational_generator通用对话 10.2% 85.6% 72.9%
sound_generation音效生成 65.5% 93.4% 100.0%
text_to_speech语音合成 78.8% 95.3% 99.5%
texture_generation纹理生成 16.5% 95.7% 99.0%

3.2 记忆模块评测结果

表3 三款模型记忆完整链路指标

| 模型参数量 | 端到端召回准确率 | 正确召回条数/125 | 记忆写入标签识别率 | 服务泄漏条数/250 | 平均延迟(ms) | 中位数延迟(ms) | P95延迟(ms) |
|—|—|—|—|—|—|—|
| 0.5B | 72.8% | 91 | 1.6% | 1 | 2025 | 1845 | 2385 |
| 1.5B | 78.4% | 98 | 5.6% | 7 | 3794 | 3582 |
| 3.0B | 93.6% | 117 | 63.2% | 8 | 9693 | 9175 | 14531 |

  1. 0.5B:简单事实召回尚可,无法区分修正信息、不能精准筛选细分记忆,几乎无法识别“写入记忆”类指令;延迟最低但可用性差。
  2. 1.5B:召回小幅提升,关联信息、简单修正处理改善,但任务更新、状态区分能力弱,大量记忆交互被误判为普通对话。
  3. 3B:召回大幅领先,可稳定处理事实、状态变更、信息修正;缺陷是部分查询请求误识别为写入操作,全链路延迟翻倍。

4 结果讨论

  1. Think思考模块(服务路由)可行性
    1.5B、3B SLM可稳定完成多类别意图识别、异构服务分发,契合工具调用、智能体调度相关研究结论;但语义近似服务易混淆,需要根据场景、延迟约束选型。

  2. Memory记忆模块可行性
    Qwen2.5-3B可可靠完成事实存储、跨会话召回、信息覆盖修正,与生成式智能体记忆研究结论一致;核心难点是区分“读取记忆”与“写入记忆”两种操作,模型容易混淆两类指令。

  3. 精度-延迟核心权衡

  • 0.5B:极低延迟,路由、记忆修正任务完全不可用;
  • 1.5B:路由任务最优平衡点,兼顾精度与实时交互;
  • 3B:记忆类复杂任务最优,延迟大幅上升,高实时虚拟场景存在卡顿风险。
    落地建议模块化混合部署:轻量0.5B/1.5B做实时调度路由,3B单独处理记忆、复杂上下文推理。
  1. 本文三大核心贡献
    (1) 完整验证服务路由可落地CEAA Think模块、结构化读写可落地CEAA Memory模块,完成边缘硬件约束下的对照实验;
    (2) 横向对比0.5B/1.5B/3B三类SLM在路由、记忆两大任务的精度、延迟权衡,给出场景化选型依据;
    (3) 证明元宇宙虚拟智能体认知后端可本地边缘运行,无需依赖云端大模型,兼顾响应速度与本地隐私。

  2. 现存落地痛点
    相似服务路由歧义、记忆读写指令区分困难、全链路延迟优化不足、真实线上多变用户输入泛化能力待验证。

5 结论、研究局限与未来工作

5.1 核心结论

本地部署的轻量SLM可在边缘硬件上部分实现CEAA架构的思考、记忆两大核心认知流程,支撑元宇宙具身虚拟智能体;模型参数量提升会同步提高路由、记忆任务准确率,但推理延迟显著增加,工程部署需根据交互实时性需求做分层模块化设计。

5.2 研究局限

  1. 实验为受控仿真数据集,未接入真实海量随机用户交互;
  2. 仅评测CEAA的Think、Memory模块,感知、具身动作、完整3D实时交互不在本次实验范围内;
  3. LLM作为人工评审存在潜在主观偏差,已增加人工盲审缓解;
  4. 仅测试Qwen2.5三款模型、单一Jetson边缘硬件,结论泛化到其他SLM、边缘设备受限;
  5. 延迟指标为整体汇总数据,未拆解提示词预处理、解码、数据库、网络各环节耗时;
  6. 未对比关键词路由、嵌入检索、专用微调SLM等替代调度方案,仅验证生成式SLM路线可行性。

5.3 未来研究方向

  1. 细分全链路延迟各阶段耗时,通过用户交互实验确定虚拟场景可接受延迟阈值;
  2. 对比嵌入检索、专用微调小模型、关键词规则等多种路由方案,量化优劣;
  3. 拓展记忆评测维度:情景记忆、空间记忆、程序流程记忆、用户偏好长期交互测试;
  4. 开展真人用户实验,评估边缘SLM智能体在真实元宇宙场景的沉浸感、交互体验;
  5. 混合模型分层调度架构研发:轻模型实时路由,大模型离线/后台处理记忆与复杂推理。
Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐