企业将LLM、VLM或RAG服务部署到边缘侧时,需要同时处理四类资源:系统主控、模型推理、数据存储和外部接口。仅有AI加速模块并不能直接构成完整节点,模型还需要操作系统、业务进程、网络、缓存、数据预处理和设备接入能力。

赋创FR50 AI BOX采用RK3588主控SoC与LQ50(Duo)AI算力模块协同架构,最高提供320 TOPS@INT8算力,面向本地大模型、多模态推理、RAG知识库和机器人上层语义处理等场景。本文从系统分工、硬件规格、模型参考数据和部署配置四个方面进行说明。

FR50的系统架构

FR50不是把所有任务集中到同一颗芯片,而是按照“系统与业务处理”和“神经网络推理”进行分工。

层级

组件

主要任务

主控层

RK3588

Ubuntu、应用调度、多媒体编解码、网络、显示和外设管理

AI推理层

LQ50(Duo),集成2×M50

LLM、VLM等模型的神经网络推理

内存与缓存

LPDDR5 16GB,32GB可选

操作系统、业务应用、数据预处理和缓存

本地存储

128GB eMMC 5.1 + M.2 2280 SSD扩展

系统、模型文件、向量库和业务数据

接口层

双千兆网口、USB、HDMI、DP、Wi-Fi、Bluetooth

接入网络、显示终端、摄像头和其他设备

RK3588集成4个Cortex-A76核心和4个Cortex-A55核心,并提供Mali-G610 MC4 GPU、多媒体编解码与多种高速接口。它负责运行操作系统和业务服务,同时完成网络、显示与外设连接。

LQ50 Duo M.2集成两颗M50芯片,集中承担模型推理。该模块提供320 TOPS@INT8和200 TFLOPS@bFP16物理算力,内存带宽为307 GB/s,典型功耗不高于26 W。

这一分工使主控侧可以持续处理业务进程和设备数据,AI模块专注执行模型计算。对本地RAG、视觉语言模型或机器人上层推理来说,系统结构比单一算力数字更重要。

FR50主要硬件规格

项目

配置

产品形态

边缘AI算力一体机

AI算力

最高320 TOPS@INT8

操作系统

Ubuntu

系统内存

LPDDR5 16GB,32GB可选

系统存储

128GB eMMC 5.1,支持M.2 SSD 2280扩展

网络

2×RJ45千兆网口,Wi-Fi 5,Bluetooth

USB

4×USB 3.0 Type-A

显示

1×HDMI 1.4,1×DP 1.4

音频

3.5mm接口

整机尺寸

152×152×45.8 mm

散热

主动散热

供电

19V直流输入,建议90W以上电源

工作温度

-10℃至+45℃

本地存储需要根据模型文件、向量库、日志和业务数据量进行扩展。128GB eMMC适合承载基础系统,M.2 SSD用于补充模型与业务数据空间。双千兆网口便于将业务网、设备网或管理网按照项目结构进行连接。

320 TOPS@INT8如何理解

TOPS表示每秒可完成的万亿次运算。FR50的320 TOPS对应LQ50(Duo)在INT8数据类型下的理论物理运算能力,即每秒约320万亿次整数运算。

这个数值适合用于描述特定精度下的AI计算规模。与其他平台对比时,需要统一数据精度和测试口径,不能把INT8 TOPS直接换算为GPU的FP16、BF16或FP8算力。

在模型部署中,算力和以下因素共同决定运行配置:

  1. 模型结构:稠密模型和MoE模型每个Token实际激活的参数量不同;
  2. 权重精度:BF16、INT8、INT4等格式影响权重占用、计算路径和模型效果;
  3. 内存资源:模型权重、运行缓存和KV Cache需要同时占用内存;
  4. 上下文与并发:输入越长、并发越高,缓存和调度压力越大;
  5. 软件适配:模型需要经过解析、量化、编译和运行时适配;
  6. 业务前后处理:ASR、OCR、图像解码、检索、重排和接口调用都会进入端到端响应时间。

因此,FR50的模型配置需要从“模型+精度+上下文+并发+业务链路”五个维度确定,而不是仅按参数量选择设备。

LLM模型参考数据

FR50面向主流大模型与多模态模型适配。以下数据覆盖8B稠密模型和35B-A3B混合专家模型。

模型

模型结构

测试规模

Prefill

Decode

DeepSeek-R1-0528-Qwen3-8B

8B稠密模型

1-Chip

2531.47 tps

22.17 tps

Qwen3.5-35B-A3B

35B总参数、约3B激活参数,MoE

1-Chip

833.39 tps

33.94 tps

Prefill与Decode

Prefill阶段读取并处理输入提示词,通常具有较高并行度;Decode阶段逐Token生成后续内容,更接近连续输出速度。模型服务的首Token响应和持续生成体验需要分别观察这两个阶段。

MoE模型的资源配置

Qwen3.5-35B-A3B的总参数约35B,但每个Token激活的参数规模约3B。MoE模型部署不能只看总参数量,还要结合激活参数、量化方式、权重存储、上下文和并发配置运行资源。

14B/32B模型的部署表达

FR50面向14B/32B规模模型的边缘部署。具体配置由稠密或MoE结构、量化精度、算力模块内存、上下文长度和并发目标共同决定。工程上应先确定完整模型名称与版本,再选择对应的量化与运行配置。

VLM多模态参考数据

多模态模型方面,现有参考数据包括:

  • Qwen2.5-VL-7B:视觉任务阶段5.22 FPS;
  • Qwen3.5-9B:视觉处理阶段9.04 FPS。

FPS用于观察视觉阶段的处理能力,但不等同于完整应用响应时间。一个视觉问答或工业辅助分析链路通常还包括摄像头采集、图像解码、尺寸变换、视觉编码、提示词处理、文本生成和业务接口。

部署VLM时,需要明确摄像头分辨率、采集频率、单次输入图片数量、输出长度和端到端响应周期,再配置模型与图像处理链路。

本地RAG如何部署到FR50

本地RAG并不只是运行一个大语言模型。完整链路通常包含:

  1. 文档采集、解析和切分;
  2. Embedding向量化;
  3. 向量数据库或检索引擎;
  4. 召回、过滤与重排;
  5. 大模型生成;
  6. 权限、日志、更新与结果复核。

FR50可以承载本地文档检索和大模型生成,并通过本地存储保存模型文件、向量库和业务数据。项目配置时,需要根据知识库规模、更新频率、检索并发和模型上下文确定SSD容量、服务编排和缓存策略。

对于知识库较大或并发更高的项目,也可以把数据服务放在内网服务器,FR50负责靠近终端的模型推理与设备接入。

部署检查表

配置项

需要确认的技术信息

目标模型与版本

完整模型名称、版本、稠密或MoE结构

权重精度与量化

权重格式、量化方案、模型效果要求、算力模块内存需求

上下文与并发

平均/峰值输入长度、输出长度、并发数和响应时间

外设与协议

摄像头、麦克风、显示器、机器人控制器、局域网和接口协议

业务服务

ASR、OCR、Embedding、检索、重排、数据库和API服务

本地存储

模型文件、向量库、日志和业务数据的容量与读写要求

部署环境

空间、供电、温度、散热、连续运行时间和维护方式

这张表的作用是把模型问题转化为可执行配置。模型名称和参数量只能确定大致范围,量化、上下文、并发和前后处理才会进一步决定内存、存储和响应链路。

FR50适合承担哪些系统任务

本地会议与企业知识助手

FR50可以承接会议内容总结、文档问答、本地知识检索和多模态交互。与ASR、向量数据库和权限系统组合后,可形成企业内网中的知识助手节点。

工业知识检索与视觉辅助

设备手册、维修记录、工单和现场图片可以构成本地知识入口。FR50运行RAG与VLM相关推理服务,帮助完成资料检索、信息提取和图像辅助判断。摄像头配置、目标算法和响应周期需要在项目侧完成匹配。

机器人上层语义推理

FR50可以处理自然语言指令、图像理解、知识检索和任务编排。运动控制、功能安全、硬实时避障和底层SLAM由相应控制器或计算平台承担,FR50作为上层推理节点与其协同。

政企内网文档处理

文档分类、要素提取、知识问答和流程辅助可以部署在本地,同时接入数据权限、日志审计、模型更新和结果复核机制。

FR50与中心侧算力如何协同

FR50适合本地数据处理、单点或有限并发推理和设备侧集成。全参数训练、大规模多用户并发、超长上下文或超大模型服务通常由中心侧GPU服务器或算力集群承担。

典型协同方式包括:

  • 中心侧完成模型训练、微调、评测与版本管理;
  • 将适合边缘运行的模型版本量化并部署到FR50;
  • FR50处理现场数据、模型推理和设备接口;
  • 中心侧负责统一更新、日志汇总或跨节点管理。

这种结构将训练与推理、中心与现场、通用服务与设备任务分别放到更合适的计算位置。

软件与业务系统集成

FR50配套的软件环境覆盖模型解析、图优化、后训练量化、编译和推理运行。模型完成选择、量化、编译和部署后,可接入本地知识库、业务系统和现场设备。

赋创可围绕FR50 AI BOX提供模型选择与适配、运行配置、内存与存储匹配、单机部署和中心服务器协同规划。响应速度、模型效果、外设联动和连续运行等关键指标,可通过PoC与容量测试完成参数校准。

总结

FR50 AI BOX的核心不是单一芯片或一个TOPS数值,而是将主控、AI推理、存储、网络和外设接口整合成可进入业务现场的边缘节点。

RK3588负责系统与业务处理,LQ50(Duo)负责神经网络推理,最高320 TOPS@INT8算力用于承载本地大模型、多模态和RAG相关任务。项目部署时,模型结构、量化精度、上下文、并发和业务前后处理共同决定最终运行配置。

说明:文中产品规格以当前资料为依据,如产品版本、软件适配或配置发生更新,以正式交付信息为准。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐