赋创FR50 AI BOX部署解析:RK3588+LQ50 Duo架构、320 TOPS与模型适配参考
企业将LLM、VLM或RAG服务部署到边缘侧时,需要同时处理四类资源:系统主控、模型推理、数据存储和外部接口。仅有AI加速模块并不能直接构成完整节点,模型还需要操作系统、业务进程、网络、缓存、数据预处理和设备接入能力。
赋创FR50 AI BOX采用RK3588主控SoC与LQ50(Duo)AI算力模块协同架构,最高提供320 TOPS@INT8算力,面向本地大模型、多模态推理、RAG知识库和机器人上层语义处理等场景。本文从系统分工、硬件规格、模型参考数据和部署配置四个方面进行说明。

FR50的系统架构
FR50不是把所有任务集中到同一颗芯片,而是按照“系统与业务处理”和“神经网络推理”进行分工。
|
层级 |
组件 |
主要任务 |
|
主控层 |
RK3588 |
Ubuntu、应用调度、多媒体编解码、网络、显示和外设管理 |
|
AI推理层 |
LQ50(Duo),集成2×M50 |
LLM、VLM等模型的神经网络推理 |
|
内存与缓存 |
LPDDR5 16GB,32GB可选 |
操作系统、业务应用、数据预处理和缓存 |
|
本地存储 |
128GB eMMC 5.1 + M.2 2280 SSD扩展 |
系统、模型文件、向量库和业务数据 |
|
接口层 |
双千兆网口、USB、HDMI、DP、Wi-Fi、Bluetooth |
接入网络、显示终端、摄像头和其他设备 |
RK3588集成4个Cortex-A76核心和4个Cortex-A55核心,并提供Mali-G610 MC4 GPU、多媒体编解码与多种高速接口。它负责运行操作系统和业务服务,同时完成网络、显示与外设连接。
LQ50 Duo M.2集成两颗M50芯片,集中承担模型推理。该模块提供320 TOPS@INT8和200 TFLOPS@bFP16物理算力,内存带宽为307 GB/s,典型功耗不高于26 W。
这一分工使主控侧可以持续处理业务进程和设备数据,AI模块专注执行模型计算。对本地RAG、视觉语言模型或机器人上层推理来说,系统结构比单一算力数字更重要。

FR50主要硬件规格
|
项目 |
配置 |
|
产品形态 |
边缘AI算力一体机 |
|
AI算力 |
最高320 TOPS@INT8 |
|
操作系统 |
Ubuntu |
|
系统内存 |
LPDDR5 16GB,32GB可选 |
|
系统存储 |
128GB eMMC 5.1,支持M.2 SSD 2280扩展 |
|
网络 |
2×RJ45千兆网口,Wi-Fi 5,Bluetooth |
|
USB |
4×USB 3.0 Type-A |
|
显示 |
1×HDMI 1.4,1×DP 1.4 |
|
音频 |
3.5mm接口 |
|
整机尺寸 |
152×152×45.8 mm |
|
散热 |
主动散热 |
|
供电 |
19V直流输入,建议90W以上电源 |
|
工作温度 |
-10℃至+45℃ |
本地存储需要根据模型文件、向量库、日志和业务数据量进行扩展。128GB eMMC适合承载基础系统,M.2 SSD用于补充模型与业务数据空间。双千兆网口便于将业务网、设备网或管理网按照项目结构进行连接。
320 TOPS@INT8如何理解
TOPS表示每秒可完成的万亿次运算。FR50的320 TOPS对应LQ50(Duo)在INT8数据类型下的理论物理运算能力,即每秒约320万亿次整数运算。
这个数值适合用于描述特定精度下的AI计算规模。与其他平台对比时,需要统一数据精度和测试口径,不能把INT8 TOPS直接换算为GPU的FP16、BF16或FP8算力。
在模型部署中,算力和以下因素共同决定运行配置:
- 模型结构:稠密模型和MoE模型每个Token实际激活的参数量不同;
- 权重精度:BF16、INT8、INT4等格式影响权重占用、计算路径和模型效果;
- 内存资源:模型权重、运行缓存和KV Cache需要同时占用内存;
- 上下文与并发:输入越长、并发越高,缓存和调度压力越大;
- 软件适配:模型需要经过解析、量化、编译和运行时适配;
- 业务前后处理:ASR、OCR、图像解码、检索、重排和接口调用都会进入端到端响应时间。
因此,FR50的模型配置需要从“模型+精度+上下文+并发+业务链路”五个维度确定,而不是仅按参数量选择设备。

LLM模型参考数据
FR50面向主流大模型与多模态模型适配。以下数据覆盖8B稠密模型和35B-A3B混合专家模型。
|
模型 |
模型结构 |
测试规模 |
Prefill |
Decode |
|
DeepSeek-R1-0528-Qwen3-8B |
8B稠密模型 |
1-Chip |
2531.47 tps |
22.17 tps |
|
Qwen3.5-35B-A3B |
35B总参数、约3B激活参数,MoE |
1-Chip |
833.39 tps |
33.94 tps |
Prefill与Decode
Prefill阶段读取并处理输入提示词,通常具有较高并行度;Decode阶段逐Token生成后续内容,更接近连续输出速度。模型服务的首Token响应和持续生成体验需要分别观察这两个阶段。

MoE模型的资源配置
Qwen3.5-35B-A3B的总参数约35B,但每个Token激活的参数规模约3B。MoE模型部署不能只看总参数量,还要结合激活参数、量化方式、权重存储、上下文和并发配置运行资源。
14B/32B模型的部署表达
FR50面向14B/32B规模模型的边缘部署。具体配置由稠密或MoE结构、量化精度、算力模块内存、上下文长度和并发目标共同决定。工程上应先确定完整模型名称与版本,再选择对应的量化与运行配置。
VLM多模态参考数据
多模态模型方面,现有参考数据包括:
- Qwen2.5-VL-7B:视觉任务阶段5.22 FPS;
- Qwen3.5-9B:视觉处理阶段9.04 FPS。

FPS用于观察视觉阶段的处理能力,但不等同于完整应用响应时间。一个视觉问答或工业辅助分析链路通常还包括摄像头采集、图像解码、尺寸变换、视觉编码、提示词处理、文本生成和业务接口。
部署VLM时,需要明确摄像头分辨率、采集频率、单次输入图片数量、输出长度和端到端响应周期,再配置模型与图像处理链路。

本地RAG如何部署到FR50
本地RAG并不只是运行一个大语言模型。完整链路通常包含:
- 文档采集、解析和切分;
- Embedding向量化;
- 向量数据库或检索引擎;
- 召回、过滤与重排;
- 大模型生成;
- 权限、日志、更新与结果复核。
FR50可以承载本地文档检索和大模型生成,并通过本地存储保存模型文件、向量库和业务数据。项目配置时,需要根据知识库规模、更新频率、检索并发和模型上下文确定SSD容量、服务编排和缓存策略。
对于知识库较大或并发更高的项目,也可以把数据服务放在内网服务器,FR50负责靠近终端的模型推理与设备接入。

部署检查表
|
配置项 |
需要确认的技术信息 |
|
目标模型与版本 |
完整模型名称、版本、稠密或MoE结构 |
|
权重精度与量化 |
权重格式、量化方案、模型效果要求、算力模块内存需求 |
|
上下文与并发 |
平均/峰值输入长度、输出长度、并发数和响应时间 |
|
外设与协议 |
摄像头、麦克风、显示器、机器人控制器、局域网和接口协议 |
|
业务服务 |
ASR、OCR、Embedding、检索、重排、数据库和API服务 |
|
本地存储 |
模型文件、向量库、日志和业务数据的容量与读写要求 |
|
部署环境 |
空间、供电、温度、散热、连续运行时间和维护方式 |
这张表的作用是把模型问题转化为可执行配置。模型名称和参数量只能确定大致范围,量化、上下文、并发和前后处理才会进一步决定内存、存储和响应链路。

FR50适合承担哪些系统任务
本地会议与企业知识助手
FR50可以承接会议内容总结、文档问答、本地知识检索和多模态交互。与ASR、向量数据库和权限系统组合后,可形成企业内网中的知识助手节点。

工业知识检索与视觉辅助
设备手册、维修记录、工单和现场图片可以构成本地知识入口。FR50运行RAG与VLM相关推理服务,帮助完成资料检索、信息提取和图像辅助判断。摄像头配置、目标算法和响应周期需要在项目侧完成匹配。

机器人上层语义推理
FR50可以处理自然语言指令、图像理解、知识检索和任务编排。运动控制、功能安全、硬实时避障和底层SLAM由相应控制器或计算平台承担,FR50作为上层推理节点与其协同。

政企内网文档处理
文档分类、要素提取、知识问答和流程辅助可以部署在本地,同时接入数据权限、日志审计、模型更新和结果复核机制。

FR50与中心侧算力如何协同
FR50适合本地数据处理、单点或有限并发推理和设备侧集成。全参数训练、大规模多用户并发、超长上下文或超大模型服务通常由中心侧GPU服务器或算力集群承担。
典型协同方式包括:
- 中心侧完成模型训练、微调、评测与版本管理;
- 将适合边缘运行的模型版本量化并部署到FR50;
- FR50处理现场数据、模型推理和设备接口;
- 中心侧负责统一更新、日志汇总或跨节点管理。
这种结构将训练与推理、中心与现场、通用服务与设备任务分别放到更合适的计算位置。

软件与业务系统集成
FR50配套的软件环境覆盖模型解析、图优化、后训练量化、编译和推理运行。模型完成选择、量化、编译和部署后,可接入本地知识库、业务系统和现场设备。
赋创可围绕FR50 AI BOX提供模型选择与适配、运行配置、内存与存储匹配、单机部署和中心服务器协同规划。响应速度、模型效果、外设联动和连续运行等关键指标,可通过PoC与容量测试完成参数校准。
总结
FR50 AI BOX的核心不是单一芯片或一个TOPS数值,而是将主控、AI推理、存储、网络和外设接口整合成可进入业务现场的边缘节点。
RK3588负责系统与业务处理,LQ50(Duo)负责神经网络推理,最高320 TOPS@INT8算力用于承载本地大模型、多模态和RAG相关任务。项目部署时,模型结构、量化精度、上下文、并发和业务前后处理共同决定最终运行配置。

说明:文中产品规格以当前资料为依据,如产品版本、软件适配或配置发生更新,以正式交付信息为准。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)