邓永恒1    章晋睿1     岳 晟2     任 炬1, 3**    

 1. 清华大学 计算机科学与技术系

 2. 中山大学 网络空间安全学院

 3. 中关村实验室

图片

主要作者简介

任   炬   清华大学计算机系长聘副教授、博士生导师。研究领域包括物联网、边缘计算与边缘智能。主持国家重点研发计划课题,国家自然科学基金重点项目、青年科学基金项目(B类)、专项项目等国家级项目10余项。

邓永恒   清华大学计算机科学与技术系博士后。博士毕业于清华大学计算机科学与技术系。研究领域主要包括边缘智能、 端边云协同计算、隐私计算。主持国家自然科学基金青年科学基金项目(C类),入选2024年度博士后创新人才支持计划。

摘  要

近年来,大语言模型技术在多个领域取得了突破性进展,为实现泛在智能提供了坚实的基础。然而,泛在智能要求在各种场景中实现无缝的智能体验,这对大语言模型的部署和应用提出了新的挑战。云上部署大模型时,面临实时性、安全性和个性化需求难以兼顾的问题,限制了其在不同环境中的适用性。这些挑战促使研究者探索端侧部署大语言模型的前景,以期在更接近数据源的位置实现更高效的智能服务。然而,端侧的资源限制为大语言模型的部署、推理与应用带来了严峻的挑战。

本文首先探讨了这些挑战,并系统梳理了端侧大模型部署与推理应用的关键技术进展,包括模型压缩、运行时优化和端边云协同等方面的前沿研究,并深入分析了相关技术在实际应用中的优势与局限性。

最后,本文对大语言模型实现泛在智能的未来发展方向进行了展望,包括模型轻量化、新型计算架构支持、隐私保护技术创新以及端边大小模型协同优化等技术,力求推动大语言模型在端侧的高效落地与应用。

关键词:大语言模型;泛在智能;端侧部署;模型优化;边缘计算;隐私保护

随着人工智能技术的快速发展,大语言模型(Large Language Models,LLMs)在自然语言处理领域取得了显著的进展。这些模型通过在大规模数据上进行预训练,展现了强大的语言理解和生成能力,广泛应用于各类下游任务。

当前大语言模型的应用主要依赖于云端智能模式,这一模式为大规模计算提供了必要的基础设施和资源支持。然而,云端智能模式需要用户将数据上传至云端以获取大语言模型服务,这带来了显著的通信延迟和带宽成本,并且用户数据在上传过程中也存在隐私泄露的风险。

面对这些挑战,向泛在智能的演进成为一种重要趋势。泛在智能强调将智能服务下沉到端边设备,利用其本地的计算能力和存储资源,实现更高效、更灵活的智能应用。这一模式不仅能够降低数据传输的需求,保护用户隐私,还能减少网络延迟,提升用户体验。然而,由于端边环境固有的资源受限性和复杂异构性,大语言模型在端设备上的应用仍面临诸多挑战。

本文系统性地探讨了大语言模型从云端智能向泛在智能演进的背景和原因,分析了当前云端智能的局限性以及泛在智能所带来的新机遇。同时,本文分析了大语言模型向泛在智能发展过程中面临的挑战,并总结了相关技术的研究现状与发展趋势,旨在为该领域的发展提供有价值的参考。

1     大语言模型的演进:从云端智能到泛在智能

1.1   云上大模型面临的挑战

随着云计算和大数据技术的快速发展,云上大语言模型成为人工智能领域的重要支柱。它们以强大的计算能力和海量数据处理能力为基础,推动了自然语言处理、机器翻译和智能问答等应用的飞速发展。当前,大语言模型通常部署在云端,以支持大规模用户访问并提供高质量的智能服务。然而,云上大模型的广泛应用也带来了诸多挑战。

首先是实时性问题。尽管云端具有强大的计算资源,但网络延迟可能导致响应时间过长,无法满足某些对时效性要求较高的应用场景;其次,安全性是云端大模型面临的重要挑战。云计算集中存储用户数据,容易受到数据泄露和网络攻击的威胁,随着用户隐私保护意识的增强,越来越多的用户出于隐私考虑不愿将个人数据上传到云端;

同时,云端大模型在个性化服务方面也存在局限性。虽然云端模型具备强大的泛化能力,但针对特定用户需求的个性化服务仍显不足,尤其在数据稀缺的场景中,难以提供精准的个性化体验。

1.2   端侧大模型的兴起

面对云端大模型的局限性,端侧大语言模型应运而生。随着硬件技术的进步,终端设备的计算性能显著提升,这为大语言模型在端侧的部署与应用提供了坚实的基础。端侧部署的大模型可以显著减少网络依赖,从而提高响应速度,满足实时应用的需求。

此外,数据处理在设备本地完成,有效防止了敏感数据的泄露,提升了用户的隐私安全感。其次,端侧模型的个性化能力更强。通过利用本地数据,端侧大模型能够根据用户的使用习惯和需求进行实时调整和优化,从而提供更精准的个性化服务。因此,端侧大模型在智能家居、智能助手和个性化推荐等领域展现出了巨大的市场潜力。

1.3   端侧大模型面临的挑战

尽管端侧大模型为智能应用带来了新机遇,但端侧的资源受限性和异构性环境为大模型的实际部署、推理和应用带来了严峻的挑战。

(1) 在部署方面,终端设备的计算能力和内存等资源通常受限,往往只能支持较小规模的模型,难以满足大模型在复杂任务中的需求。并且,终端设备往往呈现高度的系统异构性,不同设备之间具有较大的软硬件资源环境和计算能力差异,这为大模型在端设备上的个性化部署带来了挑战。

(2) 在推理方面,虽然端侧模型极大地降低了网络延迟,但在复杂的推理任务中,终端设备有限的资源使得推理时间仍可能成为瓶颈。此外,端设备数据在质量、模态和分布上的差异性带来了模型推理效率和准确性的问题,这要求端模型具备较强的自适应能力,以在不同的场景中维持稳定的推理效果。

(3) 在应用方面,端侧任务因不同的应用场景而展现出显著的多样化需求。例如,智能语音助手通常要求低延迟响应,以提升用户交互体验,而实时翻译则更注重推理精度,以确保翻译结果的准确性。这些任务在模型需求和性能指标上存在差异,智能语音助手优先考虑实时性与资源效率,而实时翻译则需具备更强的上下文理解能力和任务相关的优化策略。因此,端侧任务的多样性对端模型的泛化能力和个性化服务能力提出了更高的要求。

2     端侧大模型相关技术研究进展

为了克服上述挑战,本文总结了近年来在端侧大语言模型领域的关键技术进展,包括模型压缩技术、运行时优化技术和端边云协同技术。相关技术结构如图1所示。

图片

2.1   模型压缩

模型压缩技术旨在通过创建更高效、更紧凑的模型来减少大型语言模型的内存占用和计算需求,而不会显著降低性能。

2.1.1   网络剪枝

网络剪枝方法通过修剪模型中的冗余参数以获得更为紧凑的模型,在过去几年中得到了广泛研究[1,2]。然而,并非所有方法都能直接应用于LLM。首先,模型规模和复杂性不同。LLM的模型规模远超传统的深度学习模型,直接将常规的剪枝方法应用于LLM,可能会导致模型性能的大幅下降,或者剪枝效果不明显。其次,剪枝的再训练成本高。

剪枝通常需要对剪枝后的模型进行再训练(Fine-tuning)以恢复性能,但LLM的再训练计算开销极大,尤其是需要大规模的数据和硬件资源。第三,剪枝的效率收益不确定。对于传统剪枝方法而言,剪掉某些参数或神经元能够明显减少计算量并提高推理速度。但LLM的计算负载往往依赖于底层的实现和架构(例如GPU或TPU的高效利用),剪枝方法是否能带来实际的推理效率提升需要进一步评估。

为了应对这些挑战,近年来一些针对LLM特性的剪枝方法逐渐兴起,主要包括结构化剪枝和非结构化剪枝。结构化剪枝[3-5]通过移除特定的网络组件(如完整的注意力头或多层感知器层)来压缩模型,同时保留网络的整体结构,从而促进硬件的高效加速。

例如,Deja Vu[6]利用上下文稀疏假设,在不修改预训练模型的前提下,修剪了部分注意力头和多层感知器(Multilayer Perceptron,MLP)的冗余参数。由于结构化剪枝移除的是完整的网络组件,因此可以显著提高硬件的利用效率,尤其是在GPU和TPU等加速器上。同时,结构化剪枝通常更易于实现和集成,因为它遵循网络的整体结构,减少了复杂性。但是,由于结构化剪枝算法基于对网络组件的裁剪,可能无法充分利用网络中每个参数的冗余性,导致剪枝效果不如预期。同时,剪除整个组件可能导致一些重要的参数也被移除,从而影响模型的性能。

相比之下,非结构化剪枝[7-9]则不考虑网络内部的结构差异,直接对单个权重或神经元进行剪枝。PowerInfer[10]假设稀疏激活的神经元的访问存在偏差,利用不同神经元的访问特性使GPU和CPU分别处理不同的神经元。Mishra等人[11]将非结构化剪枝推广至半结构化N:M稀疏性,借助NVIDIA稀疏张量核心(Sparse Tensor Cores)实现显著推理加速。

LoSparse[12]和 DSFormer[13]基于低秩分解,采用一个小的密集矩阵和一个稀疏的半结构化矩阵近似模型权重。Flash-LLM[14]则为使用张量核心的非结构化修剪提供了内存高效的稀疏矩阵与矩阵乘法(SpMM)实现。非结构化剪枝允许对单个权重或神经元进行剪枝,可以更精细地控制模型的稀疏性,最大限度地减少冗余。然而,非结构化剪枝是针对单个权重,因此剪枝后通常需要对模型进行再训练,以恢复性能,这在LLM中可能带来较大的计算开销。同时,非结构化剪枝的实现和优化相对复杂,需要更多的调试和调整,以确保剪枝效果和模型性能的平衡。

2.1.2   低精度量化

低精度量化是一种通过减少模型中参数和计算的数值精度来降低LLM在推理时的存储和计算开销的技术。它通过使用更少的位数来表示浮点数(如从32位浮点数转换为16位浮点数/8位整数/4位整数或混合精度)以减少内存占用并加速计算,从而在不显著损害模型精度的前提下提升性能。

LLM的低精度量化主要包括量化感知训练 (Quantization-Aware Training,QAT)和训练后量化(Post-Training Quantization,PTQ)。量化感知训练在训练阶段考虑量化的影响,通过模拟量化误差来优化模型,能够显著提高低精度量化模型的精度。例如,LLM-QAT[15]是一种量化感知训练方法,通过利用预训练模型生成的结果进行知识蒸馏,在保持原始模型输出分布的同时降低模型大小。训练后量化是在训练完成后直接对模型进行量化。训练后量化的计算量较小,适用于硬件受限的环境。Smoothquant[16]和ZeroQuant[17]是基于8位权重—8位激活的训练后量化方法。Smoothquant通过在离线期间将缩放方差从激活迁移到权重,降低了激活的量化难度。ZeroQuant使用token-wise量化并动态计算每个token的最小/最大范围,减少了激活引起的量化误差。LLM-FP4[18]基于训练后量化,将LLM中的权重和激活量化为4位浮点数。LLMFP4通过寻找最优量化参数构建了一个强大的浮点—训练后量化基准,并提出了每通道激活量化,解决了激活分布带来的量化困难。

量化感知训练将量化过程集成到LLM的训练过程中,使模型能够在训练阶段适应低精度表示,从而减少量化引起的精度损失。因此,量化感知训练通常能够提供比训练后量化更高的准确性,尤其适用于精度要求较高的场景。相较之下,训练后量化是在LLM训练完成后对其参数进行量化,过程中无需修改模型架构或重新训练,计算量较小,适合于易用性要求较高且训练资源有限的场景。

2.1.3   知识蒸馏

知识蒸馏的核心思想是利用一个较大且性能优越的“教师模型”(Teacher Model)来监督训练一个较小的“学生模型”(Student Model)。通过将教师模型的输出(例如预测概率或特征)作为参考,学生模型可以学习到类似的知识,从而在保持性能的同时减少模型的参数量和计算开销。早期的大多数研究基于白盒蒸馏[19-21]。学生模型能够直接看到教师模型的具体内部细节,包括各层的参数、激活值等。这种方法能够较好地捕捉教师模型的内部特征,并对学生模型进行较为细致的指导。例如,DistilBERT[19]通过结合语言建模、蒸馏和余弦距离损失的三重损失,学习利用教师模型所学习到的归纳偏差。Minilm[20]通过引入“助教”以进一步促进对教师模型的蒸馏。黑盒蒸馏(Black-box Distillation)则不需要访问教师模型的内部参数和具体细节,该方法通常依赖于教师模型的输出(例如给定输入时的预测分布或得分),学生模型通过模仿这些输出来进行学习,例如WizardLM[22]和Alpaca[23]。黑盒蒸馏的优点在于它的适用性更广,即使教师模型是闭源的或保密的,只要可以获取输出,依然能够进行蒸馏。

2.2   运行时优化

2.2.1   KV-Cache优化

在基于Transformer架构的大型语言模型推理过程中,自注意力机制起着至关重要的作用。该机制通过计算每个输入元素与其他所有元素(即键,Key)的关系,对其对应的值(Value)进行加权求和。然而,当处理长序列时,每一步都需计算所有历史步骤中的键和值,导致计算开销巨大。特别是在增量解码过程中,由于KV缓存(Key-Value Cache)的内存动态变化且难以预估,像Faster Transformer这样的简单方法通常假设最大序列长度并预先分配一块连续内存,这样做会造成严重的内存浪费。为了解决这一问题,KV Cache技术应运而生,KV Cache技术通过缓存已计算的Key和Value矩阵,避免在自回归生成过程中重复计算,从而显著提升推理效率,是目前端侧部署LLM最常用的优化技术之一,例如llama.cpp[24]和mlc-llm[25]。

然而,随着批处理大小的增加,KV Cache的显存需求也大幅上升,这成为了一个亟待解决的难题。对此,研究人员提出了多种方法来压缩KV缓存。(1) 优化用于注意力机制的键/值对:这类方法通过对注意力机制的改进减少需要缓存的键/值对的数量。GQA[26]引入了一种通过多个注意力头共享键值矩阵的创新方案,减少了需要缓存的矩阵数量。SpecInfer[27]则通过树形注意力机制和深度优先树遍历,避免了为多个共享相同前缀的输出序列分配重复的KV缓存。Ge[28]研究了一种根据不同注意力结构,智能构建键值矩阵缓存的方法。Brandon等人[29]提出跨层注意力机制,通过在相邻层之间共享键和值的头,以降低KV缓存大小。(2) 压缩token:这类方法专注于通过压缩和选择性存储token来减小KV缓存的内存消耗。Li等人[30]和Mu等人[31]通过压缩token的方式来节省内存消耗。Ren等人[32]进一步提出了逐步压缩token以减少KV缓存长度的技术。Xiao等人[33]提议仅在KV Cache中保存初始和最近的token的键值,从而节约内存空间。(3) 缓存驱逐与内存管理:该类方法通过改进KV缓存的管理和驱逐策略来降低显存需求。Zhang等人[34]提出了一种动态的KV Cache驱逐策略,只保留少量KV Cache在内存中。Wu等人[35]将所有层的查询与顶层的键值进行配对,这样就无需缓存或计算顶层以外层的键值,从而节省了内存消耗和计算量。此外,Kwon等人[36]从GPU内存管理的角度出发,针对KV Cache系统中存储碎片化和难以估计的动态键值缓存问题,提出了Paged Attention技术。该技术借助操作系统的分页机制来管理键值缓存,有效减少了KV Cache的显存占用。

2.2.2   混合专家

混合专家(Mixture of Experts,MoE)的核心思想在于将一个大模型的神经网络划分为多个较小的不同子模型网络(即专家,Expert),在推理过程中由门控网络选择并激活特定的专家进行计算,从而减少计算资源的使用。混合专家的优化技术主要利用的是神经网络的稀疏性,即在特定层中,神经网络可能表现出高度稀疏性,即部分神经元的激活频率显著低于其他神经元。换言之,许多神经元在每次推理过程中并不会被频繁激活,这与人类大脑中神经元的工作机制具有一定相似性。然而,MoE架构需要较多的内存来容纳众多专家,因此其内存效率较低,相较于传统计算密集型的LLM,在部署基于MoE的LLM时带来了系统层面的挑战。为了解决MoE在推理时内存效率低的问题,SwapMoE[37]针对MoE架构中的空间稀疏性和时间局部性特性,选择在内存中仅保存一部分重要的动态专家,同时使用重要性感知调度器来维持动态专家与实际专家之间的映射关系。DeepSpeed-MoE[38]则通过混合使用张量并行、数据并行和专家并行的策略,并对系数张量和门控算子进行了优化,进一步提升了效率。EdgeMoE[39]采用了一种新的存储策略,将非专家权重保存在设备内存中,而将专家权重存储在外部存储中,只有在被激活时才将它们加载到内存中。为了进一步减少专家的I/O交换开销,EdgeMoE实施了专家级位宽自适应技术来压缩权重,并预加载预测即将被激活的专家到计算I/O管道,从而优化执行流程。Song等人[40]对基于MoE的LLM进行了稀疏性分析,发现专家内部的前馈神经网络仍然具备稀疏激活的潜力。通过将MoE与基于dReLU的稀疏激活技术结合,模型稀疏度可以提高到90%,在维持性能的同时实现了2至5倍的推理速度提升。

2.2.3   内核算子优化

内核算子优化是加速LLM推理的一种重要策略,旨在通过减少计算过程中的访存次数和内核启动的耗时来达到提升模型推理性能的目的。特别是在边缘计算场景下,如本地部署的个人LLM代理,通常会进行小批量或单批量的推理。研究显示,随着序列长度的增加,基于Transformer的注意力计算会成为推理性能的瓶颈。这是因为注意力机制的复杂度随序列长度的平方增长,而前馈网络(Feedforward Neural Network,FFN)的复杂度则与序列长度呈线性关系。因此,降低内核启动和内存访问带来的开销显得尤为重要。

目前,业界针对LLM中Transformer架构的特点, 广泛开展了算子手动融合优化。典型的实现包括DeepSpeed[41]、FasterTrans former[42]、TurboTransformers[43]、LightSeq[44]和ByteTransformer[45]等。这些框架的算子融合优化主要集中在四个方面:(1) 归一化层与QKV横向融合:将三次计算Query、Key、Value的操作合并为一个算子,并与前面的归一化操作相融合;(2) 自注意力计算融合:将自注意力计算中涉及的多个算子融合成一个,如FlashAttention[46];(3) 残差连接、全连接层和激活层融合:将MLP中第一个全连接层及其相关算子合并为一个操作; (4) 偏置和残差连接的融合。这些算子融合通常需要定制化的算子内核实现,因此对底层代码的编写要求较高。随着编译器技术的应用,如TVM的引入,算子融合也逐步实现了自动化或半自动化。

2.3   端边云协同

尽管模型压缩技术和运行时优化技术可以在一定程度上提高LLM在端设备上的运行效率,但由于端设备资源受限,端侧模型往往需要牺牲掉一部分能力。为了弥补端侧模型的性能损失,端边云协同技术提供了有效的解决方案。端边云协同不仅可以利用云端和边缘端的计算能力来弥补端设备的不足,还能通过多个端设备之间的协作实现更高效的资源利用。这种协同机制使得多个设备能够共享计算负担与数据,从而提升整体系统的性能和响应速度,增强对复杂任务的适应能力。本文主要介绍云边端协同推理和协同训练技术。

2.3.1   协同推理

现有的协同推理方式主要有模型拆分和大小模型协同两种方法。模型拆分方法对大模型做模块化拆分,并根据不同设备的算力约束将大模型的子模块部署在不同设备上,通过子模块的协同完成推理任务[47-50];大小模型协同方法通常在端设备上部署轻量级小模型,在云端部署大模型,借助大模型的强大能力提高端侧的推理效果[51-53]。

模型拆分推理的一种常见形式是将端侧的一部分模型推理任务转移到云端或者边缘端,在端设备和服务器上分别部署划分后的子模型,该方法能够卸载计算密集的LLM推理任务,从而有效减轻端设备的计算压力,同时保持模型的推理性能。该方法通常在端设备上基于用户原始数据执行子模型推理,然后将子模型输出的中间特征上传到云端或者边缘端服务器,由服务器完成剩余子模型的推理计算。在这种模式下,端设备不需要将隐私敏感的原始私有数据上传到云端,因此,该模式不仅能有效地减轻端设备的计算压力,还有效地缓解了数据隐私问题。在模型拆分推理中,如何在端设备和服务器之间合理地划分模型,以及如何降低端设备与服务器之间的数据传输开销,是两个备受关注的问题。合理的模型划分能够确保计算任务在资源受限的端设备与服务器之间的高效分配,从而优化整体推理性能。同时,降低数据传输开销可以有效减少带宽消耗和延迟,提升系统的响应速度和用户体验。

模型拆分主要有两种实现方式。一种是多节点协同的方式,例如将大模型划分为多个子模块,并根据不同设备的算力资源将多个子模块部署在不同设备上[48,49];另一种是端边云协同的方式,在该模式下,模型中计算需求较高的模块或参数量较大的模块通常会被卸载到云端或者边缘端部署执行,以缓解端设备的计算和存储压力[54,55]。为了降低协同推理的通信开销,子模型的中间输出特征可采用量化、剪枝、融合等技术进行压缩,以降低数据传输量。例如,Cao等人[56]采用量化技术将模型特征压缩为1位向量表示,Goyal等人[57]采用剪枝技术消除冗余向量,Bolya等人[58]提出合并相似tokens的特征。

模型拆分推理方法需要在多个设备之间交换高维的中间特征,因此面临通信成本的挑战。为了克服这一挑战,大小模型协同方法可以应用于LLM的协同推理中,让端侧小模型与云端大模型协同实现高效的推理。大小模型协同推理方法在端云协同架构中,充分发挥了端设备的灵活性与云端资源的强大计算能力,从而实现高效的推理过程。这一方法通常在端设备上部署轻量级小模型,以满足资源受限的环境需求,而将更复杂、计算密集的大模型部署在云端。通过这种方式,端设备不仅能够处理基础的推理任务,还能在需要时依赖云端的大模型以实现更高的性能。在实际应用中,大小模型协同推理具有多项显著优势。首先,它能够有效减轻端设备的计算负担,确保设备在处理复杂任务时的响应速度。此外,利用云端模型的强大能力,大小模型协同推理能够实现更高的推理精度,使得系统在处理复杂数据时表现出色。为了进一步提升推理效率,现有研究提出了多种优化策略。例如,投机采样(Speculative Decoding)方法[51]通过先让小模型生成初步结果,再利用大模型的能力来验证并更正小模型生成的tokens,从而加快整体推理速度;Wang等人[52]提出的策略则是只将小模型预测不准确的任务传递给大模型执行,这样不仅降低了通信开销,还能使得计算资源得到更有效的利用;Xu等人[53]提出将小模型的推理结果作为context的一部分加入大模型的输入中,使得大模型能够借鉴小模型的初步结果,从而提高推理精度。

2.3.2   协同训练

现有的协同训练模式主要有端侧微调[59]、联邦学习(Federated Learning)[60]和拆分学习(Split Learning)[61]等方法。

大语言模型在云端利用大规模的数据进行全面的预训练后,便具备了广泛的知识基础和良好的泛化能力。然而,当大模型实际应用于特定领域的特定任务时,往往还需要利用特定领域的数据进行微调,以提升大模型在特定领域的性能和适应性。针对一些数据隐私性较高的领域,端侧微调方法将预训练大模型下载到终端设备上,利用端设备本地的私域数据进行微调,从而在保护数据隐私的前提下提升大模型在特定任务上的性能。为了降低LLM的微调成本,端侧微调可采用高效参数微调(Parameter-Efficient Fine-Tuning,PEFT)的方式。例如,Houlsby等人[62]提出的适配器微调(adapter tuning)方法将适配器层插入到模型中,在微调过程中只更新适配器层的参数而保持原始大模型的参数冻结。提示微调(prompttuning)方法[63]将下游任务的训练目标转换为类似于预训练阶段的形式,通过在原始输入之前加入可训练的提示向量实现微调。Hu等人[64]提出的LoRA方法在模型训练期间优化了权重更新矩阵的低秩分解。为了进一步降低LLM的微调开销,Xiao等人[65]提出通过适配器微调方法微调压缩后的LLM,再将适配器参数插入原模型,以实现在不暴露原始数据前提下的大模型微调。

端侧微调方法无需暴露端设备的原始私域数据,因此能较好地保护数据隐私。然而,单个设备的数据量有限,从而影响模型的微调效果。为了解决这一问题,联邦学习[60]方法提出一种“数据不动模型动”的学习范式,使得多个节点之间可以在不共享私域数据的情况下,通过本地训练模型共享模型参数的方式,实现多节点之间大模型的协同微调。然而,由于大模型的参数量巨大,联邦学习方法共享模型参数的方式引入了高昂的通信开销。为了解决这一问题,现有研究将高效参数微调方法引入联邦学习中[66]。这些方法冻结了预训练大模型的大部分权重,只在设备端利用参数高效的微调方法更新少量的大模型参数,并且只有设备端上更新的参数被传输到服务器进行聚合。与全参数联邦微调方法相比,该方法可以降低大模型联邦微调的内存、计算和通信资源。

端侧微调和联邦学习方法均需要端设备在本地微调大模型,这对于终端设备而言仍面临较大的资源挑战。为了突破这一局限性,拆分学习将模型划分为多个子模块,部署在多个设备上实现协同模型更新。在端边云协同学习背景下,拆分学习使得端设备仅处理本地输入数据并将生成的中间特征传输到云端或者边缘端服务器,由服务器完成后续子模块的计算与更新,再将结果返回给端设备实现模型的协同更新[67]。

3     端侧大模型展望

为了突破端设备的局限性,端边协同大模型计算已受到了学术界与工业界的广泛关注,但其研究仍处于早期探索阶段,未来研究需从多角度出发,以进一步应对资源限制、实时性、安全性及个性化需求等方面的挑战。

3.1   数据隐私与安全

随着大模型在端边协同计算中的广泛应用,数据隐私与安全性成为关键挑战。在协同模式下,端设备与云端之间的数据交互涉及大量敏感信息,包括隐私数据和模型参数等。若在传输过程中未进行有效加密或保护,数据可能遭遇中途截获、篡改、泄露等风险,尤其是在不稳定或低安全性的网络环境下。为了应对这些隐私传输风险,未来的研究方向可以聚焦于多层级隐私保护架构,结合隐私计算和分布式存储技术,建立一套从数据收集到模型训练的全生命周期隐私保护机制。例如,探索大模型中联邦学习、差分隐私和同态加密的联合应用,同时设计适应端边环境的轻量化隐私算法。此外,可信计算环境的构建也是未来重点,可通过引入区块链技术实现端边协同数据传输和模型更新的高透明度与不可篡改性。为应对日益复杂的数据隐私威胁,开发能够自动检测潜在攻击并动态调整防护策略的智能隐私保护方案将是未来的重要方向。

3.2   更先进的模型压缩技术

在端边环境中部署LLM面临计算和存储资源受限的挑战,而模型压缩技术的进步是解决这一问题的关键方向。未来的研究可以探索任务驱动的自适应压缩技术,根据应用场景的特定需求动态调整模型结构和计算复杂度。同时,可结合硬件优化技术,提出端边协同专用的大模型压缩框架。例如,利用张量分解和动态剪枝技术开发适应异构设备的模型压缩算法。此外,设计支持在线更新的模型压缩方法,使得模型在压缩后仍能高效适应边缘设备中的动态环境和任务变化。

3.3   可解释性与动态资源管理

大模型的黑箱性质使得其在实际应用中面临信任和可解释性的问题。未来的研究可以关注如何在端边协同计算中,开发出具有可解释性的大模型推理框架。特别是在医疗和金融等对决策透明度要求较高的领域,研究者可以探索如何通过边缘推理将大模型的决策过程进行可视化或解释化,使得边缘设备能够不仅输出预测结果,还能提供决策背后的逻辑和依据。未来的研究可以开发新的可解释性算法,将大模型推理结果的因果关系呈现给用户,从而增强模型的信任度,推动其在关键任务中的应用。

随着LLM在各类应用中的广泛应用,端侧部署成为提升响应速度和用户体验的重要方向。然而,端侧设备的计算资源通常有限,如何动态管理和分配这些资源以适应不同的需求,成为亟待解决的问题。未来的动态资源管理研究策略可以分为以下几步:首先,实时监测端侧设备的计算资源使用情况,包括CPU、内存、电池状态和网络状况,是动态管理的基础;其次,根据监测结果进行模型选择与调整,通过模型压缩和多模型策略确保模型在资源受限环境中的高效运行;此外,在多任务环境中,合理的任务调度与优先级管理能够确保高优先级任务获得必要的资源;最后,建立反馈机制,结合性能评估与用户行为分析,实现资源管理策略的自适应调整。通过这些策略的综合应用,可以有效提升端侧LLM的性能和用户体验。

此外,端边协同计算中合理的资源管理和负载平衡也是未来研究的关键。通过开发动态资源管理策略,端边设备能够在不同负载和网络条件下灵活调整资源分配,从而优化系统运行效率。未来研究可以结合强化学习和自动调度算法,使大模型在端边分布式环境中动态适应,确保计算资源在变化的环境中得以高效利用,进而满足泛在智能对实时性和计算稳定性的需求。

3.4   端边智能体协同决策

在大模型出现之后,基于大模型的智能体之间的协同决策呈现出一种全新的范式。由于大模型的自然语言理解和生成能力,智能体之间可以相互交流,通过多个智能体之间类似于人类一样的协同配合机制,完成更复杂的任务。代表性的工作包括AutoGen[68]、MetaGPT[69]、Co-LLM-Agent[70] 等。例如,MetaGPT[69]模拟了一个软件公司的结构,每个大模型智能体扮演一个软件公司的角色,如产品经理、软件架构师、项目经理等,这些智能体按照预先设计的规则交互并最终产出一个项目。AutoGen[68]框架则是提供了更大的灵活性,允许用户根据自己的需求定义智能体的能力、角色以及智能体之间的互动方式。在“云—边—端”协同场景下,不同的智能体可能分布在不同的计算节点上,例如智能手机、汽车、交通信号灯、边缘服务器等。在这种分布式场景下,大模型智能体的协同决策还未有相关研究。例如,在“云—边—端”协同场景中,如何针对异构设备设计高效的通信与决策协议,实现大模型智能体的动态协作。结合不同端边智能体的异构特征和网络架构实现高效的多智能体协同将极大提高大模型智能体的决策效率并拓展其应用范围。

3.5   大模型分层协同计算架构

未来端边协同大模型计算的一个重要方向是分层计算架构的研究。大模型通常非常庞大,难以在单一层级的设备上高效执行。未来研究可以探讨如何通过分层学习框架,将大模型的不同层级任务分配到边缘设备和云端。这样可以有效利用边缘设备的低延迟优势,同时依赖云端的强大计算能力完成复杂计算。通过分层协同架构,边缘设备负责实时性要求高的任务,而复杂推理和模型更新则由云端处理。这种分层设计可以极大提升大模型在实际应用中的效率,尤其是在智能交通和智慧城市等复杂动态环境中实现实时决策和预测。此外,跨平台协作在未来的研究中具有广泛应用潜力:通过多模态数据融合,如文本、图像和音频等多源数据的集成,将为大模型提供丰富的信息上下文,支持其在端边环境中完成更加复杂、全面的智能决策。

3.6   端边大小模型协同优化

大模型由于其巨大的计算和存储需求,往往难以直接部署在边缘设备上。未来的研究可以聚焦于如何通过知识蒸馏等技术,将大模型的知识转移到轻量级模型中,使得这些小模型能够在边缘设备上高效运行。知识蒸馏通过让小模型学习大模型的输出,能够在大幅减少模型复杂度的同时,保持较高的性能。在此基础上,开发能够实时学习并优化知识迁移过程的算法,以进一步降低端边协同推理中的资源消耗,特别是在资源受限的应用中(如无人机或嵌入式设备),如何通过大小模型协同提升系统整体性能也是值得关注的研究问题。

4      总   结

本文系统性地介绍了大语言模型迈向泛在智能面临的挑战、技术进展以及发展趋势。在当前的人工智能发展背景下,大模型向泛在智能的迈进已成为一种重要趋势。然而,端设备由于资源的固有局限性,其在大模型的纯端侧应用中面临诸多挑战,尤其是模型的泛化能力难以得到充分保障,这使得单纯依赖端侧的应用路径显得不够明朗。因此,端边协同或端云协同成为了保障端侧性能的关键策略。然而,在复杂的算力环境和网络环境下,协同智能计算仍然面临许多亟待解决的问题,例如如何高效分配计算资源、降低数据传输开销以及提高系统响应速度等。这些问题的解决将为大模型的广泛应用奠定基础。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐