AI训练和推理业务如何做数据容灾?
AI项目刚开始时,团队通常更关注GPU、模型和数据准备。等业务真正上线,数据保护问题才会变得具体。
- 训练集整理了几个月,丢失后很难重新制作
- 机器人现场回流数据支撑故障分析和下一轮训练
- 企业知识库的原始文档涉及权限与审计
- 生产推理还依赖模型文件、配置和规则
一次机房故障可能让训练中断,也可能让在线业务无法读取数据。
本地多副本可以处理部分磁盘和节点故障,跨机房事故仍需要异地数据副本。EDS 5.3.2 远程复制2.0 面向这类需求,支持文件存储和对象存储的异步复制,并提供计划内切换、故障切换和恢复保护能力。
一、从数据要素到数据资产,保护要求也在变化

图:根据业务价值识别关键数据,将训练集、模型、文档、轨迹和视频等重要数据复制到异地数据中心。
国家对数据的定位已经从业务运行产生的附属记录,逐步提升到新型生产要素。《中共中央、国务院关于构建数据基础制度更好发挥数据要素作用的意见》指出,数据是数字化、网络化、智能化的基础,并围绕数据产权、流通交易、收益分配和安全治理部署基础制度。文件同时提出维护数据资源资产权益、探索数据资产入表新模式。《数据二十条》
对AI企业来说,数据要素的价值很容易在业务中看到。**一套经过清洗和标注的视觉样本,可以支撑多个模型版本;机器人故障回放数据,可以用于定位问题和改进控制策略;企业知识库中的原始文档和人工问答,可以持续改善检索与生成效果。**这些数据经历采集、清洗、标注、治理和合规审核后,企业已经为其投入了大量时间和成本。
“数据要素”和会计意义上的“数据资产”仍需区分。财政部印发的《企业数据资源相关会计处理暂行规定》自2024年1月1日起施行。企业需要依据业务实质和会计准则判断,只有符合无形资产或存货定义及确认条件的数据资源,才能进行相应会计处理;不符合资本化条件的数据资源不能确认为资产。财政部暂行规定、财政部会计司解读
因此,项目中常说的“数据资产”,可以先理解为企业已经持续投入、能够支持生产经营并需要重点保护的数据资源。是否能够入表,要由财务、法务和数据管理部门按照规定判断,存储系统无法替代这项认定。
这一变化会直接影响容灾建设。过去部分AI数据被当作可重新生成的中间文件,备份优先级较低。进入生产后,原始数据可能无法再次采集,标注结果包含大量人工投入,模型检查点关系到研发进度,现场回流数据还可能承担质量追溯和事故分析责任。数据一旦损坏或长时间不可访问,带来的损失已经超过存储设备本身。
远程复制的作用,就是为这类关键数据建立跨站点副本和可执行的恢复路径。 企业在设计方案前,应先完成数据分类:哪些数据无法重新采集,哪些数据重建成本很高,哪些数据直接影响在线业务,哪些数据涉及合规和审计。分类结果决定复制范围、同步周期、保留方式和演练频率。
二、先分清楚远程复制能保护什么
文件远程复制通过快照差异识别增量,将变化同步到备端,并在备端形成对应时间点。对象远程复制根据增量事件持续同步数据。
当前版本有几个重要边界:
- 支持文件与对象存储远程复制,不支持块存储;
- 文件任务最短同步周期可设置为5分钟;
- 对象任务可选择周期同步,也可采用秒级增量的持续同步;
- 文件数据可以还原到最近一次完整复制点;
- 对象复制当前没有同样的快照还原能力;
- 备端业务客户端只能读取,不能直接写入;
- 主备两端需要满足5.3.2全闪版本、机型和授权要求。
远程复制保护的是存储数据和存储服务。应用能否恢复,还要看网络、访问地址、账号、GPU调度、数据库和启动顺序。项目方案中应分别定义存储恢复时间与业务恢复时间。
三、五类AI业务应该如何设计复制方案
场景一:保护集中训练平台的数据集和模型
企业在主数据中心建设GPU训练集群,EDS通过NFS向训练节点提供数据集、检查点和模型文件。算法团队每天都在更新样本、标签和训练结果。
可以在异地机房部署第二套EDS,对关键文件系统空间建立远程复制。文件任务根据业务允许的数据损失量设置周期。例如企业最多能接受丢失15分钟的数据,就不能沿用默认思路随意设置一小时同步,还要确认单次复制能在下一个周期前完成。
发生主站点故障后,备端升主并提供文件共享。训练平台需要重新挂载共享,任务调度器再从最近可用的检查点恢复训练。
这个场景的用户验收重点包括:大批量样本导入期间复制是否跟得上;模型检查点写入时能否形成可用的一致状态;训练任务从备端恢复时需要重新计算多少内容;恢复后的文件权限是否完整。
场景二:视觉质检和智能安防生产业务
生产系统持续写入图片、视频和分析结果,一旦主存储不可用,前端采集可能堆积,检测结果也会中断。
方案可以将生产中心的文件或对象数据复制到灾备中心。文件业务按周期复制,对象业务可根据写入模型评估持续同步。故障后,运维人员在备端执行故障切换,再将采集程序和分析服务切换到新的访问地址。
存储升主之后,业务仍可能需要修改DNS、负载均衡配置、挂载地址或S3 Endpoint。采集设备是否支持自动重连,缓存能保存多久,断开期间的数据会不会补传,都应写进容灾方案。
视觉质检还要考虑在制品。某批产品的图片只同步了一部分时,直接恢复可能导致图片、检测结果和批次记录不一致。文件复制可以选择还原到最近完整时间点,用户需要评估回滚后是否能从采集端补回数据。
场景三:具身智能现场数据汇聚到训练中心

图:工厂、仓库和户外巡检站点通过相互隔离的复制通道,将关键日志、轨迹、点云和视频汇聚到中心训练平台。
机器人分布在工厂、仓库或园区,各站点会产生视频、点云、日志、轨迹和故障回放数据。企业可能希望把多个现场的数据集中复制到一个训练中心,用于模型优化。
EDS支持多对一的集群配对,可让多个生产站点向一个中心站点汇聚数据。容灾租户可以隔离不同站点或项目的用户和复制关系,避免同名账号相互冲突。
设计时不宜把所有数据都设成相同优先级。故障日志、人工接管片段和关键任务回放可以设置更短的同步周期;普通连续录像可以按小时或批次处理;可重新生成的临时文件可以不进入远程复制。这样能减少广域链路压力。
用户需要验证多个站点同时同步时的带宽分配、中心端写入压力和租户隔离。一个站点突发上传大量视频时,不应拖延其他站点的关键故障数据。
场景四:企业知识库和RAG数据保护
知识库常由原始文档、解析结果、切分文件、索引和向量数据组成。其中一部分通过NFS保存,另一部分可能放在S3或数据库中。
传统远程复制可以保护其承载的文件和对象数据,但不能自动保证整个RAG系统的一致性。如果原始文档已经复制到新时间点,向量数据库仍停留在旧时间点,恢复后可能出现检索缺失或索引与原文不匹配。
利用“关系组”实现多目录/桶的一致性同步
对于必须保持一致的文件和对象数据,EDS 支持创建远程复制关系组:
- 统一策略管理:可将多个文件系统空间、MTree 或 Bucket 纳入同一个关系组,使它们遵循统一的同步周期和策略
- 缩短 RPO:通过设置更短的同步周期(文件最短 5 分钟,对象可达秒级持续同步),可以尽量缩小不同数据源之间的时间差。
场景五:一个生产中心保护到多个灾备位置
大型企业可能有总部训练中心、同城灾备中心和异地灾备中心。EDS支持一对多配对,可把不同容灾租户下的数据复制到不同站点。
例如,在线推理所需的模型与配置同步到同城站点,争取更短恢复时间;原始训练数据和历史归档同步到异地站点,用于应对区域级故障。两套保护链路可以采用不同带宽、周期和演练频率。
用户需要明确每个数据集的主副本位置。多站点环境下如果多个备端先后升主,后续恢复保护会涉及数据覆盖,必须由统一流程决定以哪个站点为基准。
四、故障切换时实际会发生什么

图:源端正常向容灾端复制;源端故障后由容灾端接管业务;源端恢复后,容灾端把接管期间的新数据反向同步回源端;数据追平并确认一致后,业务再切回源端。
计划内切换
计划内切换适合容灾演练、机房维护和主动迁移。操作前必须停止生产写入,执行最后一次同步,确认两端数据达到预期状态,再暂停复制任务并切换主备角色。
停止写入需要由业务负责人确认。只看到网络流量下降,不能证明所有客户端已经停写。机器人采集程序、定时任务、后台转码和算法脚本都可能继续产生数据。
故障切换
主端失联后,运维人员可以在备端执行故障切换并将其升为主。文件复制可以选择是否还原到最近一个完整时间点。如果最后一次增量只同步了一部分,直接使用当前数据可能出现业务关联不完整;还原会舍弃未完成时间点的数据,但可以选择创建一个月有效期的快照保留被覆盖内容。
对象数据没有文件快照式的还原能力,应用侧需要自行判断对象集合是否满足恢复条件。
恢复保护
原主端修复后,两端可能都处于主端状态。此时要选择数据更新且经过确认的一端作为基准,将另一端降为备端并恢复复制保护。
选择错误的基准端会覆盖较新的数据。操作前应比较两端的业务写入时间、任务状态和数据差异,必要时先创建快照或导出关键数据。
五、用户应该如何验收RPO和RTO
产品参数只能说明能力上限。用户验收要从一次真实业务故障开始计时。
1. 测出实际RPO
在主端持续写入带时间戳的文件或对象,模拟主端突然故障,然后检查备端最后一条完整数据的时间。两者差值才是本次测试的实际RPO。
文件任务即使设置为5分钟周期,实际RPO还会受到本轮同步耗时影响。对象持续同步也会受到网络抖动、事件积压和备端性能影响。
2. 从用户无法访问开始计算RTO
测试计时应覆盖故障发现、人员响应、备端升主、数据还原、网络与访问地址切换、客户端重连、应用启动和业务验证。EDS侧最短RTO可小于30秒,指的是存储侧在理想条件下提供服务的能力,不能直接等同于整个AI平台的恢复时间。
3. 使用真实应用验证数据可用性
训练场景要从备端重新加载数据集和检查点;知识库场景要执行检索并打开原文;视觉质检要让采集端重新上传并完成一次识别;机器人场景要验证日志、轨迹和视频之间的关联。
文件数量对得上,只能作为基础检查。业务能正确读取和继续处理,才算完成恢复。
4. 模拟“同步到一半”时故障
在大批量数据同步过程中断开主端,分别测试直接升主和还原到完整点。用户要确认回滚范围、未完成数据如何保留、上层应用能否识别,以及丢失的数据能否从源设备补传。
5. 测试广域链路不足和中断
限制复制带宽,模拟高时延、抖动和链路中断,观察任务积压量与追平时间。用户应知道链路恢复后需要多久追上生产写入速度。如果新增数据产生速度长期高于复制速度,灾备端会越来越落后。
6. 验证权限和配额
用业务账号在备端读取数据,核对用户、用户组和访问权限。目录配额不会随远程复制自动同步,用户配额的具体内容也要在两端检查。对依赖配额控制的AI团队,备端配置不一致可能导致恢复后写入失败或容量失控。
7. 完整演练一次回切
很多测试做到备端升主就结束了。用户还应修复原主端、执行恢复保护、重新建立复制,再按计划切回。记录每一步的负责人、判断条件和回退方法,最终形成可以照着执行的SOP。
七、方案上线前需要确认的限制
- 主备两端均需满足EDS 5.3.2全闪版本与授权要求,容量型设备和混闪版本的支持情况应单独核对;
- 当前远程复制不覆盖块存储;
- 计划内切换需要暂停生产业务;
- 备端在复制关系中对普通业务客户端只读;
- 文件与对象的恢复机制不同,对象没有文件快照式还原;
- 目录桶和共享桶暂不支持对象远程复制,需使用受支持的通用桶;
- 自建容灾租户不能使用FTP共享和数据流动;
- 存储复制不能代替数据库、调度平台和应用组件的一致性设计。
结语
AI业务容灾要保护的不只是数据副本。训练任务能否从检查点继续,采集设备能否重连,知识库索引是否匹配原文,机器人现场数据能否补传,这些问题都会影响最终恢复结果。
EDS远程复制2.0补充了文件和对象数据的跨站点保护能力,也提供了多对一、一对多和容灾租户等规划手段。
相关阅读
版本说明:文中远程复制功能边界依据EDS 5.3.2版本材料整理。正式项目应以对应版本用户手册、机型与授权清单、兼容性列表和现场容灾演练结果为准。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)