训练效率提升50%以上:GooseFS 写缓存及其在具身智能数据处理中的应用
在具身智能场景中,数据处理业务交付周期紧张时,提升任务并发容易触发对象存储流控,影响处理效率。引入 GooseFS 写缓存方案,利用高性能缓存层加速数据处理链路,可显著提升持久化效率。某具身智能企业引入 GooseFS 写缓存方案后,训练效率提升 50% 以上,整体存储成本降低约 70%。本文将从瓶颈分析、架构解析、最佳实践和模式泛化四个维度解析该方案。
一、瓶颈分析:对象存储在具身智能数据处理管道中的写入挑战
在具身智能场景中,对象存储 COS 凭借低成本、高可靠和无限扩展的特性,天然适合作为海量原始数据和各个阶段数据处理结果的存储底座。然而,在数据处理管道这一核心环节,对象存储 COS 面临严峻挑战:
- 数据交付时效压力:具身智能客户需在约定周期内完成大批量数据处理与交付。随着数据规模增长,业务需要通过提升任务并发压缩处理周期,对数据基础设施的并发承载能力提出更高要求。
- 计算与持久化强耦合:原架构下处理结果直接写入 COS,计算进度受对象存储持久化速度制约。高并发下若出现流控、长尾延迟或请求超时,可能进一步导致任务失败,影响整个处理作业的稳定性。
- 中间数据频繁变更:多阶段数据处理会持续生成临时文件,并伴随 Rename 等文件操作。若中间状态频繁落入 COS,Rename 等操作会带来额外的数据复制和删除,增加数据搬迁和 I/O 开销。
为了缓解上述问题,业界传统的做法是自建全闪分布式文件存储作为中间层,先将热数据暂存于高性能存储,再异步持久化至对象存储。但这种方案存在以下缺陷:
- 硬件成本高昂:全量部署全闪分布式存储需要较高硬件投入,而数据处理过程中仅中间结果和热点数据需要高性能读写,原始数据及归档数据对高性能存储的需求相对有限。
- 数据流动依赖人工调度:数据从高性能层到 COS 的流动,通常依赖用户自建的脚本或调度任务。不仅开发维护成本高,且难以实时感知数据的冷热状态和持久化进度。
因此,具身智能数据处理基础设施需要一种轻量级、低成本且自动化的加速方案。GooseFS 写缓存方案利用"透明缓存"理念,在 TKE 集群中挂载 GooseFS 作为缓存数据层,依托 NVMe SSD 构建高性能写入缓冲池,既能满足多任务级联处理对 I/O 的性能需求,又能通过后台自动化的异步搬迁任务释放缓存空间,从而在消除吞吐瓶颈的同时,将整体存储成本降至最低。
二、架构解析:GooseFS 写缓存在具身智能场景中的核心设计
GooseFS 是腾讯云面向 AI、大数据等高性能计算场景提供的分布式缓存加速服务,以 COS 作为统一存储底座,在计算侧通过高性能缓存提升数据访问效率。传统场景下,GooseFS 主要通过读缓存能力,将 COS 中的热点数据按需加载至缓存,使计算任务能够就近高速读取,降低重复回源带来的访问延迟和带宽压力。
随着 AI 数据处理链路从"高频读取"逐步演进为"多阶段读写交替",计算过程中会持续产生大量中间结果,仅依靠读缓存已无法解决高并发写入带来的对象存储流控和任务阻塞问题。因此,GooseFS 在原有读缓存能力基础上进一步增加写缓存能力,将处理结果优先写入高性能缓存层,再通过后台异步机制持久化至 COS,实现计算与持久化过程解耦。
GooseFS 写缓存是专为 AI 等高吞吐数据处理场景设计的透明加速层。其核心设计理念是以 COS 为统一存储底座,在计算集群内部署 GooseFS 分布式缓存层承接高频读写 I/O,再通过异步机制将处理完成的数据持久化至 COS。该功能旨在通过"削峰填谷"策略,消除 COS 带宽波动对上层计算任务的影响,确保 GPU 算力不因 I/O 等待或写入失败而闲置。

在具身智能企业的落地架构中,数据流转如下:
- 数据写入 GooseFS:客户端把文件拆成固定大小的数据块(Block),并行发往 3 个 Worker 节点的本地 SSD,至少 2 副本写成功即返回"写入完成"。负责元数据的 Master 同时记录这次操作的日志和迁移标记,并通过 Raft 协议同步到备用 Master。主 Master 故障时备节点秒级接管,训练不中断。
- 读取写缓存文件:读请求先经 Master 查询 Block 位置,未迁移到 COS 的文件由 Worker 供读。如果数据已经迁移到了对象存储,则由 Worker 从 COS 读取数据。数据写完立刻可被下游读取,无需等待持久化完成,实现"写后即读"。
- 后台异步持久化入对象存储:Master 定期筛出待迁移文件生成批量任务,多个 Worker 通过心跳拉取任务并行执行,经短路读直接读取本地磁盘中的 Block,并分块上传 COS,减少跨 Worker 流量及后台持久化对前台带宽的影响,完成后更新持久化状态。
- 数据一致性与可靠性保障:GooseFS 在写缓存链路中通过多副本机制保障缓存数据可靠性,并提供端到端 CRC 校验。在客户端写入阶段即计算数据校验值,数据异步持久化至 COS 后再次进行校验,确保业务写入数据与最终落入 COS 的数据保持一致,在提升写入效率的同时保障数据安全。

针对具身智能数据处理场景的痛点以及传统场景的不足,GooseFS 写缓存提供了以下针对性解决方案:
- 针对"数据交付时效压力"问题:数据处理任务直接将结果写入 GooseFS 高性能缓存层,业务前台无需与对象存储的瞬时写入速度强绑定。当交付周期较紧、任务并发快速提升时,可由 GooseFS 优先承接突发写入流量,再通过后台异步任务平滑持久化至对象存储,降低存储侧波动对整体数据处理进度的影响。
- 针对"吞吐毛刺与流控"问题:GooseFS 通过高性能缓存优先承接业务写入,并采用动态流控机制协调前台业务与后台持久化任务。业务高峰期优先保障前台读写,业务低峰期利用闲置带宽加速数据迁移至 COS,在保障业务处理效率的同时,实现数据安全持久化。
- 针对"频繁文件操作"问题:具身智能数据处理过程中会频繁生成临时文件并执行 Rename 等操作。GooseFS 可先在缓存层完成文件写入和快速 Rename,待文件状态稳定后再异步持久化至 COS,减少对象存储侧重复的数据搬迁和额外 I/O 开销。
- 针对"运维复杂度高"问题:提供透明缓存,支持透明分层与自动退避。当写缓存池未满时提供极速体验;一旦容量达到上限或数据盘出现故障,自动平滑退避至直写对象存储模式,确保业务永不中断,无需人工干预降级。
- 针对"数据流动性差"问题:处理完成后的 Zarr 结果文件由 GooseFS 在后台异步写回 COS,自动完成持久化,无需手动调度数据流转任务。同时 GooseFS 提供持久化查询工具,可通过入参目录或文件路径,查询数据的持久化状态,有助于下游训练任务快速确认数据就绪。
- 针对"全闪存储成本高"问题:全量数据持久化在 COS 上,GooseFS 主要承担数据处理期间的高性能缓存与读写加速能力,相比用同等性能的全闪分布式存储覆盖全部数据量,硬件投入大幅下降,整体存储成本较自建方案降低约 70%。
三、最佳实践:GooseFS 写缓存在具身智能数据处理场景中的性能表现
客户背景
某国内领先的具身智能企业,专注于机器人感知与操控技术的研发,其数据处理平台承载从物理世界采集到模型训练的完整数据闭环。该客户的各阶段持续读取原始数据并产生新的处理结果,整体数据处理规模大、并发任务多。同时需要根据下游业务要求,在约定周期内完成特定数据集的处理和交付,对数据基础设施的吞吐能力和任务稳定性提出较高要求。
痛点描述
该客户原有架构采用计算节点直写对象存储 COS。在实际运行中暴露出三大核心问题:
- 数据交付周期紧:客户部分业务需要根据数据需求完成特定场景数据的采集、处理与交付,处理任务存在明确的交付周期。在数据量持续增长的情况下,为缩短整体处理时间,业务需要通过提高任务并发提升数据处理速度。
- 高并发写入触发 COS 流控:在一次约 70 小时数据的处理任务中,为赶交付进度,客户主动提升任务并发,大量处理结果在短时间内集中写入 COS。并发持续提高后触发 COS 流控,部分写入请求出现超时甚至导致任务失败,对整个处理作业的稳定性造成影响。
- 多任务带宽争抢:十多个子任务同时运行时,会持续产生大量存储 I/O。当多个任务集中直接写入 COS 时,存储侧的瞬时压力被进一步放大,流控触发后部分任务写入被抑制,形成"慢者更慢"的恶性循环,GPU 资源长期处于 iowait 状态。
改造方案
该客户引入 GooseFS 写缓存方案进行改造:将 COS 作为统一存储底座,通过全托管 GooseFS 构建高性能缓存层,TKE 中的数据处理任务统一挂载 GooseFS 并直接通过 GooseFS 访问数据。
任务读取 mcap 等原始数据时,直接读取 GooseFS,由 GooseFS 自动从 COS 加载并缓存。处理期间产生的中间数据统一读写 GooseFS,依托 GooseFS 写缓存获得接近本地存储的读写性能。处理完成后的 Zarr 结果文件,再由 GooseFS 异步写回 COS,自动完成持久化。业务代码无需任何修改,只需将数据读写路径指向 goosefs-mountpoint 即可完成接入。

方案收益
方案上线后,该客户在处理效率、存储成本和吞吐稳定性三方面均获得明显收益:
- 训练效率提升 50% 以上:模型迭代周期从此前的数月压缩到数周,多数据处理并行任务不再因存储侧带宽争抢互相阻塞。GPU 算力的有效利用率大幅提升,相同的算力投入下,模型迭代速度显著加快。
- 整体存储成本较自建方案降低约 70%:原始数据及各处理阶段结果最终均持久化在 COS 中,GooseFS 主要承担处理过程中的高性能缓存与读写加速。相比用同等性能的全闪分布式存储覆盖全部数据量,硬件投入大幅下降。
- 数据处理吞吐稳定达到业务目标:单次预处理任务在 2 小时内完成累计时长 1000 小时、约 30TB 的具身数据处理。耗时稳定达到业务预期,有效消除因直写 COS 流控导致的任务失败,十多个子任务的级联管道不再因存储 I/O 成为瓶颈。
四、模式泛化:写缓存模式在其他数据处理密集型场景的应用探讨
GooseFS 写缓存模式还可以广泛适用于任何面临 I/O 限制的数据密集型场景。具身智能案例中验证的"对象存储为底座、缓存层加速读写、写缓存保障持久化"的架构范式,在以下场景同样适用:
自动驾驶:多传感器数据融合与回放
自动驾驶的数据处理管道与具身智能高度相似——从路测采集的激光雷达、摄像头、毫米波雷达等多源数据,需要经过标注、融合、回放等一系列子任务。每个子任务产生大量中间文件,任务间存在强依赖。利用 GooseFS 异步写,计算节点将中间数据快速写入本地 NVMe 缓存,下游任务即时消费,处理完成后的标注结果和回放数据由后台异步写回 COS。GPU 不再因 I/O 等待而闲置,数据闭环的整体吞吐大幅提升。
AI 大模型训练:非阻塞式 Checkpoint 与数据预处理
在大语言模型和视觉大模型的训练中,数据处理与模型训练同样面临 I/O 瓶颈。海量训练数据的预处理产生大量中间结果,定期保存的 Checkpoint 文件可达数 TB。利用 GooseFS 异步写,数据预处理任务的中间结果和 Checkpoint 文件先写入缓存层,毫秒级完成确认后计算任务立即恢复。后台异步持久化过程对训练完全透明,显著提升集群的有效训练时间。
科学计算与工业仿真:海量时序数据的级联处理
在气象模拟、流体力学仿真、基因组学分析等科学计算场景中,数据处理管道同样呈现多任务级联、海量中间数据、长周期计算的特征。以基因组学为例,从原始测序数据到变异检测结果,需要经过质控、比对、排序、去重、变异检测等多个子任务,每个子任务产生数 TB 的中间文件。GooseFS 异步写方案可在此类场景中扮演高性能数据总线角色,使各子任务以接近本地存储的速度读写数据,处理完成后的结果自动归档至对象存储,兼顾性能与成本。
五、总结
从具身智能到自动驾驶,从大模型训练到科学计算,对象存储 + 高性能缓存层的双层架构正在成为数据密集型场景的通用范式。GooseFS 写缓存方案以 COS 为低成本持久化底座,以分布式缓存层为高性能读写引擎,通过自动化的异步写回机制打通数据流动的"最后一公里",在性能、成本、运维复杂度三者之间取得了精妙的平衡。
该具身智能企业的实践表明:训练效率提升 50% 以上、存储成本降低约 70%、单次 30TB 级数据预处理稳定在 2 小时内完成——这些数据是经过生产环境验证的真实结果。在算力日益昂贵的今天,"I/O 不阻塞计算"的架构理念,将成为企业降本增效、充分释放 GPU 算力潜能的关键杠杆。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)