【AIGC】常见数据量
·
| 说法 | 200k 的含义 | 换算 |
|---|---|---|
| 200k clips(片段) | 最常见的说法,通常单片段 2–10s | ≈ 110–550 小时 |
| 200k videos(长视频/源视频) | 一个长视频能切出 10–50 个 clip | ≈ 2M–10M clips |
| 200k 小时 | 工业级预训练量级 | 相当于 InternVid 的 1/4 |
绝大多数论文说"200k"指的是 clip 数,也就是约几百小时的有效视频。下面按这个理解讨论。
二、视频生成常用数据集的规模谱系
| 量级 | 代表数据集 | 规模 | 典型用途 |
|---|---|---|---|
| 10³–10⁴ | UCF-101 (13k)、Sky Timelapse、TaiChi、RealEstate10K (10k videos / 80k clips) | 千~万 | 早期无条件生成 benchmark、相机控制等专项任务 |
| 10⁴–10⁵ | MSR-VTT (10k)、DiDeMo、ActivityNet Captions (20k)、SSv2 (220k) | 万~十万 | 评测集、小规模微调 |
| 10⁵–10⁶ | MiraData (788k)、Vript (400k)、ChronoMagic-Pro (460k)、各种自建高质量集 | 十万~百万 | 高质量 SFT、domain-specific 训练、学术论文自建数据 |
| 10⁶–10⁷ | WebVid-2M (2.5M / 13k h)、OpenVid-1M、VidGen-1M、WebVid-10M (10.7M / 52k h) | 百万~千万 | 开源 T2V 的主力预训练数据 |
| 10⁷–10⁸ | Panda-70M (70.8M / 167k h)、InternVid (234M / 760k h)、HD-VILA-100M、HD-VG-130M、Koala-36M、CogVideoX (35M clips + 2B imgs) | 千万~亿 | 基座模型预训练 |
| 10⁸–10⁹ | SVD 的 LVD (580M→筛到 ~150M)、Movie Gen (~100M videos + 1B imgs)、Wan (候选池 1.5B videos + 10B imgs) | 亿级 | 大厂闭源/半开源基座 |
三、结论:200k 是什么位置
**200k clips ≈ 中等偏小规模。**具体"大不大"完全取决于你要干什么:
| 场景 | 200k 够不够 | 说明 |
|---|---|---|
| LoRA / 概念注入 / 风格化 | 远超需求 | 几百~几千条就够 |
| 特定任务微调(数字人、相机控制、视频编辑、I2V 适配、ControlNet 类) | 绰绰有余,甚至偏多 | 这类工作常见是 10k–100k |
| 在预训练基座上做高质量 SFT / 审美对齐 | 正合适,属于"好数据"的合理量级 | 业界这一阶段常用 100k–1M 精筛数据 |
| 训练一个 domain-specific 小模型(如只做人脸/风景/游戏画面) | 基本够用 | 低分辨率 + 窄域可以出效果 |
| 从零训通用 T2V 基座 | 明显不够 | 差 1–2 个数量级,泛化能力和文本对齐会很弱 |
一句话:在"微调/后训练"语境下,200k 算得上不小;在"预训练"语境下,200k 只是入门量级。
四、几个比数量更该关心的指标
视频领域"条数"是个很有欺骗性的指标,建议换算成下面这些:
1. 总时长 / 总帧数
200k × 5s × 24fps ≈ 2400 万帧。作为对比,LAION-5B 是 50 亿图。所以从"帧"的角度看,200k clip 相当于一个中小型图像数据集。
2. 有效 token 数(真正决定算力和信息量)
以 5s、256×256、8×8×4 压缩比的 VAE + 2×2 patchify 估算:
- 单 clip ≈ 10 latent frames × 16×16 ≈ 2.5k tokens
- 200k clips ≈ 5亿 token / epoch
这意味着如果你训 100k steps、batch 256,模型会把这 200k 数据过上百遍。微调没问题,但从零预训练时极易记忆化/过拟合,多样性不足是硬伤。
3. 数据质量的四个维度(近两年公认比数量更关键)
- 运动质量:静态镜头/PPT 式画面占比。WebVid 大量是幻灯片式素材,这是早期模型"动不起来"的主因
- caption 质量:alt-text 级(10 词)vs 结构化长 caption(100+ 词)。Panda-70M / MiraData / OpenVid 的核心贡献都是重打标注
- 单镜头性:是否做过 shot detection 切分,跨镜头 clip 会严重伤害时序一致性
- 分辨率/码率/水印:720p 无水印的 200k 可能强于 360p 带水印的 2M
经验判断:严格筛选后的 200k(长 caption + 高运动 + 单镜头 + 720p)在微调阶段的效果,通常优于未筛选的 2M WebVid。 反过来说,如果你的 200k 是原始爬取未清洗的,实际可用可能只剩 30%–50%。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)