数据是AI时代的黄金-从大模型语料到具身智能
数据,AI 时代的黄金:从大模型语料到智能体轨迹,再到具身智能的“GPT 时刻”
一句话结论:AI 的能力上限 ≈ 模型能力 × 数据质量。模型能力是乘法里的一个因子,而数据质量与规模,才是决定这个乘积能否做大的硬约束。
一、一个公式,看懂三个时代的“数据鸿沟”
很多课程和分享里都提到过这个公式:
AI 能力上限 = 模型能力 × 数据质量
严格来说,这两个变量并不独立:模型本身就是“从数据里长出来的”,模型能力同样受数据规模与质量的约束(例如 Chinchilla 缩放定律指出,计算最优配置下模型参数量与训练数据量应按近似 1:1 的比例同步增长,参数再大、数据不够,能力也上不去)。但作为工程直觉,这个公式依然非常准确:在模型一侧已经逼近上限时,数据质量就是那个决定性的乘数,1×0.1 永远小于 0.9×1。
如果我们把 AI 的演进按“数据形态”切一刀,会看得更清楚:
| 时代 | 数据形态 | 数据可得性 | 获取成本 | 代表瓶颈 |
|---|---|---|---|---|
| 大模型时代 | 静态文本/代码语料 | 公开、海量、近乎免费 | 低 | 清洗与质量治理 |
| Agent 时代 | 动态交互轨迹 + 反馈 | 需要“会做事”的数据 | 中 | 环境多样、反馈稀疏、隐私合规 |
| 具身智能时代 | 物理世界感知-动作数据 | 极度稀缺 | 极高 | 真机采集慢、仿真有 gap |
大模型时代靠“读万卷书”解决了,Agent 时代需要“行万里路”,而具身智能时代,人类自己都还缺一条“物理世界的路”。下面我们逐一展开。
二、大模型时代:静态语料如何成就“通用”
2.1 数据来源举例
通用大模型(如 LLaMA、GPT 系列)的预训练语料,几乎都来自以下几类公开数据:
| 来源 | 说明 | 代表数据集 |
|---|---|---|
| 通用网页 | 非营利组织 Common Crawl 自 2008 年起每月抓取全网,存档总量超 10 PiB,单次抓取约 20 亿+页面,是绝大多数大模型的“原材料” | Common Crawl → C4、FineWeb |
| 百科与知识库 | 结构化程度高、质量稳定 | Wikipedia |
| 代码 | GitHub 公开仓库,覆盖数百种语言 | The Stack(358 种语言、约 6TB)、StarCoder |
| 书籍 | 版权过期的经典书籍与小说 | Project Gutenberg、Books3 |
| 学术论文 | 高质量的领域文本 | arXiv |
| 问答社区 | 技术问答、长尾知识 | Stack Exchange |
以开源界的 RedPajama 复现 LLaMA 语料为例,其构成就是:English CommonCrawl、C4、GitHub、Wikipedia、Books、ArXiv、Stack Exchange 七大类。海量文字 + 代码,共同让通用大模型成为现实。
2.2 示例代码
示例 1:用 Hugging Face datasets 直接加载公开语料
from datasets import load_dataset
# 加载维基百科语料(取前 1000 条做演示;数据量大时建议走流式)
ds = load_dataset("wikipedia", "20220301.en", split="train[:1000]")
print(ds[0]["text"][:300])
示例 2:解析 Common Crawl 的 WARC 原始网页存档
import gzip
from warcio.archiveiterator import ArchiveIterator
def extract_html(warc_gz_path: str):
"""逐条读取 WARC 文件,抽出 URL 与 HTML 响应体"""
with gzip.open(warc_gz_path, "rb") as f:
for record in ArchiveIterator(f):
if record.rec_type == "response":
url = record.rec_headers.get_header("WARC-Target-URI")
payload = record.content_stream().read()
yield url, payload
示例 3:自建爬虫补充领域语料
import requests
from bs4 import BeautifulSoup
def fetch_clean_text(url: str) -> str:
resp = requests.get(url, headers={"User-Agent": "Mozilla/5.0"}, timeout=15)
resp.raise_for_status()
soup = BeautifulSoup(resp.text, "html.parser")
for tag in soup(["script", "style", "nav", "footer"]):
tag.decompose()
return soup.get_text(separator="\n", strip=True)
2.3 小结
大模型时代的数据是静态、公开、可近乎无限获取的。只要把网页/代码/书籍“洗干净”,规模定律就能发挥作用,通用大模型随之成为现实。这也是为什么这个大模型时代的门槛看起来“最低”——数据本身不稀缺,稀缺的是数据工程能力。
三、Agent 时代:静态语料不够了,需要“会做事”的数据
3.1 难在哪
Agent 要解决的不再是“知道什么”,而是“把事做成”。训练一个好用的 Agent,需要的不是静态知识,而是动态的交互轨迹(Observation, Thought, Action, Feedback)和不断的反馈信号。这些数据比通用大模型的训练语料难获取得多,原因在于:
- 行为闭环:数据必须是“状态 → 动作 → 环境反馈”的完整序列,缺一环就是废数据;
- 环境爆炸:网页、代码仓库、终端、数据库、各类 API……每个环境都有自己的交互方式;
- 反馈稀疏:多数任务只有最终结果能验证,中途的每一步对不对没人告诉你;
- 成本与合规:人工演示贵,真实生产日志涉及隐私、权限与合规审查。
3.2 业界主流的几种获取方式
综合近两年的工作(AgentTuning、τ-bench、SWE-bench、Tool-R0、GEM、ASTRA 等),业界大致走以下六条路线:
| 方式 | 数据形态 | 代表工作/工具 | 优点 | 局限 |
|---|---|---|---|---|
| ① 人类演示/人工标注 | 专家手写的逐步示范轨迹 | WebArena 等基准的构造、Agent Data Protocol 归纳的 manual creation | 质量最高、语义可靠 | 贵、慢、覆盖有限 |
| ② 强模型合成与蒸馏 | 用 GPT-4 等强模型生成轨迹并蒸馏给小模型 | AgentTuning、FireAct、GEM(从文本语料合成工具轨迹)、Klear-AgentForge | 低成本、可规模化 | 合成≠可信,需验证器过滤 |
| ③ 仿真/沙箱环境自动采样 | Agent 在环境中自主交互产生的轨迹 | SWE-bench(Docker + 测试验证)、τ-bench(模拟用户+API)、TerminalTraj、Learn-by-interact、ASTRA | 可无限生成、天然带验证信号 | 环境保真度决定数据质量 |
| ④ 自我对弈 + 可验证奖励(RLVR) | 生成器与求解器互相对抗迭代 | Tool-R0(零人工数据的自我对弈)、NVIDIA NeMo RLVR | 无人工、难度自适应 | 任务空间设计难、易 reward hacking |
| ⑤ 真实生产日志回流(数据飞轮) | 线上 Agent 的真实调用记录 + 用户反馈 | 阿里 AgenticQwen 数据飞轮、session replay | 最贴近真实分布 | 隐私合规、噪声大、需脱敏 |
| ⑥ 模拟用户互动生成多轮数据 | 模拟“用户- Agent”对话与工具调用 | APIGen-MT | 多轮覆盖好、可定制领域 | 模拟用户≠真实用户 |
核心共识是:合成 + 可验证 + 真实回流,三条腿走路。
3.3 示例代码
示例 1:用强模型合成 ReAct 交互轨迹(路线②)
from openai import OpenAI
client = OpenAI()
def synth_trajectory(task: str) -> str:
prompt = f"""你是一个会调用工具完成任务 Agent。请按 ReAct 格式为以下任务生成一条完整交互轨迹:
任务:{task}
格式要求:Thought: 推理 / Action: 调用工具(参数) / Observation: 环境返回,循环直至任务完成。"""
resp = client.chat.completions.create(
model="gpt-4o",
messages=[{"role": "user", "content": prompt}],
temperature=0.7,
)
return resp.choices[0].message.content
# 生产实践中,合成轨迹必须再过一道"验证器",只保留真正执行成功的轨迹
示例 2:在仿真环境中自动采样 Agent 轨迹(路线③,示意)
import gymnasium as gym
env = gym.make("MiniGrid-Empty-5x5-v0") # 可真实安装的网格环境,仅作示意
obs, _ = env.reset()
trajectory = []
for step in range(50):
action = env.action_space.sample() # 实际应替换为你的 Agent 策略
obs, reward, terminated, truncated, info = env.step(action)
trajectory.append({"step": step, "obs": obs, "action": action, "reward": reward})
if terminated or truncated:
break
# 过滤成功轨迹后,即可转换为 SFT / RL 训练格式
示例 3:把线上真实调用日志整理成训练样本(路线⑤)
import json
from pathlib import Path
def logs_to_dataset(log_dir: str, out_path: str) -> None:
"""把线上 Agent 的真实调用日志(脱敏后)重放为对话式训练数据"""
samples = []
for f in Path(log_dir).glob("*.jsonl"):
for line in f.open(encoding="utf-8"):
log = json.loads(line) # 字段:query / thought / tool / result / feedback
samples.append({
"messages": [
{"role": "user", "content": log["query"]},
{"role": "assistant", "content": log["thought"]},
{"role": "tool", "name": log["tool"], "content": log["result"]},
{"role": "user", "content": log.get("feedback", "")},
]
})
Path(out_path).write_text(
"\n".join(json.dumps(s, ensure_ascii=False) for s in samples),
encoding="utf-8",
)
3.4 小结
Agent 数据的本质是行为数据。它不再“躺”在互联网上等人抓取,而是要主动生产:要么用更强的模型造,要么放进仿真环境里跑,要么让真实用户在生产环境里喂。数据获取难度,已经明显上了一个台阶。
四、具身智能:物理世界的数据,“GPT 时刻”还没来
4.1 为什么更难
具身智能(Embodied AI)要让机器人在物理世界里感知、决策、操作。训练它的数据是目前整个 AI 体系里最难获得的,原因很直白:
- 真机采集慢且贵:人类一天只有 24 小时,一位熟练的遥操作员一天能采集的有效轨迹也就百来条,单条高质量轨迹成本动辄几十元(含人力与机器人折旧);
- 多模态对齐:一条样本要同时对齐视觉、力觉、关节状态与动作,任何一路传感器缺失都会破坏样本;
- 长程与安全:家庭/工厂任务长程多步、状态随机,且不能在真实环境里随意试错;
- 异构严重:不同本体、相机、动作空间、数据格式(RLDS、HDF5、JSONL……)互不通用;
- 仿真有 gap:仿真数据可以无限生成,但“看起来像”≠“物理上对”——大量 3D 资产缺少关节、材质、密度、摩擦等物理语义,Sim-to-Real 差距至今没有完全解决。
因此,具身智能还没有迎来自己的“GPT 时刻”——这句话的本质,就是它的训练数据还没有形成规模化的获取通道。
4.2 业界主流的几种获取方式
| 方式 | 数据形态 | 代表工作/工具 | 优点 | 局限 |
|---|---|---|---|---|
| ① 真机遥操作 | 人手操控机器人采集的图像-状态-动作序列 | ALOHA、Mobile ALOHA、GELLO、UMI | 质量最高、符合物理规律 | 成本最高、难以规模化 |
| ② 大规模真实数据联盟/训练场 | 多机构共享的真实机器人轨迹 | Open X-Embodiment(22 种机器人形态、100 万+真实轨迹、RT-X 模型)、具身智能训练场/数据工厂 | 跨本体、跨任务泛化 | 格式统一难、数据分布偏 |
| ③ 仿真合成 + Sim-to-Real | 仿真器中批量生成的虚拟交互数据 | Isaac Lab、MuJoCo、Habitat、Genesis | 无限供应、自动标注 | 存在 Sim-to-Real 差距 |
| ④ 伴随式/无本体穿戴采集 | 人在日常环境佩戴设备、机器人“跟学” | Ego 第一视角采集、UMI 夹爪数据棒 | 成本低、场景真实 | 动作对齐与标注难 |
| ⑤ 互联网视频学习 | 从人类操作视频中学习 | Video as Policy 等 | 数据量极大 | 视角转换难、缺动作标注 |
| ⑥ 世界模型与生成式数据 | 用生成模型“想象”世界并产出训练数据 | NVIDIA Cosmos、World Labs Atlas、达摩院数字遥操作 RynnWorld-Teleop | 数据成本大幅下降 | 生成保真度决定上限 |
两个值得一提的量级:Google DeepMind 的 AutoRT 让机器人车队在真实办公室环境里由 LLM 自动提出任务、VLM 过滤、RT-2 执行,7 个月自主采集了约 7.7 万条真实操作轨迹;NVIDIA 则展示过用仿真器 11 小时生成 78 万条操作轨迹(相当于约 6500 小时人类演示)——真实与仿真两条路线,正在以完全不同的速度奔跑。
4.3 示例代码
示例 1:遥操作数据的标准结构与加载(路线①,ALOHA / Open X-Embodiment 风格)
import json
import torch
from torch.utils.data import Dataset
# 一条遥操作样本(JSONL 中的一行)示意:
# {
# "observations": {"image": "camera_0.png", "state": [0.12, -0.35, 0.22, 1.57, 0.0, -0.78]},
# "actions": [0.11, -0.33, 0.21, 1.55, -0.01, -0.77],
# "reward": 1.0,
# "done": true
# }
class TeleopDataset(Dataset):
def __init__(self, jsonl_path: str):
self.episodes = [json.loads(l) for l in open(jsonl_path, encoding="utf-8")]
def __len__(self):
return len(self.episodes)
def __getitem__(self, idx):
ep = self.episodes[idx]
return {
"image": ep["observations"]["image"], # 相机图像(路径或字节)
"state": torch.tensor(ep["observations"]["state"], dtype=torch.float32),
"action": torch.tensor(ep["actions"], dtype=torch.float32),
}
示例 2:仿真批量生成操作数据(路线③,MuJoCo,示意)
import mujoco
model = mujoco.MjModel.from_xml_path("humanoid.xml") # MuJoCo 自带模型,可换成机器人 MJCF/URDF
data = mujoco.MjData(model)
dataset = []
for t in range(1000):
data.ctrl[:] = policy(data) # 接入你的策略(或随机动作做探索)
mujoco.mj_step(model, data)
dataset.append({
"qpos": data.qpos.copy(),
"qvel": data.qvel.copy(),
"ctrl": data.ctrl.copy(),
"image": render_frame(data), # 相机渲染得到视觉观测
})
示例 3:用生成式仿真引擎合成数据(路线⑥,Genesis,示意,API 以官方版本为准)
import genesis as gs
gs.init(backend=gs.gpu)
scene = gs.Scene(show_viewer=False)
plane = scene.add_entity(gs.morphs.Plane())
robot = scene.add_entity(gs.morphs.MJCF(file="xml/franka_emika_panda.xml"))
# ... 添加目标物体、配置相机后:
for _ in range(1000):
action = policy(scene) # 或从轨迹库随机采样动作
scene.step()
# 记录相机图像与关节状态,形成 (观测, 动作, 下一观测) 样本
4.4 现状判断
- 在 GTC 2026 上,宇树王兴兴的演讲题目就是《如何迈过具身智能的 ChatGPT 时刻》,指出行业还需攻克包括“数据利用效率与知识迁移”在内的多个核心问题;
- 中国信通院《2026 年具身智能训练场研究报告》直言:高质量真实物理交互数据短缺,是制约具身智能发展的核心瓶颈,训练场正作为“真实数据生产 + 模型训练 + 真机验证迭代”的关键基础设施被大规模建设;
- 一条值得关注的新变量是世界模型:李飞飞 World Labs 发布的 Atlas 可将少量真实影像转化为三维场景并生成机器人视角数据(Real-to-Sim),达摩院 RynnWorld-Teleop 甚至用生成式世界模型替代真实机器人完成“数字遥操作”。这些尝试的目的只有一个:把物理世界数据的获取成本打下来。
五、结论:数据,就是 AI 时代的黄金
回看三个时代,规律非常一致:
- 大模型时代:谁把静态语料洗干净、配比好,谁就拥有更强的底座;
- Agent 时代:谁拥有高质量交互轨迹与反馈闭环,谁就拥有更强的“行动力”;
- 具身智能时代:谁先把物理世界的数据获取成本降下来,谁就先迎来“GPT 时刻”。
所以我们必须把数据当作一等公民来重视,认真对待它的全生命周期:
采集 → 治理标注 → 数据集构建 → 训练 → 上线 → 反馈回流,形成一条不断增值的数据飞轮。
给从业者的几点建议:
- 先定义“好数据”:质量、覆盖度、多样性、可验证性,四条缺一不可;宁可少,不可脏;
- 合成数据是杠杆,验证器是刹车:AI 生成的数据必须配验证器(测试用例、reward model、LLM-as-judge)过滤,否则就是“高质量垃圾”;
- 尽早建立反馈闭环:把线上真实交互日志脱敏后回流训练,是最便宜也最真实的持续数据源;
- 具身方向盯住“数据成本曲线”:遥操作保质量、仿真保规模、世界模型保成本,三者的交叉点就是机会;
- 合规是底线:真实用户数据涉及隐私与授权,采集、存储、使用必须留痕可审计。
模型可以开源,算力可以购买,唯独高质量数据无法速成——它需要时间、工程与真实世界的交互来沉淀。数据,就是 AI 时代的黄金。
参考资料
- Common Crawl 官方:https://www.commoncrawl.org/about
- RedPajama(复现 LLaMA 语料):https://arxiv.org/html/2411.12372
- A Survey on the Optimization of LLM-based Agents:https://arxiv.org/html/2503.12434v1
- Agent Data Protocol(人工 / 合成 / 记录回放三类数据来源):https://arxiv.org/html/2510.24702v1
- τ-bench(模拟用户-工具-Agent 交互):https://arxiv.org/pdf/2406.12045v1
- Tool-R0(自我对弈 RL,零人工数据):https://arxiv.org/html/2602.21320
- GEM(从文本语料合成工具轨迹):https://arxiv.org/html/2601.10355v1
- ASTRA(自动化合成 Agent 轨迹与环境):https://arxiv.org/html/2601.21558v1
- APIGen-MT(模拟 Agent-用户对谈生成多轮数据):https://arxiv.org/pdf/2504.03601v1
- Learn-by-interact(零人工的环境自适应数据合成):https://arxiv.org/html/2501.10893
- NVIDIA:Mastering Agentic Techniques – AI Agent RL:https://developer.nvidia.com/blog/mastering-agentic-techniques-ai-agent-reinforcement-learning/
- 阿里云:智能体时代的数据飞轮(AgenticQwen):https://segmentfault.com/a/1190000047707856
- Open X-Embodiment(RT-X):https://aiwiki.ai/wiki/open_x_embodiment
- 2026 年具身智能数据行业研究白皮书(遥操作技术演进):https://www.zwbdata.com/jszw/c5272ee6-9069-4f21-b10e-3c4a62e3a5f7/9130ddf1-dde5-47f6-af2a-97610f6b37ae/国先中心:2026年具身智能数据行业研究白皮书.pdf
- 具身智能数据采集四路线(真机遥操作/伴随式/无本体/仿真):https://damodev.csdn.net/6a991bfa2b83d06f0ecb7987.html
- 达摩院数字遥操作 RynnWorld-Teleop:https://www.aitntnews.com/newDetail.html?newId=27344
- 中国信通院《2026 年具身智能训练场研究报告》:https://www.eet-china.com/mp/a519523.html
- 王兴兴 GTC 2026 演讲报道:https://robot.ofweek.com/2026-03/ART-898890-8420-30683486.html
- 李飞飞 World Labs Atlas(Real-to-Sim):http://m.toutiao.com/group/7681868225675624994/
- 36氪:10 亿级预算加持 + 百万小时数据,具身智能离“开箱即用”还有多远:https://eu.36kr.com/zh/p/3967681693194120
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)