数据,AI 时代的黄金:从大模型语料到智能体轨迹,再到具身智能的“GPT 时刻”

一句话结论:AI 的能力上限 ≈ 模型能力 × 数据质量。模型能力是乘法里的一个因子,而数据质量与规模,才是决定这个乘积能否做大的硬约束。


一、一个公式,看懂三个时代的“数据鸿沟”

很多课程和分享里都提到过这个公式:

AI 能力上限 = 模型能力 × 数据质量

严格来说,这两个变量并不独立:模型本身就是“从数据里长出来的”,模型能力同样受数据规模与质量的约束(例如 Chinchilla 缩放定律指出,计算最优配置下模型参数量与训练数据量应按近似 1:1 的比例同步增长,参数再大、数据不够,能力也上不去)。但作为工程直觉,这个公式依然非常准确:在模型一侧已经逼近上限时,数据质量就是那个决定性的乘数,1×0.1 永远小于 0.9×1。

如果我们把 AI 的演进按“数据形态”切一刀,会看得更清楚:

时代数据形态数据可得性获取成本代表瓶颈
大模型时代静态文本/代码语料公开、海量、近乎免费清洗与质量治理
Agent 时代动态交互轨迹 + 反馈需要“会做事”的数据环境多样、反馈稀疏、隐私合规
具身智能时代物理世界感知-动作数据极度稀缺极高真机采集慢、仿真有 gap

大模型时代靠“读万卷书”解决了,Agent 时代需要“行万里路”,而具身智能时代,人类自己都还缺一条“物理世界的路”。下面我们逐一展开。


二、大模型时代:静态语料如何成就“通用”

2.1 数据来源举例

通用大模型(如 LLaMA、GPT 系列)的预训练语料,几乎都来自以下几类公开数据:

来源说明代表数据集
通用网页非营利组织 Common Crawl 自 2008 年起每月抓取全网,存档总量超 10 PiB,单次抓取约 20 亿+页面,是绝大多数大模型的“原材料”Common Crawl → C4、FineWeb
百科与知识库结构化程度高、质量稳定Wikipedia
代码GitHub 公开仓库,覆盖数百种语言The Stack(358 种语言、约 6TB)、StarCoder
书籍版权过期的经典书籍与小说Project Gutenberg、Books3
学术论文高质量的领域文本arXiv
问答社区技术问答、长尾知识Stack Exchange

以开源界的 RedPajama 复现 LLaMA 语料为例,其构成就是:English CommonCrawl、C4、GitHub、Wikipedia、Books、ArXiv、Stack Exchange 七大类。海量文字 + 代码,共同让通用大模型成为现实。

2.2 示例代码

示例 1:用 Hugging Face datasets 直接加载公开语料

from datasets import load_dataset

# 加载维基百科语料(取前 1000 条做演示;数据量大时建议走流式)
ds = load_dataset("wikipedia", "20220301.en", split="train[:1000]")
print(ds[0]["text"][:300])

示例 2:解析 Common Crawl 的 WARC 原始网页存档

import gzip
from warcio.archiveiterator import ArchiveIterator

def extract_html(warc_gz_path: str):
    """逐条读取 WARC 文件,抽出 URL 与 HTML 响应体"""
    with gzip.open(warc_gz_path, "rb") as f:
        for record in ArchiveIterator(f):
            if record.rec_type == "response":
                url = record.rec_headers.get_header("WARC-Target-URI")
                payload = record.content_stream().read()
                yield url, payload

示例 3:自建爬虫补充领域语料

import requests
from bs4 import BeautifulSoup

def fetch_clean_text(url: str) -> str:
    resp = requests.get(url, headers={"User-Agent": "Mozilla/5.0"}, timeout=15)
    resp.raise_for_status()
    soup = BeautifulSoup(resp.text, "html.parser")
    for tag in soup(["script", "style", "nav", "footer"]):
        tag.decompose()
    return soup.get_text(separator="\n", strip=True)

2.3 小结

大模型时代的数据是静态、公开、可近乎无限获取的。只要把网页/代码/书籍“洗干净”,规模定律就能发挥作用,通用大模型随之成为现实。这也是为什么这个大模型时代的门槛看起来“最低”——数据本身不稀缺,稀缺的是数据工程能力。


三、Agent 时代:静态语料不够了,需要“会做事”的数据

3.1 难在哪

Agent 要解决的不再是“知道什么”,而是“把事做成”。训练一个好用的 Agent,需要的不是静态知识,而是动态的交互轨迹(Observation, Thought, Action, Feedback)和不断的反馈信号。这些数据比通用大模型的训练语料难获取得多,原因在于:

  1. 行为闭环:数据必须是“状态 → 动作 → 环境反馈”的完整序列,缺一环就是废数据;
  2. 环境爆炸:网页、代码仓库、终端、数据库、各类 API……每个环境都有自己的交互方式;
  3. 反馈稀疏:多数任务只有最终结果能验证,中途的每一步对不对没人告诉你;
  4. 成本与合规:人工演示贵,真实生产日志涉及隐私、权限与合规审查。

3.2 业界主流的几种获取方式

综合近两年的工作(AgentTuning、τ-bench、SWE-bench、Tool-R0、GEM、ASTRA 等),业界大致走以下六条路线:

方式数据形态代表工作/工具优点局限
① 人类演示/人工标注专家手写的逐步示范轨迹WebArena 等基准的构造、Agent Data Protocol 归纳的 manual creation质量最高、语义可靠贵、慢、覆盖有限
② 强模型合成与蒸馏用 GPT-4 等强模型生成轨迹并蒸馏给小模型AgentTuning、FireAct、GEM(从文本语料合成工具轨迹)、Klear-AgentForge低成本、可规模化合成≠可信,需验证器过滤
③ 仿真/沙箱环境自动采样Agent 在环境中自主交互产生的轨迹SWE-bench(Docker + 测试验证)、τ-bench(模拟用户+API)、TerminalTraj、Learn-by-interact、ASTRA可无限生成、天然带验证信号环境保真度决定数据质量
④ 自我对弈 + 可验证奖励(RLVR)生成器与求解器互相对抗迭代Tool-R0(零人工数据的自我对弈)、NVIDIA NeMo RLVR无人工、难度自适应任务空间设计难、易 reward hacking
⑤ 真实生产日志回流(数据飞轮)线上 Agent 的真实调用记录 + 用户反馈阿里 AgenticQwen 数据飞轮、session replay最贴近真实分布隐私合规、噪声大、需脱敏
⑥ 模拟用户互动生成多轮数据模拟“用户- Agent”对话与工具调用APIGen-MT多轮覆盖好、可定制领域模拟用户≠真实用户

核心共识是:合成 + 可验证 + 真实回流,三条腿走路。

3.3 示例代码

示例 1:用强模型合成 ReAct 交互轨迹(路线②)

from openai import OpenAI

client = OpenAI()

def synth_trajectory(task: str) -> str:
    prompt = f"""你是一个会调用工具完成任务 Agent。请按 ReAct 格式为以下任务生成一条完整交互轨迹:
任务:{task}
格式要求:Thought: 推理 / Action: 调用工具(参数) / Observation: 环境返回,循环直至任务完成。"""
    resp = client.chat.completions.create(
        model="gpt-4o",
        messages=[{"role": "user", "content": prompt}],
        temperature=0.7,
    )
    return resp.choices[0].message.content

# 生产实践中,合成轨迹必须再过一道"验证器",只保留真正执行成功的轨迹

示例 2:在仿真环境中自动采样 Agent 轨迹(路线③,示意)

import gymnasium as gym

env = gym.make("MiniGrid-Empty-5x5-v0")   # 可真实安装的网格环境,仅作示意
obs, _ = env.reset()
trajectory = []

for step in range(50):
    action = env.action_space.sample()    # 实际应替换为你的 Agent 策略
    obs, reward, terminated, truncated, info = env.step(action)
    trajectory.append({"step": step, "obs": obs, "action": action, "reward": reward})
    if terminated or truncated:
        break

# 过滤成功轨迹后,即可转换为 SFT / RL 训练格式

示例 3:把线上真实调用日志整理成训练样本(路线⑤)

import json
from pathlib import Path

def logs_to_dataset(log_dir: str, out_path: str) -> None:
    """把线上 Agent 的真实调用日志(脱敏后)重放为对话式训练数据"""
    samples = []
    for f in Path(log_dir).glob("*.jsonl"):
        for line in f.open(encoding="utf-8"):
            log = json.loads(line)  # 字段:query / thought / tool / result / feedback
            samples.append({
                "messages": [
                    {"role": "user", "content": log["query"]},
                    {"role": "assistant", "content": log["thought"]},
                    {"role": "tool", "name": log["tool"], "content": log["result"]},
                    {"role": "user", "content": log.get("feedback", "")},
                ]
            })
    Path(out_path).write_text(
        "\n".join(json.dumps(s, ensure_ascii=False) for s in samples),
        encoding="utf-8",
    )

3.4 小结

Agent 数据的本质是行为数据。它不再“躺”在互联网上等人抓取,而是要主动生产:要么用更强的模型造,要么放进仿真环境里跑,要么让真实用户在生产环境里喂。数据获取难度,已经明显上了一个台阶。


四、具身智能:物理世界的数据,“GPT 时刻”还没来

4.1 为什么更难

具身智能(Embodied AI)要让机器人在物理世界里感知、决策、操作。训练它的数据是目前整个 AI 体系里最难获得的,原因很直白:

  1. 真机采集慢且贵:人类一天只有 24 小时,一位熟练的遥操作员一天能采集的有效轨迹也就百来条,单条高质量轨迹成本动辄几十元(含人力与机器人折旧);
  2. 多模态对齐:一条样本要同时对齐视觉、力觉、关节状态与动作,任何一路传感器缺失都会破坏样本;
  3. 长程与安全:家庭/工厂任务长程多步、状态随机,且不能在真实环境里随意试错;
  4. 异构严重:不同本体、相机、动作空间、数据格式(RLDS、HDF5、JSONL……)互不通用;
  5. 仿真有 gap:仿真数据可以无限生成,但“看起来像”≠“物理上对”——大量 3D 资产缺少关节、材质、密度、摩擦等物理语义,Sim-to-Real 差距至今没有完全解决。

因此,具身智能还没有迎来自己的“GPT 时刻”——这句话的本质,就是它的训练数据还没有形成规模化的获取通道。

4.2 业界主流的几种获取方式

方式数据形态代表工作/工具优点局限
① 真机遥操作人手操控机器人采集的图像-状态-动作序列ALOHA、Mobile ALOHA、GELLO、UMI质量最高、符合物理规律成本最高、难以规模化
② 大规模真实数据联盟/训练场多机构共享的真实机器人轨迹Open X-Embodiment(22 种机器人形态、100 万+真实轨迹、RT-X 模型)、具身智能训练场/数据工厂跨本体、跨任务泛化格式统一难、数据分布偏
③ 仿真合成 + Sim-to-Real仿真器中批量生成的虚拟交互数据Isaac Lab、MuJoCo、Habitat、Genesis无限供应、自动标注存在 Sim-to-Real 差距
④ 伴随式/无本体穿戴采集人在日常环境佩戴设备、机器人“跟学”Ego 第一视角采集、UMI 夹爪数据棒成本低、场景真实动作对齐与标注难
⑤ 互联网视频学习从人类操作视频中学习Video as Policy 等数据量极大视角转换难、缺动作标注
⑥ 世界模型与生成式数据用生成模型“想象”世界并产出训练数据NVIDIA Cosmos、World Labs Atlas、达摩院数字遥操作 RynnWorld-Teleop数据成本大幅下降生成保真度决定上限

两个值得一提的量级:Google DeepMind 的 AutoRT 让机器人车队在真实办公室环境里由 LLM 自动提出任务、VLM 过滤、RT-2 执行,7 个月自主采集了约 7.7 万条真实操作轨迹;NVIDIA 则展示过用仿真器 11 小时生成 78 万条操作轨迹(相当于约 6500 小时人类演示)——真实与仿真两条路线,正在以完全不同的速度奔跑。

4.3 示例代码

示例 1:遥操作数据的标准结构与加载(路线①,ALOHA / Open X-Embodiment 风格)

import json
import torch
from torch.utils.data import Dataset

# 一条遥操作样本(JSONL 中的一行)示意:
# {
#   "observations": {"image": "camera_0.png", "state": [0.12, -0.35, 0.22, 1.57, 0.0, -0.78]},
#   "actions": [0.11, -0.33, 0.21, 1.55, -0.01, -0.77],
#   "reward": 1.0,
#   "done": true
# }

class TeleopDataset(Dataset):
    def __init__(self, jsonl_path: str):
        self.episodes = [json.loads(l) for l in open(jsonl_path, encoding="utf-8")]

    def __len__(self):
        return len(self.episodes)

    def __getitem__(self, idx):
        ep = self.episodes[idx]
        return {
            "image": ep["observations"]["image"],   # 相机图像(路径或字节)
            "state": torch.tensor(ep["observations"]["state"], dtype=torch.float32),
            "action": torch.tensor(ep["actions"], dtype=torch.float32),
        }

示例 2:仿真批量生成操作数据(路线③,MuJoCo,示意)

import mujoco

model = mujoco.MjModel.from_xml_path("humanoid.xml")  # MuJoCo 自带模型,可换成机器人 MJCF/URDF
data = mujoco.MjData(model)

dataset = []
for t in range(1000):
    data.ctrl[:] = policy(data)      # 接入你的策略(或随机动作做探索)
    mujoco.mj_step(model, data)
    dataset.append({
        "qpos": data.qpos.copy(),
        "qvel": data.qvel.copy(),
        "ctrl": data.ctrl.copy(),
        "image": render_frame(data), # 相机渲染得到视觉观测
    })

示例 3:用生成式仿真引擎合成数据(路线⑥,Genesis,示意,API 以官方版本为准)

import genesis as gs

gs.init(backend=gs.gpu)
scene = gs.Scene(show_viewer=False)
plane = scene.add_entity(gs.morphs.Plane())
robot = scene.add_entity(gs.morphs.MJCF(file="xml/franka_emika_panda.xml"))
# ... 添加目标物体、配置相机后:

for _ in range(1000):
    action = policy(scene)           # 或从轨迹库随机采样动作
    scene.step()
    # 记录相机图像与关节状态,形成 (观测, 动作, 下一观测) 样本

4.4 现状判断

  • 在 GTC 2026 上,宇树王兴兴的演讲题目就是《如何迈过具身智能的 ChatGPT 时刻》,指出行业还需攻克包括“数据利用效率与知识迁移”在内的多个核心问题;
  • 中国信通院《2026 年具身智能训练场研究报告》直言:高质量真实物理交互数据短缺,是制约具身智能发展的核心瓶颈,训练场正作为“真实数据生产 + 模型训练 + 真机验证迭代”的关键基础设施被大规模建设;
  • 一条值得关注的新变量是世界模型:李飞飞 World Labs 发布的 Atlas 可将少量真实影像转化为三维场景并生成机器人视角数据(Real-to-Sim),达摩院 RynnWorld-Teleop 甚至用生成式世界模型替代真实机器人完成“数字遥操作”。这些尝试的目的只有一个:把物理世界数据的获取成本打下来

五、结论:数据,就是 AI 时代的黄金

回看三个时代,规律非常一致:

  • 大模型时代:谁把静态语料洗干净、配比好,谁就拥有更强的底座;
  • Agent 时代:谁拥有高质量交互轨迹与反馈闭环,谁就拥有更强的“行动力”;
  • 具身智能时代:谁先把物理世界的数据获取成本降下来,谁就先迎来“GPT 时刻”。

所以我们必须把数据当作一等公民来重视,认真对待它的全生命周期

数据采集

治理与标注

数据集构建

训练与微调

上线推理

用户/环境反馈

采集 → 治理标注 → 数据集构建 → 训练 → 上线 → 反馈回流,形成一条不断增值的数据飞轮

给从业者的几点建议:

  1. 先定义“好数据”:质量、覆盖度、多样性、可验证性,四条缺一不可;宁可少,不可脏;
  2. 合成数据是杠杆,验证器是刹车:AI 生成的数据必须配验证器(测试用例、reward model、LLM-as-judge)过滤,否则就是“高质量垃圾”;
  3. 尽早建立反馈闭环:把线上真实交互日志脱敏后回流训练,是最便宜也最真实的持续数据源;
  4. 具身方向盯住“数据成本曲线”:遥操作保质量、仿真保规模、世界模型保成本,三者的交叉点就是机会;
  5. 合规是底线:真实用户数据涉及隐私与授权,采集、存储、使用必须留痕可审计。

模型可以开源,算力可以购买,唯独高质量数据无法速成——它需要时间、工程与真实世界的交互来沉淀。数据,就是 AI 时代的黄金。


参考资料

  • Common Crawl 官方:https://www.commoncrawl.org/about
  • RedPajama(复现 LLaMA 语料):https://arxiv.org/html/2411.12372
  • A Survey on the Optimization of LLM-based Agents:https://arxiv.org/html/2503.12434v1
  • Agent Data Protocol(人工 / 合成 / 记录回放三类数据来源):https://arxiv.org/html/2510.24702v1
  • τ-bench(模拟用户-工具-Agent 交互):https://arxiv.org/pdf/2406.12045v1
  • Tool-R0(自我对弈 RL,零人工数据):https://arxiv.org/html/2602.21320
  • GEM(从文本语料合成工具轨迹):https://arxiv.org/html/2601.10355v1
  • ASTRA(自动化合成 Agent 轨迹与环境):https://arxiv.org/html/2601.21558v1
  • APIGen-MT(模拟 Agent-用户对谈生成多轮数据):https://arxiv.org/pdf/2504.03601v1
  • Learn-by-interact(零人工的环境自适应数据合成):https://arxiv.org/html/2501.10893
  • NVIDIA:Mastering Agentic Techniques – AI Agent RL:https://developer.nvidia.com/blog/mastering-agentic-techniques-ai-agent-reinforcement-learning/
  • 阿里云:智能体时代的数据飞轮(AgenticQwen):https://segmentfault.com/a/1190000047707856
  • Open X-Embodiment(RT-X):https://aiwiki.ai/wiki/open_x_embodiment
  • 2026 年具身智能数据行业研究白皮书(遥操作技术演进):https://www.zwbdata.com/jszw/c5272ee6-9069-4f21-b10e-3c4a62e3a5f7/9130ddf1-dde5-47f6-af2a-97610f6b37ae/国先中心:2026年具身智能数据行业研究白皮书.pdf
  • 具身智能数据采集四路线(真机遥操作/伴随式/无本体/仿真):https://damodev.csdn.net/6a991bfa2b83d06f0ecb7987.html
  • 达摩院数字遥操作 RynnWorld-Teleop:https://www.aitntnews.com/newDetail.html?newId=27344
  • 中国信通院《2026 年具身智能训练场研究报告》:https://www.eet-china.com/mp/a519523.html
  • 王兴兴 GTC 2026 演讲报道:https://robot.ofweek.com/2026-03/ART-898890-8420-30683486.html
  • 李飞飞 World Labs Atlas(Real-to-Sim):http://m.toutiao.com/group/7681868225675624994/
  • 36氪:10 亿级预算加持 + 百万小时数据,具身智能离“开箱即用”还有多远:https://eu.36kr.com/zh/p/3967681693194120
Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐