7月28日,国家数据局副局长余英在2026中国国际大数据产业博览会新闻发布会上,

提到一句值得所有数据标注从业者关注的话:

积极发展数据标注众包等专业化服务新业态。

同一场发布会上,国家数据局还介绍,目前已经组织50个试点地区开展数据产业集聚区建设试点。

截至2026年6月,140家先行先试单位建成高质量数据集超过106PB

72家行业链主单位建成高质量数据集超过45PB,覆盖高价值场景超过759个

很多人看到数据标注众包,第一反应可能是:

数据标注是不是又要大规模招兼职了?

  • 项目是不是可以继续往下分包了?
  • 以后是不是谁手里的人多,谁就能接到项目?

但我想说,如果你只看到“众包”,可能就把这次释放的信号理解反了。

因为这句话里真正重要的,不只是“众包”,而是前面的四个字:

专业化服务

一、数据标注众包,不等于低价招兼职

过去的数据标注众包,给很多人的印象并不好。

一个项目经过甲方、一级供应商、二级供应商,再分到地方团队和个人手里。

中间层层抽成,最后真正干活的人拿不到多少钱,项目质量也没有人真正负责。

  • 任务做错了,找不到责任人;
  • 数据泄露了,查不到传播路径;
  • 项目延期了,各层供应商互相推诿;

标准发生变化,只能重新通知几百个人返工。

这种模式不叫专业化众包,只能叫无序分包。

国家数据局这次强调的,是“数据标注众包等专业化服务新业态”。

它真正指向的,应该是一种新的数据生产组织方式:

把分散在不同地区、不同专业和不同能力层级的人,

通过平台、工具、标准和质量体系组织起来,形成一张可以动态调度的数据产能网络。

所以,众包不是简单地把任务发给更多人,

而是要解决一个更难的问题:

如何让几百个甚至几千个不在同一地点的人,按照统一标准,安全、稳定地生产出可以训练模型的数据。

二、为什么现在需要数据标注众包?

因为人工智能需要的数据,已经变了。

过去的数据标注项目,往往是一次性释放几十万张图片、几万小时语音或者几百万条文本。

数据类型相对统一,标准相对固定,企业可以集中招聘几百名标注员,在一个场地里连续生产几个月。

但大模型、AI Agent和具身智能进入真实行业以后,数据需求正在变得越来越碎。

  • 模型上线以后,会不断产生新的错误案例;
  • 行业大模型需要医生、律师、工程师参与专业判断;
  • 机器人需要在不同城市、家庭、工厂和商场采集真实场景;
  • 模型评测需要不断更新题目、边界案例和对抗样本;

企业还需要根据用户反馈,持续补充小批量、高价值的数据。

这些任务有一个共同特点:

数量未必特别大,但类型多、变化快、专业要求高,而且需要持续生产。

为了一个只有几千条数据的任务,专门招聘几十个人不划算;

为了一个需要医学知识的项目,临时培养普通标注员也不现实。

这时候,众包的价值才真正体现出来。

企业可以根据任务要求,快速找到对应地区、专业背景和能力等级的人,再通过平台进行任务分发、过程管理、质量抽检和统一结算。

这不是回到人海战术,而是从“固定养人”走向“按需调度产能”。

三、未来标注公司,不再是人员供应商

过去很多数据标注公司的核心能力,是招人。

客户给项目,公司招聘项目经理,项目经理再组织标注员、组长和质检员,把任务按时交出去。

公司拥有多少人,往往就代表拥有多大的交付能力。

但众包模式发展以后,这套逻辑会发生变化。

未来客户关注的,可能不再是你公司现在有多少名全职标注员,而是:

  • 一个星期内能调动多少合格人员?
  • 能不能快速找到医学、金融、法律、工业等专业人才?
  • 任务标准变化以后,能不能当天完成全员更新?
  • 一条数据出现问题,能不能追溯到具体操作人员和操作过程?
  • 低质量人员能不能自动降级或者退出?
  • 敏感数据能不能做到分级、脱敏和权限隔离?

这意味着,数据标注公司的核心资产将从“人员数量”,变成五种能力:

任务拆解能力、人员分级能力、平台调度能力、质量追踪能力和数据安全能力。

企业不一定需要长期雇佣几千个人,但必须有能力管理几千个人。

过去建设的是一个项目团队,未来建设的是一张生产网络。

四、众包只淘汰低水平中间商

有人可能会担心:

如果客户能够直接在平台上发布任务,还需要数据标注公司吗?

当然需要。

因为客户真正购买的,从来不是一个人点击鼠标、画框或者填写标签的动作。

客户购买的是最终数据能不能使用。

一批数据能不能直接进入模型训练,取决于前期的标准设计、任务拆解、样本分配、过程质检、结果验收、安全管理和持续优化。

这些工作并不会因为采用众包而消失,反而会变得更加复杂。

参与的人越多,质量管理难度越高;

人员越分散,数据安全风险越大;

任务越专业,人员能力识别越重要;

项目变化越快,平台和工具能力越关键。

所以,众包不会让专业数据标注公司失去价值。

真正可能被淘汰的,是那些只会从上游拿项目、再加价转给下游,既没有平台、没有质量体系,也不承担最终交付责任的中间商。

2025年印发的《关于促进数据标注产业高质量发展的实施意见》已经明确提出,到2027年,数据标注产业专业化、智能化及科技创新能力要显著提升,产业年均复合增长率超过20%,并培育一批具有影响力的科技型数据标注企业。

注意,政策要培育的是“科技型数据标注企业”,不是简单的人力外包公司。

这次再次提出数据标注众包,本质上是在进一步回答一个问题:

当人工智能的数据需求越来越分散、专业和持续,应该用什么方式组织生产?

答案之一,就是平台化、专业化的众包网络。

五、数据标注公司应该抓住什么机会?

我认为,未来至少有三类企业能够从这轮变化中受益。

第一类,是有平台和工具能力的企业。

能够完成在线任务分发、人员画像、质量追踪、自动结算、模型预标注和异常数据识别的平台,才有可能管理大规模分布式产能。

第二类,是拥有垂直行业专家资源的企业。

普通图片拉框的门槛会越来越低,但医疗、法律、金融、工业、机器人等领域的数据,需要真正懂行业的人参与。

谁能组织这些专业人才,谁就拥有更高价值的数据生产能力。

第三类,是拥有安全合规交付体系的企业。

众包不代表所有数据都可以拿回家处理。

涉及个人信息、企业机密、地图、医疗、金融和内容安全的数据,仍然需要封闭职场、专用设备、权限隔离和全流程审计。

未来更成熟的模式,很可能不是纯线上众包,也不是全部集中交付,而是:

普通任务在线众包,专业任务专家参与,敏感任务封闭生产,模型完成预标注,人工负责判断和验收。

这才是数据标注产业真正的“人机协同”。

写在最后

国家数据局点名“数据标注众包”,当然是一个值得关注的行业信号。

但它并不意味着,只要手里有人,就能抓住新机会。

未来的数据标注竞争,不再只是看谁能招到更多人,

而是看谁能把人、专家、模型、工具和场景组织成一套稳定的数据生产系统。

过去,数据标注公司的竞争力是一间职场、几百台电脑和几百名标注员。

未来,真正有价值的数据标注公司,可能没有最多的固定员工,

却能够随时调动不同地区、不同专业、不同能力等级的数据生产者。

所以,这次政策释放的最大机会,不是让我们继续扩大人海。

而是提醒所有数据标注公司:

从今天开始,你需要建设的,不只是一个项目团队,而是一张能够持续生产高质量数据的产能网。

我是AI数据标注猿刘吉,跟着我,用数据视角看AI世界。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐