国家数据局点名“数据标注众包”:新机会不是多招人,而是建一张产能网
7月28日,国家数据局副局长余英在2026中国国际大数据产业博览会新闻发布会上,
提到一句值得所有数据标注从业者关注的话:
积极发展数据标注众包等专业化服务新业态。
同一场发布会上,国家数据局还介绍,目前已经组织50个试点地区开展数据产业集聚区建设试点。
截至2026年6月,140家先行先试单位建成高质量数据集超过106PB,
72家行业链主单位建成高质量数据集超过45PB,覆盖高价值场景超过759个。
很多人看到数据标注众包,第一反应可能是:
数据标注是不是又要大规模招兼职了?
- 项目是不是可以继续往下分包了?
- 以后是不是谁手里的人多,谁就能接到项目?
但我想说,如果你只看到“众包”,可能就把这次释放的信号理解反了。
因为这句话里真正重要的,不只是“众包”,而是前面的四个字:
专业化服务
一、数据标注众包,不等于低价招兼职
过去的数据标注众包,给很多人的印象并不好。
一个项目经过甲方、一级供应商、二级供应商,再分到地方团队和个人手里。
中间层层抽成,最后真正干活的人拿不到多少钱,项目质量也没有人真正负责。
- 任务做错了,找不到责任人;
- 数据泄露了,查不到传播路径;
- 项目延期了,各层供应商互相推诿;
标准发生变化,只能重新通知几百个人返工。
这种模式不叫专业化众包,只能叫无序分包。
国家数据局这次强调的,是“数据标注众包等专业化服务新业态”。
它真正指向的,应该是一种新的数据生产组织方式:
把分散在不同地区、不同专业和不同能力层级的人,
通过平台、工具、标准和质量体系组织起来,形成一张可以动态调度的数据产能网络。
所以,众包不是简单地把任务发给更多人,
而是要解决一个更难的问题:
如何让几百个甚至几千个不在同一地点的人,按照统一标准,安全、稳定地生产出可以训练模型的数据。

二、为什么现在需要数据标注众包?
因为人工智能需要的数据,已经变了。
过去的数据标注项目,往往是一次性释放几十万张图片、几万小时语音或者几百万条文本。
数据类型相对统一,标准相对固定,企业可以集中招聘几百名标注员,在一个场地里连续生产几个月。
但大模型、AI Agent和具身智能进入真实行业以后,数据需求正在变得越来越碎。
- 模型上线以后,会不断产生新的错误案例;
- 行业大模型需要医生、律师、工程师参与专业判断;
- 机器人需要在不同城市、家庭、工厂和商场采集真实场景;
- 模型评测需要不断更新题目、边界案例和对抗样本;
企业还需要根据用户反馈,持续补充小批量、高价值的数据。
这些任务有一个共同特点:
数量未必特别大,但类型多、变化快、专业要求高,而且需要持续生产。
为了一个只有几千条数据的任务,专门招聘几十个人不划算;
为了一个需要医学知识的项目,临时培养普通标注员也不现实。
这时候,众包的价值才真正体现出来。
企业可以根据任务要求,快速找到对应地区、专业背景和能力等级的人,再通过平台进行任务分发、过程管理、质量抽检和统一结算。
这不是回到人海战术,而是从“固定养人”走向“按需调度产能”。
三、未来标注公司,不再是人员供应商
过去很多数据标注公司的核心能力,是招人。
客户给项目,公司招聘项目经理,项目经理再组织标注员、组长和质检员,把任务按时交出去。
公司拥有多少人,往往就代表拥有多大的交付能力。
但众包模式发展以后,这套逻辑会发生变化。
未来客户关注的,可能不再是你公司现在有多少名全职标注员,而是:
- 一个星期内能调动多少合格人员?
- 能不能快速找到医学、金融、法律、工业等专业人才?
- 任务标准变化以后,能不能当天完成全员更新?
- 一条数据出现问题,能不能追溯到具体操作人员和操作过程?
- 低质量人员能不能自动降级或者退出?
- 敏感数据能不能做到分级、脱敏和权限隔离?
这意味着,数据标注公司的核心资产将从“人员数量”,变成五种能力:
任务拆解能力、人员分级能力、平台调度能力、质量追踪能力和数据安全能力。
企业不一定需要长期雇佣几千个人,但必须有能力管理几千个人。
过去建设的是一个项目团队,未来建设的是一张生产网络。
四、众包只淘汰低水平中间商
有人可能会担心:
如果客户能够直接在平台上发布任务,还需要数据标注公司吗?
当然需要。
因为客户真正购买的,从来不是一个人点击鼠标、画框或者填写标签的动作。
客户购买的是最终数据能不能使用。
一批数据能不能直接进入模型训练,取决于前期的标准设计、任务拆解、样本分配、过程质检、结果验收、安全管理和持续优化。
这些工作并不会因为采用众包而消失,反而会变得更加复杂。
参与的人越多,质量管理难度越高;
人员越分散,数据安全风险越大;
任务越专业,人员能力识别越重要;
项目变化越快,平台和工具能力越关键。
所以,众包不会让专业数据标注公司失去价值。
真正可能被淘汰的,是那些只会从上游拿项目、再加价转给下游,既没有平台、没有质量体系,也不承担最终交付责任的中间商。
2025年印发的《关于促进数据标注产业高质量发展的实施意见》已经明确提出,到2027年,数据标注产业专业化、智能化及科技创新能力要显著提升,产业年均复合增长率超过20%,并培育一批具有影响力的科技型数据标注企业。
注意,政策要培育的是“科技型数据标注企业”,不是简单的人力外包公司。

这次再次提出数据标注众包,本质上是在进一步回答一个问题:
当人工智能的数据需求越来越分散、专业和持续,应该用什么方式组织生产?
答案之一,就是平台化、专业化的众包网络。
五、数据标注公司应该抓住什么机会?
我认为,未来至少有三类企业能够从这轮变化中受益。
第一类,是有平台和工具能力的企业。
能够完成在线任务分发、人员画像、质量追踪、自动结算、模型预标注和异常数据识别的平台,才有可能管理大规模分布式产能。
第二类,是拥有垂直行业专家资源的企业。
普通图片拉框的门槛会越来越低,但医疗、法律、金融、工业、机器人等领域的数据,需要真正懂行业的人参与。
谁能组织这些专业人才,谁就拥有更高价值的数据生产能力。
第三类,是拥有安全合规交付体系的企业。
众包不代表所有数据都可以拿回家处理。
涉及个人信息、企业机密、地图、医疗、金融和内容安全的数据,仍然需要封闭职场、专用设备、权限隔离和全流程审计。
未来更成熟的模式,很可能不是纯线上众包,也不是全部集中交付,而是:
普通任务在线众包,专业任务专家参与,敏感任务封闭生产,模型完成预标注,人工负责判断和验收。
这才是数据标注产业真正的“人机协同”。
写在最后
国家数据局点名“数据标注众包”,当然是一个值得关注的行业信号。
但它并不意味着,只要手里有人,就能抓住新机会。
未来的数据标注竞争,不再只是看谁能招到更多人,
而是看谁能把人、专家、模型、工具和场景组织成一套稳定的数据生产系统。
过去,数据标注公司的竞争力是一间职场、几百台电脑和几百名标注员。
未来,真正有价值的数据标注公司,可能没有最多的固定员工,
却能够随时调动不同地区、不同专业、不同能力等级的数据生产者。
所以,这次政策释放的最大机会,不是让我们继续扩大人海。
而是提醒所有数据标注公司:
从今天开始,你需要建设的,不只是一个项目团队,而是一张能够持续生产高质量数据的产能网。
我是AI数据标注猿刘吉,跟着我,用数据视角看AI世界。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)