一、研究背景与数据集定位

近两年来,「数据要素」作为新型生产要素的地位被反复强调,但学术界一直缺乏一个口径统一、可大样本测算上市公司「数据要素应用能力」的指标体系。巫强、曹长帅与汪阳昕在《中国工业经济》2026 年第 3 期发表的研究《企业数据要素应用能力与供应链韧性:广度与深度的差异化机制》,填补了这一空白。

本文整理的「企业数据要素应用能力数据(2010—2025)」,完整复现了上述论文的指标构建流程:基于上市公司年度报告「管理层讨论与分析」(MD&A)文本,利用中文 BERT 二分类模型识别企业是否真正「在自身业务中部署和使用了数据相关技术」,并最终形成公司—年份层面的应用广度(Breadth)、应用深度(Depth)与综合应用能力(Dea)三个核心指标。

二、指标构造方法:从关键词到 BERT 分类

数据集的构造可分为三个阶段,理解这三步对正确使用指标至关重要。

第一阶段:文本预处理与关键词体系搭建。

研究团队首先对上市公司 MD&A 文本进行编码统一、字符清理与语句切分,并按数据基础设施、数据处理与分析、数据管理与存储、数据驱动应用、数据安全与隐私保护五大类构建关键词体系。其中——

• 广度维度(覆盖企业「有没有相关能力建设」):服务器、数据中心、算力、数据平台、数据中台、数据分析、数据库、数据湖、云存储等;

• 深度维度(覆盖企业「有没有真正落地应用」):数字孪生、机器人、自动化、物联网、机器学习、神经网络、计算机视觉、数据安全、隐私保护、数据合规、隐私计算等。

至于互联网技术、信息技术、AI、人工智能、数字化这类宽泛词,仅用于辅助识别语境,不单独计入核心词频——这是为了避免企业靠喊口号拉高指标。

第二阶段:BERT 二分类微调,剔除「假应用」。

年报里大量语句其实是行业趋势描述、政策背景介绍、客户应用、未来计划或荣誉认定,并不是「企业自身已经做了什么」。为减少误判,研究团队基于人工标注语料对中文 BERT 模型进行微调,训练成一个二分类器:

• 标签 1:企业自身实际部署、应用或使用了数据技术;

• 标签 0:行业背景、业务介绍、对外产品或服务、未来规划、口号、无关含义。

正式测算时,以模型预测「实际应用」的概率 ≥ 0.60 作为语句保留阈值;低于 0.60 的语句一律剔除。这一阈值的选择兼顾了召回率与噪声控制。

第三阶段:核心词频加总与指标构造。

在公司—年份层面,被保留语句中广度类核心词出现总次数记为「广度核心词频」,深度类核心词出现总次数记为「深度核心词频」,二者之和为「核心词总频次」。在此基础上构造三个对数化指标:

未识别到候选语句或未识别到有效核心词的记录仍予以保留,相应指标记为 0。

数据集预览:2010 年 A 股上市公司样本,含股票代码、简称、行业、省份、城市、Breadth/Depth/Dea 等核心字段。

数据集预览:2010 年 A 股上市公司样本,含股票代码、简称、行业、省份、城市、Breadth/Depth/Dea 等核心字段。

三、数据集基本信息

四、字段说明

数据集每行对应一家上市公司在一个会计年度的记录,主要字段如下:

• 基础信息:股票代码、年份、股票简称、行业代码、行业名称、省份代码、省份、城市代码、城市、上市状态;

• 核心频次:广度核心词频、深度核心词频、核心词总频次;

• 最终指标:Breadth、Depth、Dea。

需特别注意,Breadth、Depth、Dea 已经过对数化处理(ln(1+x)),可直接用于回归分析,无需再做对数变换。

五、可拓展的研究方向

这套数据的真正价值不在于单独看,而是和上市公司其他常用数据组合使用。基于原始论文的思路,至少有以下几条可以拓展:

1. 经济后果类研究:将 Dea(或分别用 Breadth、Depth)与全要素生产率、经营绩效、创新产出、融资约束、投资效率、风险承担、绿色转型等指标进行匹配,识别数据要素应用的经济效应;

2. 机制研究:考察数据要素应用通过何种渠道(如创新、要素配置、组织变革)影响企业经营;

3. 异质性研究:按产权性质、地区、行业、数字化政策试点(如「东数西算」节点城市)分组讨论;

4. 与「供应链韧性」结合:直接复现原论文核心结论,并尝试延展到 ESG、供应链金融等领域。

原论文的一个关键发现是:数据要素应用的「广度」与「深度」对企业供应链韧性的影响机制存在差异化。这意味着在做实证时,不建议把 Dea 当作一个整体指标丢进回归——建议同时把 Breadth 和 Depth 放进模型,观察二者系数的大小与显著性差异,这是复现该论文最重要的细节。

六、使用提示与注意事项

• 指标取值范围:因为是 ln(1+x),当 x=0 时指标为 0;当 x 较大时指标增长变缓,呈典型的边际递减。这意味着样本中绝大多数企业的 Dea 都会聚集在 0—2 之间,少数数据要素投入密集的企业可能达到 4 以上;

• 行业差异:互联网、软件信息服务、金融等行业的指标天然偏高,传统制造业次之,采矿业、农业等偏低,做分组回归时建议按行业单独回归或加入行业固定效应;

• 时间趋势:2010—2025 跨越「互联网+」、「数字中国」、《数据二十条》等多个政策节点,指标可能存在明显的结构性断点,必要时可加入政策时间虚拟变量;

• 共被引建议:在使用数据时,请同时引用原始论文,以保证学术可追溯性。

七、参考文献

[1] 巫强, 曹长帅, 汪阳昕. 企业数据要素应用能力与供应链韧性:广度与深度的差异化机制[J]. 中国工业经济, 2026, (3): 170-193.


数据来源说明:本文数据集整理自上市公司年报 MD&A 文本与上市公司基础信息,方法来源为《中国工业经济》2026 年第 3 期。


数据来源:原始方法来源:巫强、曹长帅、汪阳昕(2026),《中国工业经济》第3期;

引用格式:巫强,曹长帅,汪阳昕.企业数据要素应用能力与供应链韧性:广度与深度的差异化机制[J].中国工业经济,2026,(3):170-193.

顶部专栏分享更多内容

经管社科数据整理与分析_Paper数据分析的博客-CSDN博客

更多详情:

CSDN私信Paper数据分析

来源:Paper数据分析

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐