在数字经济时代,数据资产已经取代传统要素,成为企业构筑并维持核心竞争力的战略性资源。然而,数据资产并未直接体现在财务报表的资产科目中,如何对企业的数据资产化水平进行量化,一直是实证研究面临的难题。本文介绍的数据集采用文本分析法回答了这一问题:以《中国工业经济》何瑛(2024)的研究设计为基础,构建“数据资产”文本词典,从上市公司年报中提取关键词,用词频高低来刻画企业数据资产化的程度。
具体做法上,研究团队以“信息”“网络”“数字”“数据”四个词作为种子词汇,通过构建相似词词集的方式向外扩展,最终在年报文本中识别并统计出221个数据资产相关词频。再按照数据资产的具体用途差异,将指标进一步区分为自用型数据资产(企业内部开发利用)与交易型数据资产(对外流通交易)两大类。该指标体系从企业文本披露的视角,反映了企业对数据资源开发利用、数据资产管理以及数据要素价值实现的重视程度,可为考察数据资产化对企业创新、全要素生产率、企业价值、融资约束及高质量发展的影响提供微观量化基础。
一、数据集基本信息
二、数据整理流程
整个面板数据的构建过程可以概括为以下几个环节:
• 搜集1998—2025年全部上市公司年报,将非结构化的报告文本整理为面板数据;
• 统计年报全文的文本长度,并分别统计其中中文部分与英文部分的长度;
• 构建数字化术语词典,并将扩充词汇导入Python的jieba分词库;
• 去除停用词后,逐一统计各明细词汇的出现数目;
• 加总得到数据资产化词频总和,同时保留各明细词频,形成最终的指标体系。
三、指标体系构成
除股票代码、公司简称、年报标题、年份、行业名称、行业代码等基础识别变量,以及全文文本总长度、仅中英文文本总长度等控制变量外,数据集还包含数据资产总词频、数据资产词频加1取对数、自用型数据资产总词频、交易型数据资产总词频四个汇总指标。221个明细词频指标按种子词归类整理如下:
四、数据概览
从时间维度看,披露数据资产相关词汇的企业数量逐年递增,词频均值亦呈上升态势,直观反映出上市公司数据资产化意识的持续增强。
数据集同时提供Excel版本与Stata版本两种格式,便于不同软件环境的用户直接调用:
数据资产化—历年企业数目
数据资产化—历年企业数目
上市公司数据资产化词频统计数据(Excel版本)
上市公司数据资产化词频统计数据(Excel版本)
上市公司数据资产化词频统计数据(Stata版本)
上市公司数据资产化词频统计数据(Stata版本)
五、使用建议
•变量构造:实证中通常采用“数据资产词频加1取对数”作为核心解释变量,该变量已预先计算好,可直接使用;
•稳健性检验:可分别以自用型、交易型数据资产词频替换总词频进行回归,或以文本总长度对词频进行标准化处理,缓解“长文本天然词频高”的偏误;
•匹配扩展:面板按股票代码-年份组织,可与CSMAR、Wind等数据库中的财务指标、创新专利数据直接合并;
•研究场景:适合考察数据资产化与企业融资约束缓解(专精特新中小企业)、企业价值重估、数字化转型绩效等议题。
引用格式:[1]何瑛,陈丽丽,杜亚光.数据资产化能否缓解“专精特新”中小企业融资约束[J].中国工业经济,2024,(08):154-173.
顶部专栏分享更多内容
专栏合集:经管社科数据集合与整理
来源: Paper 数据分析