news 2026/8/27 16:41:55

1998-2025年上市公司数据资产化词频统计面板数据

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
1998-2025年上市公司数据资产化词频统计面板数据

在数字经济时代,数据资产已经取代传统要素,成为企业构筑并维持核心竞争力的战略性资源。然而,数据资产并未直接体现在财务报表的资产科目中,如何对企业的数据资产化水平进行量化,一直是实证研究面临的难题。本文介绍的数据集采用文本分析法回答了这一问题:以《中国工业经济》何瑛(2024)的研究设计为基础,构建“数据资产”文本词典,从上市公司年报中提取关键词,用词频高低来刻画企业数据资产化的程度。

具体做法上,研究团队以“信息”“网络”“数字”“数据”四个词作为种子词汇,通过构建相似词词集的方式向外扩展,最终在年报文本中识别并统计出221个数据资产相关词频。再按照数据资产的具体用途差异,将指标进一步区分为自用型数据资产(企业内部开发利用)与交易型数据资产(对外流通交易)两大类。该指标体系从企业文本披露的视角,反映了企业对数据资源开发利用、数据资产管理以及数据要素价值实现的重视程度,可为考察数据资产化对企业创新、全要素生产率、企业价值、融资约束及高质量发展的影响提供微观量化基础。

一、数据集基本信息

二、数据整理流程

整个面板数据的构建过程可以概括为以下几个环节:

• 搜集1998—2025年全部上市公司年报,将非结构化的报告文本整理为面板数据;

• 统计年报全文的文本长度,并分别统计其中中文部分与英文部分的长度;

• 构建数字化术语词典,并将扩充词汇导入Python的jieba分词库;

• 去除停用词后,逐一统计各明细词汇的出现数目;

• 加总得到数据资产化词频总和,同时保留各明细词频,形成最终的指标体系。

三、指标体系构成

除股票代码、公司简称、年报标题、年份、行业名称、行业代码等基础识别变量,以及全文文本总长度、仅中英文文本总长度等控制变量外,数据集还包含数据资产总词频、数据资产词频加1取对数、自用型数据资产总词频、交易型数据资产总词频四个汇总指标。221个明细词频指标按种子词归类整理如下:

四、数据概览

从时间维度看,披露数据资产相关词汇的企业数量逐年递增,词频均值亦呈上升态势,直观反映出上市公司数据资产化意识的持续增强。

数据集同时提供Excel版本Stata版本两种格式,便于不同软件环境的用户直接调用:

数据资产化—历年企业数目

数据资产化—历年企业数目

上市公司数据资产化词频统计数据(Excel版本)

上市公司数据资产化词频统计数据(Excel版本)

上市公司数据资产化词频统计数据(Stata版本)

上市公司数据资产化词频统计数据(Stata版本)

五、使用建议

变量构造:实证中通常采用“数据资产词频加1取对数”作为核心解释变量,该变量已预先计算好,可直接使用;

稳健性检验:可分别以自用型、交易型数据资产词频替换总词频进行回归,或以文本总长度对词频进行标准化处理,缓解“长文本天然词频高”的偏误;

匹配扩展:面板按股票代码-年份组织,可与CSMAR、Wind等数据库中的财务指标、创新专利数据直接合并;

研究场景:适合考察数据资产化与企业融资约束缓解(专精特新中小企业)、企业价值重估、数字化转型绩效等议题。

引用格式:[1]何瑛,陈丽丽,杜亚光.数据资产化能否缓解“专精特新”中小企业融资约束[J].中国工业经济,2024,(08):154-173.

顶部专栏分享更多内容

专栏合集:经管社科数据集合与整理

来源: Paper 数据分析

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/27 16:41:20

ncmdump NCM 解密指南:单曲到整库 MP3 转换三步走完

ncmdump NCM 解密指南:单曲到整库 MP3 转换三步走完 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump 把下载好的歌插进车机一按播放,屏幕立刻提示"格式不支持",文件大小、时长却都完好。…

作者头像 李华