1、数据介绍
本套数据覆盖2000-2024年中国A股5408家上市公司,累计形成4.5万个企业-年份观测样本,原始文本素材全部取自上市公司公开披露的年度报告,核心参考陆瑶等(2025)发表于《经济研究》的大语言模型文本分析范式构建。数据维度完整覆盖数字技术风险三大核心类别:数据风险维度包含数据泄露、数据篡改、数据滥用、违规传输等细分场景;网络风险维度纳入有害程序、网络攻击、设备设施故障、灾害性事件等典型风险事件;技术风险维度同步纳入数字化转型过程中技术落地相关的各类潜在隐患。整套数据资源配套完整,同步提供原始数据Excel文件、Python测算执行代码与最终指标计算结果,为相关学术研究提供可复现的完整分析链条。2000-2024年上市公司企业数字技术风险暴露数据+代码原始数据资源-CSDN下载https://download.csdn.net/download/2401_84585615/93431953
文献
陆瑶,施函青,周欣怡.中国企业数字技术风险暴露对企业价值的影响——来自大语言模型的文本分析证据[J].经济研究,2025,60(02):73-89.
数据构建严格遵循学术标准化流程,基于金融领域预训练的FinBERT大语言模型,对年报中“管理层讨论与分析”板块的风险相关文本进行分句识别与情感分类,通过“风险暴露句负面情感概率最大值减去风险防范句正面情感概率平均值”的公式聚合得到企业层面的风险暴露指标,验证集分类精度达到91.4%,有效规避了传统关键词匹配方法的识别偏差。该测算方法将企业年报中分散的定性风险表述转化为连续可比较的定量指标,填补了数字技术风险领域“定性识别-定量度量-影响评估”的研究数据空白,为数字经济监管政策评估、企业数字化转型风险管控、资本市场风险定价等领域的实证研究提供了可靠的微观数据支撑。
2、数据指标
最终输出的企业-年份层面核心指标体系保持与原始研究完全一致,具体包含:stock_code(上市公司股票代码)、company(企业全称)、year(统计年份)、digi_risk(企业整体数字技术风险暴露水平)、data_risk(细分维度数据风险暴露水平)、cyber_risk(细分维度网络风险暴露水平)。所有指标均经过标准化清洗与异常值处理,数据分布特征符合学术研究规范,可直接用于后续实证回归分析,无需额外复杂的指标重构工作。