北京市 2026 0.0025 天津市 2026 0.0007 河北省 2026 0.0006 山西省 2026 0.0018 内蒙古自治区 2026 0.0007 辽宁省 2026 0.0011 吉林省 2026 0.0006 黑龙江省 2026 0.0012 上海市 2026 0.0015 江苏省 2026 0.0009 浙江省 2026 0.0019 安徽省 2026 0.0012 福建省 2026 0.0010 江西省 2026 0.0013 山东省 2026 0.0013 河南省 2026 0.0019 湖南省 2026 0.0014 广东省 2026 0.0015 广西壮族自治区 2026 0.0007 海南省 2026 0.0010 北京市 2026 0.0025 天津市 2026 0.0007 河北省 2026 0.0006 山西省 2026 0.0018 内蒙古自治区 2026 0.0007 辽宁省 2026 0.0011 吉林省 2026 0.0006 黑龙江省 2026 0.0012 上海市 2026 0.0015 江苏省 2026 0.0009 浙江省 2026 0.0019 安徽省 2026 0.0012 福建省 2026 0.0010 江西省 2026 0.0013 山东省 2026 0.0013 河南省 2026 0.0019 湖南省 2026 0.0014 广东省 2026 0.0015 广西壮族自治区 2026 0.0007 海南省 2026 0.0010
首页/ 省级数据/ 核心数据库/ 新质生产力/ 数据资产化/ 数据资产化词频和占总词数比例
Panel Dataset — 省份级面板数据

中国省份数据资产化词频和占总词数比例面板数据(1998-2026)

参考何瑛(2024)构建的数据资产化关键词词典(共221个关键词),对省级政府工作报告进行jieba分词后,统计词典内关键词出现的总次数并除以该文本的总词数。数据版本v202607。。数据整理自省级政府工作报告。

精选数据 省份 更新 2026-07-28 1998-2026 · 29年 Excel / Stata
2026
覆盖年份
1998–2026
共 29 年连续面板
有效样本
787
缺失率 0.0%
覆盖主体
27
省份数量
指标类型
精选
支持预览与下载
01 趋势分析
0.0016 0.0013 0.0009 0.0006 0.0002 1998 2004 2009 2015 2020 2026
折线为年度均值
1998
0.0003
2003
0.0008
2007
0.0007
2012
0.0007
2017
0.0009
2021
0.0015
2026
0.0012
02 样例数据
样例数据(前 10 行) 支持复制到 Excel
年份 省份 数据资产化词频和占总词数比例
1998 河北省 0.0003
1998 内蒙古自治区 0.0002
1998 青海省 0.0003
1999 河北省 0.0
1999 内蒙古自治区 0.0002
1999 海南省 0.0007
2000 河北省 0.0003
2000 内蒙古自治区 0.0002
2000 浙江省 0.0002
2000 青海省 0.0
参考何瑛(2024)构建的数据资产化关键词词典(共221个关键词),对省级政府工作报告进行jieba分词后,统计词典内关键词出现的总次数并除以该文本的总词数。数据版本v202607。。覆盖 27 个省份29 年连续面板,适用于面板回归、政策评估与综合评价研究。
03 指标详情

指标解释

指标定义

参考何瑛(2024)构建的数据资产化关键词词典(共221个关键词),对省级政府工作报告进行jieba分词后,统计词典内关键词出现的总次数并除以该文本的总词数。数据版本v202607。

数据类型

省份级面板数据,覆盖27个省份。

时间跨度

1998-2026年,共29年连续面板数据。

应用场景

  • 作为被解释变量或核心解释变量进行面板回归分析
  • 结合其他指标做相关性与多元回归研究
  • 分析时间趋势与区域差异
  • 政策评估(DID、PSM-DID 等准自然实验)
  • 构建综合评价指标体系(熵值法等)
04 技术文档
数据说明书(Data Dictionary)
数据来源

数据整理自省级政府工作报告。经人工校验与交叉比对,确保数据准确性。

部分缺失值已通过线性插值补齐,原始数据与插值数据均可分别下载。

变量名 中文名称 类型 说明
year 年份 int 1998-2026
province 省份 string 省/自治区/直辖市
prov-dd0f9c64fbc9e47b00f41-shujuzichanhuacipinhezhanzongcishubili-a647e4 数据资产化词频和占总词数比例 float 参考何瑛(2024)构建的数据资产化关键词词典(共221个关键词),对省级政府工作报告进行jieba分词后,统计词典内关键词出现的总次数并除以该文本的总词数。数据版本v202607。
数据出处
本数据来自马克集数(s.macrodatas.cn)。
引用或转载请注明来源
Stata 读取代码

下载数据后,可使用以下 Stata 代码快速读取并设定面板结构:

Stata 复制代码
* 读取数据
use "prov_shujuzichanhuacipinhezh_1998_2026.dta", clear

* 查看变量与前几行
describe
list in 1/10

* 编码省份变量(如尚未编码)
encode province, gen(prov_id)

* 设定面板数据结构
xtset prov_id year

* 描述性统计
summarize prov_shujuzichanhuacipinhezh, detail

* 简单面板回归示例
xtreg prov_shujuzichanhuacipinhezh x1 x2, fe
estimates store fe_model

如下载的是 Excel 格式,请先在 Stata 中使用 import excel "prov-dd0f9c64fbc9e47b00f41-shujuzichanhuacipinhezhanzongcishubili-a647e4_1998_2026.xlsx", firstrow clear 导入。

05 相关指标推荐
数据预览
加载中...