01
趋势分析
折线为年度均值
1991
0.0000
2000
0.0003
2005
0.0005
2011
0.0005
2016
0.0010
2021
0.0010
2026
0.0011
02
样例数据
样例数据(前 10 行)
支持复制到 Excel
| 年份 | 省份 | 城市 | 区县 | 数字基础设施词频TF-IDF最大值 |
|---|---|---|---|---|
| 1991 | 辽宁省 | 鞍山市 | 铁东区 | 0.0 |
| 1994 | 福建省 | 南平市 | 政和县 | 0.0 |
| 1996 | 福建省 | 南平市 | 政和县 | 0.0003 |
| 1998 | 福建省 | 南平市 | 政和县 | 0.0004 |
| 1998 | 河南省 | 南阳市 | 社旗县 | 0.0 |
| 1999 | 福建省 | 南平市 | 政和县 | 0.0008 |
| 1999 | 湖北省 | 十堰市 | 茅箭区 | 0.0005 |
| 2000 | 河北省 | 邯郸市 | 武安市 | 0.0002 |
| 2000 | 吉林省 | 通化市 | 集安市 | 0.0 |
| 2000 | 浙江省 | 宁波市 | 江北区 | 0.0 |
参考钞小静(2021)构建的数字基础设施关键词词典(共51个关键词),对区县政府工作报告进行jieba分词后,基于全语料TF-IDF模型计算词典内各关键词TF-IDF值的最大值。数据版本v202607。。覆盖 976 个区县、36 年连续面板,适用于面板回归、政策评估与综合评价研究。
03
指标详情
指标解释
指标定义参考钞小静(2021)构建的数字基础设施关键词词典(共51个关键词),对区县政府工作报告进行jieba分词后,基于全语料TF-IDF模型计算词典内各关键词TF-IDF值的最大值。数据版本v202607。
数据类型区县级面板数据,覆盖976个区县。
时间跨度1991-2026年,共36年连续面板数据。
应用场景
- 作为被解释变量或核心解释变量进行面板回归分析
- 结合其他指标做相关性与多元回归研究
- 分析时间趋势与区域差异
- 政策评估(DID、PSM-DID 等准自然实验)
- 构建综合评价指标体系(熵值法等)
04
技术文档
数据说明书(Data Dictionary)
数据来源
数据整理自区县政府工作报告。经人工校验与交叉比对,确保数据准确性。
部分缺失值已通过线性插值补齐,原始数据与插值数据均可分别下载。
| 变量名 | 中文名称 | 类型 | 说明 |
|---|---|---|---|
| year | 年份 | int | 1991-2026 |
| province | 省份 | string | 省/自治区/直辖市 |
| city | 城市 | string | 地级市名称 |
| county | 区县 | string | 区县名称 |
| county-f1179fd792777ad2c393d-shuzijichusheshicipintfidfzuidazhi-2119d2 | 数字基础设施词频TF-IDF最大值 | float | 参考钞小静(2021)构建的数字基础设施关键词词典(共51个关键词),对区县政府工作报告进行jieba分词后,基于全语料TF-IDF模型计算词典内各关键词TF-IDF值的最大值。数据版本v202607。 |
数据出处
本数据来自马克集数(s.macrodatas.cn)。
引用或转载请注明来源
Stata 读取代码
下载数据后,可使用以下 Stata 代码快速读取并设定面板结构:
* 读取数据
use "county_shuzijichusheshicipin_2_1991_2026.dta", clear
* 查看变量与前几行
describe
list in 1/10
* 编码区县变量(如尚未编码)
encode county, gen(county_id)
* 设定面板数据结构
xtset county_id year
* 描述性统计
summarize county_shuzijichusheshicipin_2, detail
* 简单面板回归示例
xtreg county_shuzijichusheshicipin_2 x1 x2, fe
estimates store fe_model
如下载的是 Excel 格式,请先在 Stata 中使用 import excel "county-f1179fd792777ad2c393d-shuzijichusheshicipintfidfzuidazhi-2119d2_1991_2026.xlsx", firstrow clear 导入。
05
相关指标推荐