基于LDA主题模型的省级数据政策文本挖掘与聚类分析

期刊: 《社会发展与科技创新》 DOI:10.64649/yh.shfzykjcx.2025090020 全文阅读 返回期刊

卢妍

西北师范大学

摘要

本文以30个省份76份省级数据政策文件为研究样本,运用LDA主题模型提取政策文本的潜在主题结构,识别出数字经济发展与数据流通、公共数据开放与获取规范、公共数据资源登记管理、政务数据共享与开放、授权运营管理五个核心政策主题,并基于主题概率分布矩阵采用K-means聚类方法将省份划分为五类政策取向。研究发现,省级数据政策在关注维度上呈现从宏观顶层设计到微观操作规范的层次递进;东部省份在开放共享和授权运营上得分更高,西部省份在大数据条例中较多涉及基础设施建设议题;登记管理类政策覆盖面最广且地域差异最小。研究为理解省级数据政策的差异化格局提供了量化依据,为政策协同优化提供了参考。

关键词

LDA主题模型;K-means聚类;政策文本量化;省级数据政策;数据治理

参考文献

[1]周毅,陈必坤,马江华,等.基于文本量化分析的我国公共数据治理政策发展研究[J].情报学报,2023,42(4):436-452.

[2]周鑫. 基于三维分析视角的我国政府数据治理政策文本分析 [D]; 长春工业大学, 2025.

[3]于兴尚,谭洪,罗碧,等.政策工具视角下公共数据治理研究——基于省级政策文本的分析[J].图书馆,2024,(2):28-35.

[4]孙远太, 李润东. 中国大中城市人才政策评价及协同类型分析——基于PMC—LDA模型的实证研究 [J]. 科学学研究: 1-22.

[5]梁益琳. 基于LDA模型的我国人工智能政策量化分析 [J]. 价值工程, 2026, 45(17): 75-7.


XML显示示例

    
·