摘要:中国31省慢性病知识图谱数据集。该数据集面向慢性病数据分析、知识图谱构建和Neo4j图数据库应用设计,覆盖中国大陆31个省级行政区,共包含155,000条合成病例记录,每个省级行政区包含5,000条病例,可作为慢性病相关科研、教学、毕业设计以及图数据库实践的数据基础。
数据集概述
本数据集围绕常见慢性疾病及其相关健康信息进行构建,主要涉及高血压、2型糖尿病、冠心病、脑卒中后遗症、慢性阻塞性肺疾病、慢性肾脏病、血脂异常、肥胖症、高尿酸血症/痛风和非酒精性脂肪性肝病等10类疾病。数据同时包含患者所属省份、人口学特征、主要疾病、共病、症状、危险因素、并发症、医学指标、生活方式、药物使用、用药依从性、随访频率和风险等级等内容。数据均为合成示例数据,不对应真实患者个人信息,适合用于数据分析和系统功能验证。
数据结构与关键特征
原始病例数据共包含35个字段,涵盖基本信息、疾病诊断、临床指标、生活方式和治疗管理等多个维度,并进一步拆分为患者、疾病、症状、药物、省份等节点文件以及关系文件。知识图谱共包含155,000个患者节点、10个疾病节点、29个症状节点、24个药物节点和31个省份节点,并构建患者与主要疾病、共病、症状、药物、省份以及疾病与症状之间的983,206条关系。数据采用唯一ID、标准标签和关系类型进行组织,可直接适配Neo4j图数据库批量导入和后续图查询分析。
应用价值与研究方向
该数据集可用于慢性病知识图谱构建、疾病共病关系分析、区域慢性病分布研究、患者健康画像、风险分层、药物使用分析以及医学数据可视化等任务。基于Neo4j可进一步开展多跳关系查询、疾病关联发现和图结构分析,也可结合机器学习、图神经网络和大语言模型研究慢性病风险预测、智能问答、辅助决策和个性化健康管理等方向。后续还可以进一步扩展危险因素、并发症和医学指标等独立实体,构建更加完整的慢性病医学知识网络。
数据集来源
由张家梁(Bob)整理并于2026年在7zcode平台公开发布。
数据集信息
免责声明与引用
数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。
作者信息
作者:Bob (张家梁)
项目编号:Datasets-857
文件大小:12M
原创声明:本数据集为整理作品
联系方式

开源协议
本项目采用AGPL-3.0开源协议,允许个人和组织自由使用、修改和分发代码,但基于本项目的衍生作品必须同样开源,且用于提供网络服务时需向用户提供完整源代码。本项目仅供学习研究使用,作者不对使用本项目产生的任何后果承担责任,使用者应遵守当地法律法规,合理合法使用本项目。如本项目对您的研究或工作有所帮助,欢迎引用并注明出处。


评论(0)