摘要:统一慢性病数据集是一个用于慢性病分类和合并症分析的综合医疗保健数据集,包含 280,985 条匿名患者记录,每条记录包含 38 项临床和生活方式特征,零缺失值。
数据集简介
数据集概述
统一慢性病数据集(Unified Chronic Disease Dataset)是一个用于慢性病分类和合并症分析的综合医疗保健数据集,包含 280,985 条匿名患者记录,每条记录包含 38 项临床和生活方式特征,零缺失值。该数据集整合了三个公开可用的数据集,分别涵盖糖尿病、心脏病和高血压,整合过程采用 Microsoft SQL Server 中的 Medallion 架构(铜级 → 银级 → 金级),创建干净、标准化且可用于机器学习和医疗保健研究的分析数据集。数据集提供二元目标(正常或异常)和 8 类疾病组合标签,使研究人员能够研究单个疾病以及合并症模式。
数据集包含 38 个特征:
(1) 人口统计信息:composite_key(唯一标识符)、age(年龄)、age_normalized(标准化年龄 0-1)、age_level(年龄组:青年/中年/成熟/老年)、gender(性别)、education_level(教育水平)、employment_status(就业状况);
(2) BMI 和人体测量:bmi(BMI)、bmi_level(BMI 类别,基于 WHO 标准);
(3) 生活方式因素:smoking_status(吸烟状况)、physical_activity(体力活动)、stress_level(压力水平)、sleep_hours(睡眠时长)、alcohol_intake(酒精摄入)、salt_intake(盐摄入)、sugar_consumption(糖摄入);
(4) 临床测量:glucose(血糖)、HbA1c_level(糖化血红蛋白)、cholesterol(总胆固醇)、triglycerides(甘油三酯)、hdl(高密度脂蛋白)、ldl(低密度脂蛋白)、low_hdl_cholesterol/high_ldl_cholesterol(指标)、blood_pressure(血压)、systolic_bp/diastolic_bp(收缩压/舒张压)、high_blood_pressure(高血压指标)、heart_rate(心率)、crp_level(C反应蛋白)、homocysteine_level(同型半胱氨酸);
(5) 疾病指标:diabetes(糖尿病)、hypertension(高血压)、heart_disease(心脏病)、family_history(家族史);
(6) 目标变量:disease_flags(疾病组合代码)、sublabel(多类疾病标签,8 类)、label(二元目标标签:正常/异常);
(7) 元数据:source_dataset(原始源数据集)。
该数据集适用于:慢性病预测(糖尿病、心脏病、高血压)、多类分类(8 类疾病组合)、二元健康筛查(正常 vs 异常)、合并症分析、临床决策支持、特征重要性和可解释 AI(XAI)、医疗保健分析、教育项目和机器学习基准测试、风险因素识别、生活方式干预研究、机器学习模型训练、公共卫生研究、预测建模。
数据集来源
该综合数据集由三个公开的数据集创建(涵盖糖尿病、心脏病和高血压),采用 Microsoft SQL Server 中的 Medallion 架构(铜级 → 银级 → 金级)整合,包含 280,985 条患者记录、38 个特征(人口统计、BMI、生活方式、临床测量、疾病指标)、零缺失值,提供二元目标(正常/异常)和 8 类疾病组合标签,专为慢性病预测、合并症分析、机器学习和医疗保健研究设计。由张家梁(Bob)整理并于2026年在7zcode平台公开发布。
数据集信息
免责声明与引用
数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。
作者信息
作者:Bob (张家梁)
项目编号:Datasets-130
文件大小:7M
原创声明:本数据集为整理作品
联系方式

开源协议
本项目采用AGPL-3.0开源协议,允许个人和组织自由使用、修改和分发代码,但基于本项目的衍生作品必须同样开源,且用于提供网络服务时需向用户提供完整源代码。本项目仅供学习研究使用,作者不对使用本项目产生的任何后果承担责任,使用者应遵守当地法律法规,合理合法使用本项目。如本项目对您的研究或工作有所帮助,欢迎引用并注明出处。


评论(0)