摘要:医疗保健疾病预测数据集是一个面向临床风险评估与机器学习疾病预测研究构建的结构化医疗数据集,共包含 2000 名患者记录。数据融合了人口统计学信息、临床生理指标、生活方式以及病史等多维特征,可用于分析不同健康因素与疾病发生之间的关联。

数据集概述

医疗保健疾病预测数据集是一个面向临床风险评估与机器学习疾病预测研究构建的结构化医疗数据集,共包含 2000 名患者记录。数据融合了人口统计学信息、临床生理指标、生活方式以及病史等多维特征,可用于分析不同健康因素与疾病发生之间的关联。与传统单一疾病分类数据不同,该数据集采用多标签分类形式,同一名患者可能同时患有心脏病、糖尿病和中风中的一种或多种疾病,因此更加适合模拟真实医疗场景中的多疾病共存问题,并为综合健康风险预测模型提供数据基础。

数据结构与关键特征

该数据集以患者为基本样本单位,主要包含人口统计学特征、临床指标、生活方式因素、病史信息和疾病标签。人口统计信息包括年龄和性别;临床指标包括体重指数(BMI)、收缩压、舒张压、胆固醇和血糖水平,可用于反映肥胖、血压异常、血脂及糖代谢状态;生活方式特征包括吸烟、饮酒和体育活动,可用于分析行为因素对疾病风险的影响;病史部分包含家族疾病史等遗传相关信息。目标变量分别为 心脏病、糖尿病和中风三个二元标签,每个标签均采用 0/1 表示未患病或患病,从而支持一个患者对应多个疾病标签的联合预测任务。

应用价值与研究方向

该数据集可广泛应用于心血管疾病预测、糖尿病风险识别、中风预警、多疾病联合预测以及个体健康风险评估等研究。研究人员可以采用逻辑回归、随机森林、XGBoost、LightGBM、支持向量机和神经网络等方法建立多标签分类模型,并通过特征重要性、SHAP 等可解释性方法分析年龄、BMI、血压、胆固醇、血糖以及生活方式因素对不同疾病的影响。进一步还可围绕疾病共现关系建模、类别不平衡处理、多任务学习、个性化风险评分和早期筛查系统开展研究,为智能医疗辅助决策、慢性病管理和健康干预提供数据支持。

数据集来源

由张家梁(Bob)整理并于2026年在7zcode平台公开发布。

数据集信息

免责声明与引用

数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。

作者信息

作者:Bob (张家梁)
项目编号:Datasets-444
文件大小:28K
原创声明:本数据集为整理作品

联系方式

开源协议

本项目采用AGPL-3.0开源协议,允许个人和组织自由使用、修改和分发代码,但基于本项目的衍生作品必须同样开源,且用于提供网络服务时需向用户提供完整源代码。本项目仅供学习研究使用,作者不对使用本项目产生的任何后果承担责任,使用者应遵守当地法律法规,合理合法使用本项目。如本项目对您的研究或工作有所帮助,欢迎引用并注明出处。

声明:本站所有项目资源都可以正常运行,亲测无错!而且我们录制了演示视频,在我们注明的环境版本下,项目运行效果完全和演示视频一致。客服QQ:下载须知