摘要:该数据集包含 10,000 条合成医疗保险理赔记录,主要用于医疗保险欺诈检测与风险建模研究。

数据集概述

该数据集包含 10,000 条合成医疗保险理赔记录,主要用于医疗保险欺诈检测与风险建模研究。每条记录模拟一笔完整的保险理赔业务,覆盖患者信息、治疗过程、账单金额、保单信息、异常指标以及欺诈标签等内容。数据集完全由合成数据构成,不包含真实患者或保险业务信息,因此适合用于教学、科研和机器学习实验。

数据结构与关键特征

数据集以单笔保险理赔记录为基本单位,特征主要包括患者人口统计信息、诊疗与治疗详情、医疗费用与账单指标、保险保单相关属性以及用于识别异常行为的风险特征。核心目标变量为 fraud_label,其中 0 表示正常理赔,1 表示欺诈理赔。通过这些多维特征,可以分析不同理赔行为与欺诈风险之间的关联,并开展特征工程、类别不平衡处理和异常模式识别。

应用价值与研究方向

该数据集可用于保险欺诈检测、医疗风险评估、异常检测和不平衡分类等任务。研究者可以训练逻辑回归、随机森林、XGBoost、神经网络等分类模型建立欺诈识别系统,并结合风险评分、特征重要性和可解释性方法识别高风险理赔因素。进一步还可研究异常检测、成本敏感学习、重采样策略和模型阈值优化,为医疗保险智能审核、风险预警和反欺诈系统设计提供实验基础。

数据集来源

由张家梁(Bob)整理并于2026年在7zcode平台公开发布。

数据集信息

免责声明与引用

数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。

作者信息

作者:Bob (张家梁)
项目编号:Datasets-371
文件大小:241K
原创声明:本数据集为整理作品

联系方式

开源协议

本项目采用AGPL-3.0开源协议,允许个人和组织自由使用、修改和分发代码,但基于本项目的衍生作品必须同样开源,且用于提供网络服务时需向用户提供完整源代码。本项目仅供学习研究使用,作者不对使用本项目产生的任何后果承担责任,使用者应遵守当地法律法规,合理合法使用本项目。如本项目对您的研究或工作有所帮助,欢迎引用并注明出处。

声明:本站所有项目资源都可以正常运行,亲测无错!而且我们录制了演示视频,在我们注明的环境版本下,项目运行效果完全和演示视频一致。客服QQ:下载须知