摘要:胃癌(GC)数据集是一个面向人工智能辅助诊断、癌症风险预测和临床决策支持研究的大规模多模态医学数据集,主要用于胃癌的检测、分类与风险建模。
数据集概述
胃癌(GC)数据集是一个面向人工智能辅助诊断、癌症风险预测和临床决策支持研究的大规模多模态医学数据集,主要用于胃癌的检测、分类与风险建模。该数据集整合了来自临床研究、医学影像和分子诊断等多个医疗来源的信息,覆盖人口统计学特征、生活方式因素、病史信息、内镜与CT检查结果以及miRNA相关分子特征,能够较为全面地描述胃癌患者的临床与生物学状态。数据集包含212,354条记录,并以二元标签标识患者是否患有胃癌,为建立基于机器学习和深度学习的胃癌检测模型提供了坚实的数据基础。
数据结构与关键特征
该数据集采用结构化多模态表格数据形式组织,包含临床、人口统计、影像和分子生物学等多类特征。临床与人口统计特征包括年龄、性别、种族、地理位置、家族史、吸烟习惯、饮酒情况、幽门螺杆菌感染、饮食习惯和既往病史等,用于反映患者基础健康背景和危险因素;诊断相关特征包括内镜图像结果、活检结果和CT扫描结果,用于提供与胃部病变直接相关的临床证据;分子生物学特征则涵盖成熟miRNA登录号、成熟miRNA ID、靶基因符号、靶基因Entrez ID、Ensembl ID以及多种miRNA-靶基因相互作用预测评分,如DIANA microT、ElMMo、MicroCosm、MiRanda、miRDB、PicTar、PITA和TargetScan评分等,这些特征可用于捕捉分子层面的癌症信号。目标变量为二元标签,1表示胃癌阳性,0表示非胃癌。
应用价值与研究方向
该数据集在智能医疗、肿瘤早筛、分子诊断和精准医学领域具有很高的研究与应用价值,可用于构建胃癌风险预测模型、辅助诊断系统和个体化治疗支持工具。研究人员可以基于逻辑回归、随机森林、XGBoost等传统机器学习方法进行可解释性建模,也可以结合深度学习、多模态融合网络和医学大模型开展临床特征、影像结果与分子标志物的联合分析。进一步研究方向包括胃癌高危人群筛查、miRNA生物标志物挖掘、胃癌发生机制研究、影像-分子联合诊断、模型可解释性分析以及面向真实临床场景的AI辅助决策系统开发,为提升胃癌早期发现率和临床诊断效率提供技术支持。
数据集来源
由张家梁(Bob)整理并于2026年在7zcode平台公开发布。
数据集信息
免责声明与引用
数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。
作者信息
作者:Bob (张家梁)
项目编号:Datasets-423
文件大小:22M
原创声明:本数据集为整理作品
联系方式

开源协议
本项目采用AGPL-3.0开源协议,允许个人和组织自由使用、修改和分发代码,但基于本项目的衍生作品必须同样开源,且用于提供网络服务时需向用户提供完整源代码。本项目仅供学习研究使用,作者不对使用本项目产生的任何后果承担责任,使用者应遵守当地法律法规,合理合法使用本项目。如本项目对您的研究或工作有所帮助,欢迎引用并注明出处。


评论(0)