摘要:该数据集汇集了乳腺癌正常组织、肿瘤组织、复发状态、治疗反应及模拟样本的高维基因表达数据,由BC-TCGA、GSE2034、GSE25066和Simulation-Data四个独立子数据集组成。

数据集概述

该数据集汇集了乳腺癌正常组织、肿瘤组织、复发状态、治疗反应及模拟样本的高维基因表达数据,由BC-TCGA、GSE2034、GSE25066和Simulation-Data四个独立子数据集组成,主要用于乳腺癌分类、预后分析、疗效预测和高维数据降维研究。

数据结构与关键特征

包含17,814个基因和590个样本,其中正常组织61例、乳腺癌组织529例;GSE2034包含12,634个基因和286例乳腺癌样本,其中复发107例、未复发179例;GSE25066包含12,634个基因和492例样本,其中病理完全缓解100例、残留病灶392例;模拟数据包含100个阳性样本、100个阴性样本和10,000个服从指定正态分布的特征。数据具有维度高、样本量相对有限、来源多样及分类任务丰富等特点。

应用价值与研究方向

该数据集可用于乳腺癌组织识别、肿瘤复发预测、新辅助治疗反应评估、差异表达基因筛选和生物标志物发现,也适合比较随机投影、主成分分析、特征选择及深度学习等降维和分类方法,并可开展跨队列泛化、领域适应及高维小样本学习研究。

数据集来源

由张家梁(Bob)整理并于2026年在7zcode平台公开发布。

数据集信息

免责声明与引用

数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。

作者信息

作者:Bob (张家梁)
项目编号:Datasets-664
文件大小:100M
原创声明:本数据集为整理作品

联系方式

开源协议

本项目采用AGPL-3.0开源协议,允许个人和组织自由使用、修改和分发代码,但基于本项目的衍生作品必须同样开源,且用于提供网络服务时需向用户提供完整源代码。本项目仅供学习研究使用,作者不对使用本项目产生的任何后果承担责任,使用者应遵守当地法律法规,合理合法使用本项目。如本项目对您的研究或工作有所帮助,欢迎引用并注明出处。

声明:本站所有项目资源都可以正常运行,亲测无错!而且我们录制了演示视频,在我们注明的环境版本下,项目运行效果完全和演示视频一致。客服QQ:下载须知