摘要:HISTOPANTUME子宫癌病理组织学数据集是从泛癌症组织病理学数据集HISTOPANTUME中提取的专注于子宫癌领域的精选子集。
数据集概述
HISTOPANTUME子宫癌病理组织学数据集是从泛癌症组织病理学数据集HISTOPANTUME中提取的专注于子宫癌领域的精选子集。该数据集包含6,334张从癌症基因组图谱(TCGA)获取的组织病理学图像,专门用于肿瘤检测、领域泛化和计算病理学研究。数据集采用二分类架构,包含肿瘤类别(3,000张)和非肿瘤类别(3,334张),类别分布相对均衡。所有图像均为224×224像素的JPEG格式,通过从原始数据集中间部分开始采样的方式构建,确保了样本的代表性和多样性。
数据结构与关键特征
数据集采用简洁的二级目录结构组织,分为Tumor和Non-Tumor两个类别文件夹,每个文件夹包含相应类别的组织病理学图像切片。图像统一为224×224像素分辨率,便于直接输入卷积神经网络进行训练。原始文件名编码了TCGA来源切片和切片坐标的相关信息,为溯源和研究提供了便利。数据集的类别分布接近1:1(3,000 vs 3,334),避免了严重的类别不平衡问题,使其成为二分类任务的理想训练资源。图像质量经过人工检查,确保了数据的可靠性和一致性。
应用价值与研究方向
该数据集在计算病理学和医学图像分析领域具有广泛的应用价值,特别适用于肿瘤二分类、迁移学习、轻量级深度学习模型开发以及领域泛化实验。研究方向包括:基于ImageNet预训练模型的迁移学习、自监督学习和半监督学习方法探索、不确定性估计、可解释性AI(如Grad-CAM分析)、特征提取与表示学习、模型鲁棒性评估等。由于数据集规模适中且标注明确,它为子宫癌早期筛查系统的开发、病理学家辅助诊断工具的构建以及深度学习算法在组织病理学图像分析中的性能基准测试提供了宝贵的研究资源,有助于推动精准医学和数字病理学的发展。
数据集来源
由张家梁(Bob)整理并于2026年在7zcode平台公开发布。
数据集信息
免责声明与引用
数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。
作者信息
作者:Bob (张家梁)
项目编号:Datasets-311
文件大小:128M
原创声明:本数据集为整理作品
联系方式

开源协议
本项目采用AGPL-3.0开源协议,允许个人和组织自由使用、修改和分发代码,但基于本项目的衍生作品必须同样开源,且用于提供网络服务时需向用户提供完整源代码。本项目仅供学习研究使用,作者不对使用本项目产生的任何后果承担责任,使用者应遵守当地法律法规,合理合法使用本项目。如本项目对您的研究或工作有所帮助,欢迎引用并注明出处。


评论(0)