摘要:骨髓细胞分类数据集是一个专门用于血液学疾病诊断的医学图像数据集,包含7,000张经过专家标注的白细胞显微图像,涵盖白血病和淋巴瘤等血液系统恶性肿瘤。
数据集概述
骨髓细胞分类数据集是一个专门用于血液学疾病诊断的医学图像数据集,包含7,000张经过专家标注的白细胞显微图像,涵盖白血病和淋巴瘤等血液系统恶性肿瘤。该数据集由Matek等人创建并发布于癌症影像档案馆(TCIA),所有图像均经过血液学专家的精确标注。数据集将白细胞分为7个不同的类别:原始细胞(BLA)、嗜酸性粒细胞(EOS)、淋巴细胞(LYT)、单核细胞(MON)、分叶核中性粒细胞(NGS)、无法识别细胞(NIF)和早幼粒细胞(PMO)。每个类别包含约1,000张图像,为训练稳健的分类模型提供了均衡的数据分布,特别适用于机器学习、深度学习以及生物医学分析任务。
数据结构与关键特征
该数据集采用标准的图像分类结构,包含bone_marrow_cell_dataset文件夹和abbreviations.csv缩写对照表,便于理解各类别的医学含义。其核心特征在于数据的专业性和平衡性——所有7,000张图像均由血液学专家进行精确标注,确保了标签的临床准确性,每个类别约1,000张图像的均衡分布避免了模型训练中的类别偏差问题。数据集中的细胞类型涵盖了从成熟细胞(如分叶核中性粒细胞、淋巴细胞)到未成熟前体细胞(如原始细胞、早幼粒细胞)的完整发育谱系,特别包含了白血病患者常见的异常细胞形态。此外,数据集还包含”无法识别”类别,反映了实际临床诊断中的不确定性,增强了模型的实用价值。
应用价值与研究方向
该数据集在血液病诊断、临床病理学和计算病理学领域具有重要的应用价值,可用于开发自动化骨髓细胞分类系统,辅助血液科医生进行白血病、淋巴瘤等血液系统恶性肿瘤的快速诊断和分型。在研究方向上,该数据集支持多个前沿课题的探索,包括深度学习在医学图像分类中的应用、迁移学习在小样本医学数据上的优化、注意力机制在细胞形态特征提取中的作用以及可解释性AI在临床决策支持中的实现。该数据集已被证明可用于训练高精度的深度神经网络模型,在骨髓细胞形态学鉴别中达到专家级水准。此外,该数据集还可用于研究类别不平衡问题的缓解策略、多模态学习(结合细胞形态和临床数据)以及联邦学习在保护患者隐私前提下的模型协作训练,为智能医疗和精准诊断技术的发展提供坚实的数据支撑。
数据集来源
由张家梁(Bob)整理并于2026年在7zcode平台公开发布。
数据集信息
免责声明与引用
数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。
作者信息
作者:Bob (张家梁)
项目编号:Datasets-303
文件大小:260M
原创声明:本数据集为整理作品
联系方式

开源协议
本项目采用AGPL-3.0开源协议,允许个人和组织自由使用、修改和分发代码,但基于本项目的衍生作品必须同样开源,且用于提供网络服务时需向用户提供完整源代码。本项目仅供学习研究使用,作者不对使用本项目产生的任何后果承担责任,使用者应遵守当地法律法规,合理合法使用本项目。如本项目对您的研究或工作有所帮助,欢迎引用并注明出处。


评论(0)