摘要:罕见神经系统疾病 MRI 精选版数据集包含 2,000 张质量精选的 MRI 图像(JPG,51 MB),涵盖 5 种罕见神经系统疾病(每类 400 张完美平衡),使用三维自动化质量评估(对比度 40%、清晰度 40%、亮度 20%)从 Mendeley Benchmark MRI 数据集中筛选。数据集预分为训练/验证/测试(1,400/300/300,分层抽样),配有 ORPHA 罕见病代码和临床元数据,可直接用于 Keras/PyTorch,支持多类别分类、少样本学习和医学 AI 公平性研究,仅限研究和教育用途。
数据集简介
数据集概述
罕见神经系统疾病 MRI 精选版数据集(Rare Neurological Diseases MRI – Curated Edition)是一个高质量、精心挑选的 MRI 数据集,包含 5 种罕见神经系统疾病的 2,000 张图像(JPG 格式,约 51 MB),从更大的集合中使用自动化质量评估筛选而来,旨在解决机器学习研究中罕见疾病影像数据严重短缺的问题。数据集的核心优势包括:质量精选(使用对比度 40%、清晰度 40%、亮度平衡 20% 的加权自动评分选择顶级图像)、完美类别平衡(每种疾病精确 400 张图像,无类别不平衡问题)、ML 就绪(预分为训练集 1,400 张/验证集 300 张/测试集 300 张,70/15/15 比例,采用分层抽样)、Orphadata 官方关联(包含 ORPHA 罕见病代码在元数据中)、清晰结构(简单文件夹层次,可直接用于 Keras/PyTorch)。数据集涵盖 5 种罕见神经系统疾病:Walker-Warburg 综合征(ORPHA:899,1-9/1M)、小脑发育不全性厚脑回(ORPHA:2524,<1/1M)、烟雾病伴脑室内出血(ORPHA:2573,1-5/100K)、Hallervorden-Spatz 病/PKAN(ORPHA:157850,1-2/1M)和福山型肌营养不良(ORPHA:272,1-5/100K),仅限研究和教育用途。
数据结构与模态特征
据集采用标准的训练/验证/测试三层目录结构,每个集合下包含 5 个疾病类别子目录(训练集每类 280 张,验证集和测试集各 60 张)。数据精选流程包括五个严格步骤:(1) 从 Mendeley Data 的 Benchmark Diagnostic MRI 数据集(4,248 张图像,40 种疾病)中选择源数据;(2) 聚焦 5 种样本充足的神经系统罕见病(每种 592-1,064 张原始图像);(3) 使用三维自动化质量评估对每张图像评分(对比度 40% 权重测量像素强度标准差、清晰度 40% 权重使用拉普拉斯方差检测模糊、亮度平衡 20% 权重测量与最佳中值范围的距离);(4) 选择每种疾病质量评分最高的 400 张图像(占可用图像的 20-50%);(5) 创建分层平衡的训练/验证/测试划分(70/15/15)保持类别分布。数据集提供两个核心元数据文件:metadata.csv(2,000 行,包含文件名、疾病类别、划分、相对路径、ORPHA 代码、完整疾病名称、患病率、遗传模式、医学分类和受累系统)和 disease_summary.csv(5 行,包含每种疾病的综合临床详情和 Orphadata 参考)。
应用价值与研究方向
该数据集支持多个罕见病医学 AI 和深度学习研究方向。多类别分类:训练 CNN 区分 5 种罕见神经系统疾病。少样本学习:测试元学习算法(原型网络、MAML、匹配网络)在有限医学数据上的性能。迁移学习:预训练模型用于其他神经影像任务。医学 AI 公平性:解决罕见和代表性不足疾病的偏见问题。可解释 AI:开发 GradCAM/注意力图等可解释模型用于临床决策支持。数据增强研究:测试 GAN/扩散模型等罕见病合成数据生成技术。数据集已提供完整的快速启动代码示例(Keras/TensorFlow 和 PyTorch 数据加载、元数据探索、EfficientNetB0 基线模型构建)。潜在研究方向包括架构对比(ResNet、EfficientNet、ConvNeXt、ViT、混合模型)、领域适应(从常见到罕见神经系统疾病的迁移)、多模态学习(结合临床文本、遗传数据)、不确定性量化(贝叶斯方法)和类别不平衡技术泛化测试。数据集特别强调仅限研究和教育用途,明确禁止用于临床诊断、治疗决策或未经验证的医疗设备开发和临床部署。
数据集来源
该数据集从 Mendeley Benchmark MRI 数据集(2024,4,248 张图像)中精选 2,000 张高质量图像(5 种罕见神经系统疾病),使用自动化质量评估筛选,配有 ORPHA 代码和临床元数据,由 Muhammad Ahsan 于 2026 年 2 月发布。由张家梁(Bob)整理并于2026年8月二次整理在7zcode平台公开发布。
数据集信息
免责声明与引用
数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。
作者信息
作者:Bob (张家梁)
项目编号:Datasets-75
文件大小:51M
原创声明:本数据集为整理作品
联系方式

开源协议
本项目采用AGPL-3.0开源协议,允许个人和组织自由使用、修改和分发代码,但基于本项目的衍生作品必须同样开源,且用于提供网络服务时需向用户提供完整源代码。本项目仅供学习研究使用,作者不对使用本项目产生的任何后果承担责任,使用者应遵守当地法律法规,合理合法使用本项目。如本项目对您的研究或工作有所帮助,欢迎引用并注明出处。


评论(0)