摘要:数据集包含2,000个音频样本,采用平衡的四分类组织结构:按构音障碍状态(构音障碍/非构音障碍)和性别(男/女)分为四个文件夹,每个文件夹包含500个在不同场合录制的音频样本,配有data.csv元数据文件记录文件路径、构音障碍状态和性别信息。
数据集概述
构音障碍检测数据集(TORGO数据库)是由多伦多大学计算机科学系、言语语言病理学系与多伦多Holland-Bloorview儿童康复医院合作创建的构音障碍患者声学和发音语音数据库,包含来自脑瘫(CP)或肌萎缩侧索硬化症(ALS)患者(导致言语障碍的两种最常见原因)的对齐声学数据和三维发音特征,以及匹配的对照组数据。本版本数据集包含2,000个音频样本,按构音障碍状态和性别分为四组:构音障碍女性(500)、构音障碍男性(500)、非构音障碍女性(500)和非构音障碍男性(500),每组样本在不同场合录制。数据集提供data.csv元数据文件,包含文件路径(filename)、构音障碍状态(is_dysarthria)和性别(gender)三个字段。完整的TORGO数据库包含18GB数据,可通过http://www.cs.toronto.edu/~complingweb/data/TORGO/torgo.html下载,仅限学术用途。该数据集适用于使用深度学习技术对构音障碍患者进行自动分类、言语障碍检测、语音病理学研究和辅助诊断系统开发
数据结构与关键特征
数据集包含2,000个音频样本,采用平衡的四分类组织结构:按构音障碍状态(构音障碍/非构音障碍)和性别(男/女)分为四个文件夹,每个文件夹包含500个在不同场合录制的音频样本,配有data.csv元数据文件记录文件路径、构音障碍状态和性别信息。关键特征包括:平衡的类别设计(构音障碍vs非构音障碍各1,000样本,男性vs女性各1,000样本,确保无类别偏见)、医学权威性(包含真实脑瘫和ALS患者数据,由专业医疗和学术机构采集)、多样性覆盖(不同说话者、不同场合录制,增强数据代表性)、完整标注信息(清晰的二分类标签和性别属性)、以及标准化组织结构(四个文件夹+CSV元数据便于数据加载和处理)。数据集源自完整的18GB TORGO数据库,本版本为精简的2,000样本子集,适合快速原型开发和算法验证。构音障碍和非构音障碍的1:1比例使其特别适合训练二分类模型,性别分层使研究者能够分析性别对构音障碍检测的影响,不同场合录制确保了数据的生态效度。
应用价值与研究方向
该数据集在语音病理学、医疗AI、辅助诊断和言语康复研究领域具有重要应用价值,可用于开发构音障碍自动检测系统、言语障碍辅助诊断工具、康复训练评估平台和语音病理分析软件。研究方向包括:基于深度学习的构音障碍分类算法(如CNN、RNN、Transformer)、语音特征提取与分析、声学特征与发音特征融合、性别差异对检测性能的影响、迁移学习从健康语音到病理语音、实时构音障碍检测系统、可解释性AI用于识别关键语音障碍特征、以及跨语言构音障碍检测。数据集特别适合研究如何从音频信号中提取构音障碍的判别特征、如何处理患者间语音差异、以及如何为脑瘫和ALS患者提供客观的言语评估工具。此外,该数据集还可扩展至其他言语障碍检测(失语症、口吃)、语音治疗效果评估、远程言语病理评估等应用场景,为推动AI技术在言语病理学领域的应用、提升构音障碍早期筛查效率、支持康复训练个性化、改善患者生活质量提供重要的数据支撑和技术基础。TORGO数据库作为言语障碍研究的权威数据集,为构音障碍检测算法提供了标准化的评估基准,2,000样本的平衡设计和医学专业机构的背景保证了数据的高质量和临床相关性。
数据集来源
由张家梁(Bob)整理并于2026年在7zcode平台公开发布。
数据集信息
免责声明与引用
数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。
作者信息
作者:Bob (张家梁)
项目编号:Datasets-241
文件大小:120M
原创声明:本数据集为整理作品
联系方式

开源协议
本项目采用AGPL-3.0开源协议,允许个人和组织自由使用、修改和分发代码,但基于本项目的衍生作品必须同样开源,且用于提供网络服务时需向用户提供完整源代码。本项目仅供学习研究使用,作者不对使用本项目产生的任何后果承担责任,使用者应遵守当地法律法规,合理合法使用本项目。如本项目对您的研究或工作有所帮助,欢迎引用并注明出处。


评论(0)