摘要:德语嗓音病理学数据集包含德语母语者的 .wav 音频录音(健康对照和多种嗓音障碍患者),采用标准化录音协议在声处理室采集(高保真麦克风,特定发声任务如持续元音、标准文本阅读)。所有诊断由耳鼻喉科医生通过喉镜检查确认,数据已匿名化处理,配有元数据(患者 ID、年龄、性别、诊断),支持非侵入性嗓音病理学筛查、二元和多类别分类以及声学特征分析研究。
数据集简介
数据集概述
德语嗓音病理学数据集(German Voice Pathology Dataset)是一个包含德语母语者 .wav 音频录音的嗓音疾病检测和分类数据集,专为喉部疾病(病理学)的自动检测而设计。数据集包含健康个体(对照组)和被诊断患有各种嗓音障碍患者的录音,旨在促进计算生物声学和医疗 AI 领域的研究与开发,可用于训练和评估非侵入性嗓音病理学初步筛查的机器学习模型,为耳鼻喉科医生和语言病理学家提供辅助。数据收集遵循标准化录音协议:参与者在声处理室或安静临床室内,使用高保真电容麦克风(距离口部约 15 cm)执行特定发声任务(如持续发 /a/ 音 3-5 秒、阅读标准化德语文本”北风与太阳”或从一数到十)。所有病理标签由合格的耳鼻喉科医生通过喉镜检查或临床检查确认,所有参与者提供知情同意,数据已匿名化处理以保护患者隐私。
数据结构与类别特征
数据集组织为 audio/ 目录和 metadata.csv 元数据文件。音频文件以 .wav 格式存储,技术规格包括采样率(如 44100 Hz 或 16000 Hz)、位深度(如 16-bit)和单声道通道。文件命名遵循一致模式(如 P001_A_N.wav,其中 P001 是匿名化患者 ID,A 是元音,N 代表声带结节)。元数据文件(metadata.csv)包含关键字段:filename(对应 .wav 文件名)、patient_id(匿名化说话者标识符)、age(年龄)、sex(性别,M/F)、diagnosis(目标标签,确认的医学诊断,如 Healthy、Vocal Nodules、Laryngitis、Polyp、Paralysis)以及可能的其他相关字段(如吸烟状态、诊断年限等)。数据集涵盖不同年龄段(如 25-70 岁)和性别的说话者,确保人口统计学多样性。
应用价值与研究方向
该数据集支持多个基于音频的机器学习和医疗 AI 应用方向。病理学分类:训练机器学习模型(SVM、随机森林或深度学习模型)区分健康和病理性嗓音(二元分类)或多种疾病类型(多类别分类)。特征提取与分析:提取和分析与嗓音障碍相关的经典声学特征,如抖动(Jitter,频率变化)、微振(Shimmer,幅度变化)、谐噪比(HNR)和梅尔频率倒谱系数(MFCCs)。深度学习应用:使用原始音频或其频谱图表示训练 CNN 或 RNN 进行端到端分类。生物标志物发现:研究哪些声学特征是德语人群特定喉部病症的最强预测因子。数据集适用于嗓音障碍筛查系统开发、语音病理学研究、非侵入性诊断工具构建以及跨语言嗓音分析比较研究,为改善耳鼻喉科诊断效率、支持远程医疗语音评估以及推动语音健康监测技术的发展提供数据基础。
数据集来源
该数据集包含德语母语者的 .wav 音频录音,涵盖健康对照和多种嗓音障碍患者(声带结节、喉炎、息肉、麻痹等),在标准化环境中通过特定发声任务采集(如持续元音、标准文本阅读),配有详细元数据(患者 ID、年龄、性别、诊断),所有诊断由耳鼻喉科医生通过喉镜检查确认,数据已匿名化处理,专为嗓音病理学自动检测和分类研究而构建。由张家梁(Bob)整理并于2026年在7zcode平台公开发布。
数据集信息
免责声明与引用
数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。
作者信息
作者:Bob (张家梁)
项目编号:Datasets-71
文件大小:290M
原创声明:本数据集为整理作品
联系方式

开源协议
本项目采用AGPL-3.0开源协议,允许个人和组织自由使用、修改和分发代码,但基于本项目的衍生作品必须同样开源,且用于提供网络服务时需向用户提供完整源代码。本项目仅供学习研究使用,作者不对使用本项目产生的任何后果承担责任,使用者应遵守当地法律法规,合理合法使用本项目。如本项目对您的研究或工作有所帮助,欢迎引用并注明出处。


评论(0)