摘要:该数据集是一个面向呼吸音分析、异常呼吸音检测与呼吸系统疾病智能诊断研究构建的音频数据集。
数据集概述
该数据集是一个面向呼吸音分析、异常呼吸音检测与呼吸系统疾病智能诊断研究构建的音频数据集。数据集包含来自 126 名患者的 920 条呼吸音录音,单段录音时长约为 10~90 秒,总录音时长约 5.5 小时,覆盖儿童、成人和老年人等不同年龄群体。数据同时包含清晰呼吸音及带有真实环境噪声的录音,可用于研究机器学习和深度学习模型在实际临床环境中的呼吸音识别能力。
数据结构与关键特征
数据集包含 920 个 WAV 音频文件及对应的 920 个 TXT 注释文件,共标注 6898 个呼吸周期,其中 1864 个周期包含啰音(Crackles)、886 个周期包含喘鸣音(Wheezes)、506 个周期同时包含啰音和喘鸣音。每个注释文件记录呼吸周期的开始时间、结束时间以及啰音和喘鸣音是否存在。音频文件名还包含患者编号、录音序号、胸部采集位置、采集模式和录音设备等信息,采集位置覆盖气管、左右前胸、左右后胸和左右侧胸。除此之外,数据集还提供患者诊断结果及年龄、性别、BMI、儿童体重和身高等人口统计信息,为多维度呼吸系统疾病分析提供支持。
应用价值与研究方向
该数据集适用于呼吸音分类、啰音与喘鸣音检测、呼吸周期自动分割、肺部疾病识别以及智能电子听诊系统等研究方向。研究者可以对 WAV 音频进行去噪、分帧和时频分析,并提取 MFCC、Mel 频谱图、STFT、Chroma 等声学特征,再结合 CNN、CRNN、LSTM、Audio Transformer 等模型进行识别。结合患者诊断信息,还可进一步研究 **COPD(慢性阻塞性肺疾病)、LRTI(下呼吸道感染)、URTI(上呼吸道感染)**等疾病的辅助识别,并用于开发基于数字听诊器的智能呼吸健康监测和临床辅助诊断系统。
数据集来源
由张家梁(Bob)整理并于2026年在7zcode平台公开发布。
数据集信息
免责声明与引用
数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。
作者信息
作者:Bob (张家梁)
项目编号:Datasets-820
文件大小:3.68G
原创声明:本数据集为整理作品
联系方式

开源协议
本项目采用AGPL-3.0开源协议,允许个人和组织自由使用、修改和分发代码,但基于本项目的衍生作品必须同样开源,且用于提供网络服务时需向用户提供完整源代码。本项目仅供学习研究使用,作者不对使用本项目产生的任何后果承担责任,使用者应遵守当地法律法规,合理合法使用本项目。如本项目对您的研究或工作有所帮助,欢迎引用并注明出处。


评论(0)