摘要:婴儿哭声识别数据集是一套面向婴儿哭声分类、需求识别和智能看护研究构建的音频数据集,主要通过分析婴儿声音信号判断其可能处于的状态或需求。
数据集概述
婴儿哭声识别数据集是一套面向婴儿哭声分类、需求识别和智能看护研究构建的音频数据集,主要通过分析婴儿声音信号判断其可能处于的状态或需求。主数据目录共包含 866 个有效 WAV 音频文件及 866 个一一对应的 JSON 标注文件,每段音频时长约为 14~15 秒,且均为单声道。数据集共设置 7 个类别,分别为 hungry、hug、sleepy、awake、diaper、uncomfortable 和 silence,能够覆盖饥饿、需要安抚、困倦、清醒、更换尿布、身体不适以及安静等常见状态。数据整体类别分布较为接近,适合开展多类别音频识别和婴儿状态分析实验
数据结构与关键特征
数据集采用“WAV 音频 + JSON 标签”的一一对应结构,每个音频文件均具有同名 JSON 标注文件,标签通过 labels 列表中的 name 字段记录具体类别。7 个类别的样本数量分别为 hungry 136 个、hug 155 个、sleepy 133 个、awake 120 个、diaper 114 个、uncomfortable 106 个和 silence 102 个,共计 866 条有效样本。音频编码包含 16-bit PCM WAV 和 32-bit IEEE Float WAV 两种形式,采样率主要为 16 kHz 和 44.1 kHz,因此在建模前适合统一转换为单声道、16 kHz、16-bit PCM 格式。同时,数据根目录还存在一个与主数据目录中 3.wav 重复的额外音频,正式训练时应排除该重复文件,并采用分层抽样方式划分训练集、验证集和测试集,以保持各类别比例基本一致。
应用价值与研究方向
该数据集可用于婴儿哭声自动分类、婴儿需求与状态识别、声音事件检测、智能婴儿监护和家庭辅助看护系统等研究,也适合作为音频机器学习与深度学习实验数据。研究中可从原始波形中提取 MFCC、梅尔频谱图、频谱质心、过零率等声学特征,并采用支持向量机、随机森林等传统模型,或 CNN、CRNN、RNN、音频 Transformer 等深度学习模型进行七分类识别;也可以直接使用原始音频波形开展端到端学习。进一步的研究方向包括类别不平衡处理、跨采样率音频标准化、哭声与静音类别区分、噪声环境下的鲁棒识别、轻量化模型部署以及实时婴儿状态监测等。模型输出适合作为智能看护中的辅助信息,不应替代专业医疗诊断或实际照护判断。
数据集来源
由张家梁(Bob)整理并于2026年在7zcode平台公开发布。
数据集信息
免责声明与引用
数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。
作者信息
作者:Bob (张家梁)
项目编号:Datasets-547
文件大小:338M
原创声明:本数据集为整理作品
联系方式

开源协议
本项目采用AGPL-3.0开源协议,允许个人和组织自由使用、修改和分发代码,但基于本项目的衍生作品必须同样开源,且用于提供网络服务时需向用户提供完整源代码。本项目仅供学习研究使用,作者不对使用本项目产生的任何后果承担责任,使用者应遵守当地法律法规,合理合法使用本项目。如本项目对您的研究或工作有所帮助,欢迎引用并注明出处。


评论(0)