摘要:面向语音情感识别、情感计算与音频分类研究的高质量语音数据集,由多伦多大学相关研究团队构建。
数据集概述
面向语音情感识别、情感计算与音频分类研究的高质量语音数据集。数据集由两名女性说话者录制,年龄分别为 26 岁和 64 岁,每位说话者围绕 200 个目标词进行语音表达,并分别呈现 愤怒、厌恶、恐惧、快乐、愉快惊讶、悲伤和中性 7 种基本情绪。数据集共包含 2800 个 WAV 音频文件,录音质量较高,尤其适合用于训练和评估语音情感分类模型。
数据结构与关键特征
TESS 数据集按照“说话者 + 情绪类别”进行文件夹组织,每位女性说话者的不同情绪分别保存在独立目录中,每个情绪目录包含 200 个目标词对应的音频文件。所有语音均使用固定载体句式 “Say the word ___” 进行录制,从而在控制语言内容的同时突出不同情绪状态下的声学变化。其核心可分析特征包括基频、能量、语速、音高变化、MFCC、频谱质心、过零率、共振峰及语音节奏等,可用于研究不同情绪在声学层面的差异。
应用价值与研究方向
该数据集适用于七类语音情感分类、说话人无关情感识别、声学特征分析和情感语音建模等任务。研究人员可以采用 MFCC + SVM、随机森林等传统方法,也可以使用 CNN、CRNN、LSTM、Audio Transformer、Wav2Vec 2.0 或 HuBERT 等深度学习模型进行情绪识别。进一步可研究年龄差异对情绪表达的影响、跨说话人泛化、类别混淆分析、多数据集联合训练以及面向语音助手、智能客服和人机交互系统的实时情绪识别。
数据集来源
由张家梁(Bob)整理并于2026年在7zcode平台公开发布。
数据集信息
免责声明与引用
数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。
作者信息
作者:Bob (张家梁)
项目编号:Datasets-472
文件大小:420M
原创声明:本数据集为整理作品
联系方式

开源协议
本项目采用AGPL-3.0开源协议,允许个人和组织自由使用、修改和分发代码,但基于本项目的衍生作品必须同样开源,且用于提供网络服务时需向用户提供完整源代码。本项目仅供学习研究使用,作者不对使用本项目产生的任何后果承担责任,使用者应遵守当地法律法规,合理合法使用本项目。如本项目对您的研究或工作有所帮助,欢迎引用并注明出处。


评论(0)