摘要:面向语音情感识别、多模态情绪分析与情感计算研究的大规模演员情绪数据集。
数据集概述
CREMA-D(Crowd-sourced Emotional Multimodal Actors Dataset,众包情感多模态演员数据集)是一个面向语音情感识别、多模态情绪分析与情感计算研究的大规模演员情绪数据集。数据集共包含 7,442 个原始音频片段,由 91 位演员录制,其中包括48位男性和43位女性,年龄范围约为 20–74岁。参与者具有较为多样的人口背景,使数据在说话人数量、性别和年龄方面具有较好的覆盖度。与只包含少量说话人的情感语音数据集相比,CREMA-D更适合用于评估模型的跨说话人泛化能力,并降低因模型记忆特定说话人特征而产生过拟合的风险。
数据结构与关键特征
CREMA-D中的演员朗读 12个固定句子,并以不同情绪和不同情绪强度进行表达。数据覆盖 愤怒、厌恶、恐惧、快乐、中性和悲伤6种情绪类别,同时设置低、中、高以及未指定4种情绪强度。由于同一文本可由不同演员、不同情绪和不同强度进行演绎,因此能够有效控制语言内容差异,并突出音高、能量、语速、节奏和音色等情感相关声学变化。音频可进一步提取MFCC、Mel频谱、基频、频谱质心、过零率、能量以及韵律等特征;CREMA-D本身也具有多模态属性,可用于结合语音与面部视觉信息开展联合情绪识别。
应用价值与研究方向
该数据集适用于六类情绪分类、情绪强度识别、跨说话人情感识别和音视频多模态融合等研究。研究人员可以采用CNN、CRNN、LSTM、Transformer、Wav2Vec 2.0、HuBERT等模型分析语音情绪,也可结合视觉模型和多模态Transformer研究声音与面部表情之间的互补关系。进一步可开展年龄与性别差异对情绪表达的影响、跨数据集迁移学习、情绪强度估计、说话人无关建模以及面向智能客服、虚拟助手、人机交互和情感计算系统的实时情绪识别研究。
数据集来源
由张家梁(Bob)整理并于2026年在7zcode平台公开发布。
数据集信息
免责声明与引用
数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。
作者信息
作者:Bob (张家梁)
项目编号:Datasets-474
文件大小:450M
原创声明:本数据集为整理作品
联系方式

开源协议
本项目采用AGPL-3.0开源协议,允许个人和组织自由使用、修改和分发代码,但基于本项目的衍生作品必须同样开源,且用于提供网络服务时需向用户提供完整源代码。本项目仅供学习研究使用,作者不对使用本项目产生的任何后果承担责任,使用者应遵守当地法律法规,合理合法使用本项目。如本项目对您的研究或工作有所帮助,欢迎引用并注明出处。


评论(0)