摘要:本数据集选用 CREMA-D 和 RAVDESS 两个公开多模态情感识别数据集作为实验数据来源。两个数据集均包含语音和视频信息,能够同时提供语音声学特征与面部视觉特征,适合用于多模态情感识别模型的训练、验证和性能评估。

数据集简介

数据集概述

CREMA-D 数据集包含 91 名演员录制的 7,442 个音视频片段,演员年龄范围为 20~74 岁,涵盖不同性别和族裔。数据集包含愤怒、厌恶、恐惧、快乐、中性和悲伤 6 类基本情绪,并设置低、中、高及未指定等不同情绪强度,具有较丰富的情感表达形式。

RAVDESS 数据集由 24 名专业演员录制,共包含 7,356 条数据,其中视频语音文件 2,880 个。数据集涵盖中性、平静、快乐、悲伤、愤怒、恐惧、厌恶和惊讶 8 类情绪,并设置正常和强烈两种情绪强度。其音视频数据同步性较好、类别标注清晰,可为多模态情感识别算法研究提供可靠的数据基础。

1. CREMA-D

CREMA-D 数据库(Cao 等,2014)包含 7,442 个视频片段,由 91 名演员参与录制,其中男性 48 名、女性 43 名,年龄范围为 20~74 岁。演员具有不同的族裔背景,包括非裔美国人、亚裔、白人、西班牙裔以及未注明族裔。

演员使用英语朗读 12 个语音平衡句子,并分别表达六种基本情绪:

愤怒(Anger)、厌恶(Disgust)、恐惧(Fear)、快乐(Happy)、中性(Neutral)和悲伤(Sad)。

每种情绪按照四种情绪强度进行表达:

低(Low)、中(Medium)、高(High)和未指定(Unspecified)。

文件名标注

CREMA-D 数据集中的 7,442 个文件均具有唯一的文件名。文件名由 5 个部分组成,例如:

1001_DFA_ANG_XX_01.mp4

这些标识符分别描述样本的不同属性。

演员编号(Actor ID)

演员编号范围为 1001~1091,分别对应 91 名演员。

语句(Statement)

IEO = “现在是十一点钟。”
TIE = “事情就是这样发生的。”
IOM = “我正在去开会的路上。”
IWW = “我想知道这是怎么回事。”
TAI = “飞机快坐满了。”
MTI = “也许明天会很冷。”
IWL = “我想要一个新的闹钟。”
ITH = “我想我预约了医生。”
DFA = “别忘了带一件夹克。”
ITS = “我想我以前见过这个。”
TSI = “表面很滑。”
WSI = “我们几分钟后就会停下来。”

情绪(Emotion)

ANG = 愤怒
DIS = 厌恶
FEA = 恐惧
HAP = 快乐
NEU = 中性
SAD = 悲伤

情绪强度(Emotional Intensity)

LO = 低强度
MD = 中等强度
HI = 高强度
XX = 未指定

性别(Gender)

2. RAVDESS

RAVDESS 数据库(Livingstone & Russo,2018)包含 7,356 条录制数据,其中用于**视频语音(Video-Speech)**的文件共有 2,880 个。

该数据集由 24 名专业演员参与录制,其中男性 12 名、女性 12 名。演员使用北美英语朗读或演唱两条中性语句,并表现八种不同的情绪:

愤怒(Angry)、平静(Calm)、厌恶(Disgust)、恐惧(Fearful)、快乐(Happy)、中性(Neutral)、悲伤(Sad)和惊讶(Surprise)。

情绪强度分为两个等级:

正常(Normal)和强烈(Strong)。

每个文件均提供分辨率为 1280×720 的高清视频,同时配有同步的 48 kHz、16 位音频,从而形成内容丰富且较为均衡的多模态情感数据集,可用于多模态情感识别等相关研究。

文件名标注

RAVDESS 的 2,880 个视频语音文件均具有唯一文件名。

文件名由 7 个部分组成,例如:

01-01-01-01-01-01-01.mp4

这些编号分别表示样本的不同属性。

模态(Modality)

01 = 完整音视频(Full Audio-Visual)
02 = 仅视频(Video-only)
03 = 仅音频(Audio-only)

发声通道(Vocal Channel)

01 = 语音(Speech)
02 = 歌唱(Song)

情绪(Emotion)

01 = 中性(Neutral)
02 = 平静(Calm)
03 = 快乐(Happy)
04 = 悲伤(Sad)
05 = 愤怒(Angry)
06 = 恐惧(Fearful)
07 = 厌恶(Disgust)
08 = 惊讶(Surprised)

情绪强度(Emotional Intensity)

01 = 正常(Normal)
02 = 强烈(Strong)

注意:中性情绪不存在“强烈”强度等级。

语句(Statement)

01 = “孩子们正在门边说话。”
02 = “狗正坐在门边。”

重复次数(Repetition)

01 = 第 1 次重复
02 = 第 2 次重复

演员(Actor)

演员编号范围为 01~24。

其中:

奇数编号演员为男性,偶数编号演员为女性。

01 = 男性
02 = 女性

数据集来源

本文实验所采用的数据主要来源于两个公开的多模态情感识别数据集:CREMA-D 和 RAVDESS。论文引用:Livingstone, S. R. 和 Russo, F. A.(2018). 瑞尔森情感语音与歌唱音视频数据库(RAVDESS):一个基于北美英语面部表情和声音情感表达的动态多模态数据集. 《PLoS ONE》,13(5),e0196391。

数据集信息

免责声明与引用

数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。 如需引用,请在论文或报告中注明数据集名称与版本号。

作者信息

作者:Bob (张家梁)
项目编号:Datasets-6
文件大小:13.9G
原创声明:本数据集为整理作品

联系方式

开源协议

本项目采用AGPL-3.0开源协议,允许个人和组织自由使用、修改和分发代码,但基于本项目的衍生作品必须同样开源,且用于提供网络服务时需向用户提供完整源代码。本项目仅供学习研究使用,作者不对使用本项目产生的任何后果承担责任,使用者应遵守当地法律法规,合理合法使用本项目。如本项目对您的研究或工作有所帮助,欢迎引用并注明出处。

声明:本站所有项目资源都可以正常运行,亲测无错!而且我们录制了演示视频,在我们注明的环境版本下,项目运行效果完全和演示视频一致。客服QQ:下载须知