摘要:该数据集面向电视场景理解与导演决策预测,共包含4,622条多模态记录,将视觉帧、音频片段和文本内容进行同步关联。

数据集概述

该数据集面向电视场景理解与导演决策预测,共包含4,622条多模态记录,将视觉帧、音频片段和文本内容进行同步关联。每条记录描述一个具体场景的视觉活动、对话、音乐、环境声音、情绪和叙事强度,并提供相应的导演决策标签,可用于分析多种感知线索如何共同影响场景切换、镜头焦点调整和叙事重点安排。

数据结构与关键特征

主数据通过Sample_ID、Scene_ID和Episode_ID标识样本来源,并利用Audio_ID、Image_ID和Text_ID关联三种模态。特征包括音频类型、情感标签、场景强度、对话状态、背景音乐等级、说话者数量、视觉密度、场景亮度和文本长度,目标字段为Decision_Label。此外,Text.csv约405.61 MB,包含电影中英文名称、用户、评分、评论、发布时间和点赞量等10个字段。由于评论数据与场景级导演决策数据的语义层级不同,使用前应重点核验Text_ID与评论ID之间是否存在有效映射,确认其属于核心文本模态还是独立的辅助数据。

应用价值与研究方向

该数据集可用于导演决策预测、场景转换识别、镜头选择、叙事节奏分析、自动视频剪辑和影视内容理解。研究方向包括音频—视觉—文本特征融合、多模态Transformer、情绪与场景强度建模、跨模态注意力学习及导演动作分类。辅助评论数据还可用于观众情感分析、评分预测和互动趋势研究;若能与具体剧集或场景可靠关联,可进一步分析导演决策与观众反馈之间的关系。

数据集来源

由张家梁(Bob)整理并于2026年在7zcode平台公开发布。

数据集信息

免责声明与引用

数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。

作者信息

作者:Bob (张家梁)
项目编号:Datasets-565
文件大小:260M
原创声明:本数据集为整理作品

联系方式

开源协议

本项目采用AGPL-3.0开源协议,允许个人和组织自由使用、修改和分发代码,但基于本项目的衍生作品必须同样开源,且用于提供网络服务时需向用户提供完整源代码。本项目仅供学习研究使用,作者不对使用本项目产生的任何后果承担责任,使用者应遵守当地法律法规,合理合法使用本项目。如本项目对您的研究或工作有所帮助,欢迎引用并注明出处。

声明:本站所有项目资源都可以正常运行,亲测无错!而且我们录制了演示视频,在我们注明的环境版本下,项目运行效果完全和演示视频一致。客服QQ:下载须知