摘要:该数据集面向电视新闻节目中的商业广告自动识别任务,数据来源于3个印度新闻频道和2个国际新闻频道,共包含约150小时的电视广播内容,每个频道约30小时。

数据集概述

该数据集面向电视新闻节目中的商业广告自动识别任务,数据来源于3个印度新闻频道和2个国际新闻频道,共包含约150小时的电视广播内容,每个频道约30小时。原始视频采用720×576分辨率和25帧/秒的帧率录制,并从视频镜头中提取标准化视听特征,用于区分新闻内容与商业广告片段。

数据结构与关键特征

数据集由 BBC.txt、CNN.txt、CNNIBN.txt、NDTV.txt、TIMESNOW.txt 和 readme.txt 组成,五个频道分别存储在独立的文本文件中。每条记录对应一个视频镜头及其视听特征,文件保留镜头在原始广播中的出现顺序,可用于分析广告片段的连续性和上下文关系。数据覆盖不同国家、频道风格和新闻编排方式,具有较明显的跨频道差异。

应用价值与研究方向

该数据集可用于电视广告自动检测、新闻与广告二分类、广播内容分割、节目监测、广告时长统计及媒体内容管理。研究方向包括传统机器学习分类、时序神经网络、Transformer序列建模、音视频特征融合、镜头边界分析、类别不平衡处理、跨频道迁移学习和领域泛化,还可结合原始视频进一步研究端到端广告定位与实时广播监控。

数据集来源

由张家梁(Bob)整理并于2026年在7zcode平台公开发布。

数据集信息

免责声明与引用

数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。

作者信息

作者:Bob (张家梁)
项目编号:Datasets-575
文件大小:71M
原创声明:本数据集为整理作品

联系方式

开源协议

本项目采用AGPL-3.0开源协议,允许个人和组织自由使用、修改和分发代码,但基于本项目的衍生作品必须同样开源,且用于提供网络服务时需向用户提供完整源代码。本项目仅供学习研究使用,作者不对使用本项目产生的任何后果承担责任,使用者应遵守当地法律法规,合理合法使用本项目。如本项目对您的研究或工作有所帮助,欢迎引用并注明出处。

声明:本站所有项目资源都可以正常运行,亲测无错!而且我们录制了演示视频,在我们注明的环境版本下,项目运行效果完全和演示视频一致。客服QQ:下载须知