摘要:该数据集用于研究模型能否在不读取新闻正文和标题的情况下,仅根据新闻封面图片判断整篇报道的情感倾向。

数据集概述

该数据集用于研究模型能否在不读取新闻正文和标题的情况下,仅根据新闻封面图片判断整篇报道的情感倾向。数据集包含10,000篇新闻文章的封面图片,新闻来源覆盖BBC、路透社、纽约时报、卫报、CNN和福克斯新闻等媒体,相关内容通过GDELT收集,情感标签则根据文章文本由Gemini 2.5 Flash Lite生成。

数据结构与关键特征

数据集由images、texts和metadata.csv三部分组成。images目录存放新闻封面图片,texts目录保存对应的新闻文本,metadata.csv用于关联图像、文本、新闻来源及情感标签等信息。图像涵盖经济、医疗、政治、灾害、科技和社会事件等多种新闻主题,可通过人物表情、场景氛围、色彩和构图推断报道倾向。由于标签由大模型根据文章文本自动生成,使用时需要注意潜在的标签噪声与模型偏差。

应用价值与研究方向

该数据集可用于新闻图像正负面二分类、连续情感得分回归、情绪基调与情感倾向多标签预测,以及图像和文章文本联合建模的多模态情感分析。研究人员还可以探索视觉线索与新闻叙事之间的关系,分析媒体选图偏好及不同新闻来源的视觉框架差异,并用于训练新闻推荐、内容审核、舆情分析和跨模态新闻理解模型。

数据集来源

由张家梁(Bob)整理并于2026年在7zcode平台公开发布。

数据集信息

免责声明与引用

数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。

作者信息

作者:Bob (张家梁)
项目编号:Datasets-627
文件大小:150M
原创声明:本数据集为整理作品

联系方式

开源协议

本项目采用AGPL-3.0开源协议,允许个人和组织自由使用、修改和分发代码,但基于本项目的衍生作品必须同样开源,且用于提供网络服务时需向用户提供完整源代码。本项目仅供学习研究使用,作者不对使用本项目产生的任何后果承担责任,使用者应遵守当地法律法规,合理合法使用本项目。如本项目对您的研究或工作有所帮助,欢迎引用并注明出处。

声明:本站所有项目资源都可以正常运行,亲测无错!而且我们录制了演示视频,在我们注明的环境版本下,项目运行效果完全和演示视频一致。客服QQ:下载须知