摘要:这是一个用于虚假新闻检测研究的多模态数据集,包含13,325个样本,涵盖娱乐八卦(Gossip)和政治新闻(Political)两个领域。每个样本包含新闻文本内容、配图和真假标签(0或1),其中Gossip子集包含12,840个样本,Political子集包含485个样本。数据集配备了13,301张图像文件,适合用于基于文本-图像融合的多模态虚假新闻识别研究
数据集简介
数据集概述
数据集呈现明显的类别不平衡特征,Label 1占总样本的79.4%(10,580个),Label 0占20.6%(2,745个)。在Gossip子集中,Label 1的比例约为80%;在Political子集中,Label 1的比例约为68%。根据样本内容分析,Label 0很可能代表虚假新闻(Fake),Label 1代表真实新闻(Real),这种分布反映了真实世界中真实新闻数量通常多于虚假新闻的实际情况。
该数据集专门针对AAAI会议发表的研究项目设计,具有较高的学术价值。通过结合文本语义和视觉特征,研究者可以训练多模态深度学习模型来识别虚假新闻。数据集分为训练集和测试集,其中Gossip Train(10,010样本)、Gossip Test(2,830样本)、Political Train(381样本)、Political Test(104样本),适合用于监督学习、迁移学习和跨域虚假新闻检测等研究任务。
数据集来源
FakeNewsNet – 一个包含GossipCop(娱乐八卦)和PolitiFact(政治新闻)两个子集的多模态虚假新闻检测基准数据集,广泛应用于AAAI等顶级会议的虚假新闻检测研究。由张家梁(Bob)整理并于2026年在7zcode平台公开发布。
数据集信息
免责声明与引用
数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。
作者信息
作者:Bob (张家梁)
项目编号:Datasets-23
文件大小:2.5G
原创声明:本数据集为整理作品
联系方式

开源协议
本项目采用AGPL-3.0开源协议,允许个人和组织自由使用、修改和分发代码,但基于本项目的衍生作品必须同样开源,且用于提供网络服务时需向用户提供完整源代码。本项目仅供学习研究使用,作者不对使用本项目产生的任何后果承担责任,使用者应遵守当地法律法规,合理合法使用本项目。如本项目对您的研究或工作有所帮助,欢迎引用并注明出处。


评论(0)