摘要:本数据集由两个关联文件组成,提供了用于检测虚假社交媒体账号和恶意欺诈内容的全面行为与档案级信息。数据集包含131,284条用户活动和帖子记录,以及5,000个对应的用户档案条目,覆盖全球多个国家和地区。每个条目均标注了真实与虚假标签(is_fake),支持监督学习任务。数据集专为社交媒体取证、虚假账号检测、情感与可信度分析以及网络犯罪分类等机器学习研究而设计,整合了地理位置信息(国家、地区、城市)、平台与设备元数据、隐私设置、认证状态、媒体存在性、档案完整度以及可疑行为模式标识等多维特征。
数据集简介
数据集概述
数据集采用行为-档案双层结构的多模态组织方式。用户活动文件(raw_user_activities.csv)包含24个特征字段,涵盖时间戳、内容特征(点赞数、评论数、分享数、字符数、话题标签数、提及数、URL标识)、媒体类型、发布设备与平台、时间行为特征(发布时段、星期、是否周末)、地理位置和语言等维度。用户档案文件(raw_user_profiles.csv)包含用户身份信息(用户名、全名)、邮箱、账号创建日期、账号年龄、档案完整度、所在地、社交关系指标(关注者数、关注数、帖子数)、隐私与认证状态、档案元素完整性(头像、横幅、简介、网站、位置)、账号类型和语言偏好。这种行为数据与身份特征融合的结构支持从内容异常和账号特征两个维度进行虚假检测。
该数据集在社交媒体安全、数字取证和网络犯罪防范领域具有重要应用价值。支持的研究任务包括:虚假账号分类与检测、恶意内容识别、社交机器人识别、多模态特征融合、行为模式异常检测、账号可信度评分、时序行为分析以及跨平台欺诈检测。数据集的地理覆盖广泛性和多维度特征使其适用于全球化的社交媒体监管研究。此外,时间行为特征支持昼夜节律分析和协同欺诈网络识别,社交关系指标有助于图神经网络和社交网络分析方法的应用。数据集采用CC BY-NC-SA 4.0许可证,为学术研究、网络安全工具开发、平台内容审核系统优化以及数字素养教育提供了数据支撑。
数据集来源
包含131,284条用户活动记录和5,000个用户档案的社交媒体虚假检测数据集,整合行为特征、地理位置、平台元数据和账号属性,标注真实与虚假标签用于监督学习。由张家梁(Bob)整理并于2026年在7zcode平台公开发布。
数据集信息
免责声明与引用
数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。
作者信息
作者:Bob (张家梁)
项目编号:Datasets-39
文件大小:3.4M
原创声明:本数据集为整理作品
联系方式

开源协议
本项目采用AGPL-3.0开源协议,允许个人和组织自由使用、修改和分发代码,但基于本项目的衍生作品必须同样开源,且用于提供网络服务时需向用户提供完整源代码。本项目仅供学习研究使用,作者不对使用本项目产生的任何后果承担责任,使用者应遵守当地法律法规,合理合法使用本项目。如本项目对您的研究或工作有所帮助,欢迎引用并注明出处。


评论(0)