摘要:该数据集面向网络欺凌自动检测任务,汇集了来自Twitter、维基百科讨论页和YouTube等不同来源的社交媒体文本。

数据集概述

该数据集面向网络欺凌自动检测任务,汇集了来自Twitter、维基百科讨论页和YouTube等不同来源的社交媒体文本。样本按照是否包含欺凌行为进行标注,并涵盖仇恨言论、攻击性表达、侮辱、毒性内容、种族主义和性别歧视等多种网络不良行为,可为跨平台内容安全模型的训练和评估提供数据支持。

数据结构与关键特征

数据集由多个经过解析的CSV文件组成,包括攻击性、攻击行为、毒性、Twitter综合数据、Twitter种族主义、Twitter性别歧视、YouTube及Kaggle来源数据。各文件保存平台文本及其相应类别标签,既包含欺凌与非欺凌二分类信息,也反映不同类型的有害语言。数据具有来源平台多样、表达方式复杂、类别定义存在差异及文本噪声较多等特点,适合开展跨数据源联合建模与泛化能力研究。

应用价值与研究方向

该数据集可用于网络欺凌识别、仇恨言论检测、毒性评论过滤、社交平台内容审核及网络环境风险预警。研究方向包括传统机器学习与Transformer文本分类、多任务和多标签学习、跨平台领域适应、类别不平衡处理、隐晦攻击识别、对抗鲁棒性、模型可解释性及实时审核系统开发;还应关注数据偏差、群体公平性、语境误判和用户隐私保护,避免模型对特定身份群体或语言表达产生不合理歧视。

数据集来源

由张家梁(Bob)整理并于2026年在7zcode平台公开发布。

数据集信息

免责声明与引用

数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。

作者信息

作者:Bob (张家梁)
项目编号:Datasets-588
文件大小:64M
原创声明:本数据集为整理作品

联系方式

开源协议

本项目采用AGPL-3.0开源协议,允许个人和组织自由使用、修改和分发代码,但基于本项目的衍生作品必须同样开源,且用于提供网络服务时需向用户提供完整源代码。本项目仅供学习研究使用,作者不对使用本项目产生的任何后果承担责任,使用者应遵守当地法律法规,合理合法使用本项目。如本项目对您的研究或工作有所帮助,欢迎引用并注明出处。

声明:本站所有项目资源都可以正常运行,亲测无错!而且我们录制了演示视频,在我们注明的环境版本下,项目运行效果完全和演示视频一致。客服QQ:下载须知