摘要:该数据集面向网络钓鱼邮件识别与电子邮件安全研究,由Enron、Ling、CEAS 2008、Nazario、Nigerian Fraud和SpamAssassin等多个公开邮件数据集整合而成。
数据集概述
该数据集面向网络钓鱼邮件识别与电子邮件安全研究,由Enron、Ling、CEAS 2008、Nazario、Nigerian Fraud和SpamAssassin等多个公开邮件数据集整合而成。数据同时包含邮件主题、正文内容、通信背景和分类标签,可用于分析网络钓鱼、垃圾邮件及合法邮件在语言表达、诱导策略、发送方式和结构特征方面的差异,为构建自动化恶意邮件检测系统提供较大规模的数据基础。
数据结构与关键特征
数据集以多个CSV文件保存,包括CEAS_08.csv、Enron.csv、Ling.csv、Nazario.csv、Nigerian_Fraud.csv、SpamAssasin.csv以及合并后的phishing_email.csv。最终数据集约包含82,500封邮件,其中垃圾或网络钓鱼邮件42,891封、合法邮件39,595封,类别分布相对均衡。不同来源文件包含邮件主题、正文、发件人、收件人、发送日期及类别标签等字段,但原始字段结构可能存在差异,因此建模前通常需要进行字段统一、缺失值处理、重复邮件清理、HTML标签移除、文本规范化和敏感信息匿名化。
应用价值与研究方向
该数据集可用于网络钓鱼邮件检测、垃圾邮件过滤、欺诈意图识别、恶意文本分类和邮件安全风险评估等任务。研究人员可以探索TF-IDF与传统机器学习、CNN、LSTM、Transformer及预训练语言模型等方法,并结合发件人信息、链接特征、邮件结构和时间属性构建多特征检测模型;还可围绕跨数据源泛化、类别不平衡、对抗性文本、概念漂移、模型可解释性以及实时邮件网关部署等方向开展研究,从而提升复杂网络环境下钓鱼邮件识别的准确性与鲁棒性。
数据集来源
由张家梁(Bob)整理并于2026年在7zcode平台公开发布。
数据集信息
免责声明与引用
数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。
作者信息
作者:Bob (张家梁)
项目编号:Datasets-710
文件大小:47M
原创声明:本数据集为整理作品
联系方式

开源协议
本项目采用AGPL-3.0开源协议,允许个人和组织自由使用、修改和分发代码,但基于本项目的衍生作品必须同样开源,且用于提供网络服务时需向用户提供完整源代码。本项目仅供学习研究使用,作者不对使用本项目产生的任何后果承担责任,使用者应遵守当地法律法规,合理合法使用本项目。如本项目对您的研究或工作有所帮助,欢迎引用并注明出处。


评论(0)