垃圾邮件、正常邮件与钓鱼信息数据集是一个包含约 515,000 条文本消息的多类别 NLP 数据集,分为正常消息(Ham,0)、垃圾消息(Spam,1)和钓鱼消息(Phishing,2)三类。数据集已完成标准化预处理(小写转换、去标点、去停用词、文本规范化),整合自多个公开数据源并统一标签格式,适用于垃圾邮件过滤、钓鱼检测和文本分类研究,支持传统机器学习(朴素贝叶斯、SVM、逻辑回归)和深度学习模型(LSTM、BERT)。
数据集简介
数据集概述
数据集采用简洁的二列结构:text 列包含消息内容,label 列标注消息类别(0/1/2 编码)。三个类别具有明确的语义区分:正常消息(Ham) 指合法、有用的日常通信内容,如个人对话、工作邮件或正常通知;垃圾消息(Spam) 指未经请求的推广性或无关消息,如商业广告、营销邮件或骚扰信息;钓鱼消息(Phishing) 指欺诈性或诈骗性消息,旨在窃取敏感信息、诱导点击恶意链接或进行金融欺诈。数据集的预处理流程确保了文本的一致性:所有文本转换为小写以消除大小写差异,移除标点符号减少噪声,清除停用词(如 the、is、and 等)降低维度并突出关键词,整体文本标准化提升特征提取质量。这种预处理后的数据格式特别适合 TF-IDF 向量化、词袋模型和词嵌入技术,为下游分类任务提供了即用型数据资源。
该数据集为网络安全、信息过滤和 NLP 研究领域提供多方面应用支持,核心应用包括垃圾邮件检测系统开发、钓鱼攻击识别模型训练、电子邮件和短信自动分类、NLP 文本分类项目实践以及网络安全威胁分析研究。研究人员和开发者可以利用该数据集训练传统机器学习分类器(朴素贝叶斯、逻辑回归、SVM)实现高效的文本过滤,开发深度学习模型(LSTM、BERT、Transformer)捕捉复杂的语义模式和上下文信息,或构建集成学习系统结合多种算法优势提升检测准确率。数据集的三类别设计使其能够同时处理一般垃圾信息过滤和高风险钓鱼攻击检测,为邮件服务提供商、即时通讯平台、企业安全系统和个人隐私保护工具提供了数据基础。通过支持多类别分类任务,该数据集有助于开发更精细的消息过滤策略、降低误判率、提升用户体验,并为理解垃圾消息和钓鱼攻击的语言特征、演化模式以及防御策略提供实证研究平台。
数据集来源
该数据集整合自多个公开数据源,包含约 515,000 条文本消息,经过统一的预处理流程(小写转换、标点符号移除、停用词清理、文本标准化)和标签格式标准化(正常消息、垃圾消息、钓鱼消息三类编码为 0/1/2),专为垃圾邮件过滤和钓鱼检测的机器学习与 NLP 研究项目而创建。由张家梁(Bob)整理并于2026年在7zcode平台公开发布。
数据集信息
免责声明与引用
数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。
作者信息
作者:Bob (张家梁)
项目编号:Datasets-56
文件大小:64M
原创声明:本数据集为整理作品
联系方式

开源协议
本项目采用AGPL-3.0开源协议,允许个人和组织自由使用、修改和分发代码,但基于本项目的衍生作品必须同样开源,且用于提供网络服务时需向用户提供完整源代码。本项目仅供学习研究使用,作者不对使用本项目产生的任何后果承担责任,使用者应遵守当地法律法规,合理合法使用本项目。如本项目对您的研究或工作有所帮助,欢迎引用并注明出处。


评论(0)