摘要:本数据集是一个专门用于网络钓鱼检测研究的精心策划的平衡型URL数据集,包含1,697个经过筛选和标注的网址样本。数据集采用平衡设计,包含1,147个合法URL(来自Tranco全球排名前100万的网站)和550个钓鱼URL(从PhishTank和URLhaus两个权威威胁情报平台获取),确保了正负样本的合理分布,有效避免了类别不平衡问题对模型训练的影响。该数据集专为多模态深度学习模型设计,已成功应用于Bi-LSTM(双向长短期记忆网络)与VGG16卷积神经网络的融合模型训练,通过结合URL文本特征和网页视觉特征两种模态信息,实现了对网络钓鱼攻击的高精度识别。

数据集简介

数据集概述

数据集的构建遵循严格的质量控制标准,合法URL样本源自Tranco排名系统——一个基于多个流行排名列表的综合性网站排名服务,从其Top-1M(前100万)网站中精选出1,147个具有代表性的正常网站,确保了合法样本的权威性和多样性。钓鱼URL样本则从PhishTank(社区驱动的钓鱼网站验证平台)和URLhaus(恶意URL共享平台)两个专业威胁情报来源采集550个经过验证的钓鱼网址,这些样本代表了真实世界中的各种钓鱼攻击手法。数据集经过精心策划(curated)和平衡处理(balanced),不仅在数量上保持合理比例,更在样本质量、多样性和时效性上进行了严格把关。该数据集支持多模态分析方法,可以同时提取URL字符串的文本特征和网页截图的视觉特征,为基于深度学习的钓鱼检测模型提供了丰富的训练数据。

本数据集为网络安全领域的钓鱼检测研究提供了高质量的基准数据资源,特别是在多模态深度学习方法的开发和验证方面具有重要价值。该数据集已成功应用于Bi-LSTM + VGG16多模态融合模型的训练,其中Bi-LSTM网络负责处理URL文本序列特征,捕捉钓鱼网址在字符模式和结构上的异常,而VGG16卷积神经网络则分析网页视觉外观,识别伪装和模仿真实网站的视觉线索。这种多模态融合方法显著提升了钓鱼检测的准确率和鲁棒性,能够有效应对单一特征容易被绕过的问题。该数据集对于浏览器安全插件、邮件过滤系统、企业网络防护、安全意识培训等实际应用场景具有直接的技术支撑作用,有助于提升互联网用户对钓鱼攻击的防御能力,减少因钓鱼攻击导致的身份盗用、财务损失和数据泄露等安全事件。

数据集来源

本数据集包含1,697个精心策划的URL样本,其中1,147个合法URL来自Tranco全球网站排名Top-1M(前100万网站),550个钓鱼URL来自PhishTank社区驱动验证平台和URLhaus恶意URL共享平台,采用平衡设计确保正负样本合理分布,已成功应用于Bi-LSTM与VGG16多模态融合模型的训练,通过结合URL文本特征和网页视觉特征实现高精度钓鱼检测,为网络安全防护、浏览器安全插件、邮件过滤系统和企业网络防护等实际应用提供可靠的数据支撑。

数据集信息

免责声明与引用

数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。

作者信息

作者:Bob (张家梁)
项目编号:Datasets-19
文件大小:10K
原创声明:本数据集为整理作品

联系方式

开源协议

本项目采用AGPL-3.0开源协议,允许个人和组织自由使用、修改和分发代码,但基于本项目的衍生作品必须同样开源,且用于提供网络服务时需向用户提供完整源代码。本项目仅供学习研究使用,作者不对使用本项目产生的任何后果承担责任,使用者应遵守当地法律法规,合理合法使用本项目。如本项目对您的研究或工作有所帮助,欢迎引用并注明出处。

声明:本站所有项目资源都可以正常运行,亲测无错!而且我们录制了演示视频,在我们注明的环境版本下,项目运行效果完全和演示视频一致。客服QQ:下载须知