摘要:多模态网络钓鱼检测数据集是一个面向网络安全威胁识别和恶意网址检测研究的数据集,主要用于构建基于深度学习的智能钓鱼攻击检测模型。

数据集概述

多模态网络钓鱼检测数据集是一个面向网络安全威胁识别和恶意网址检测研究的数据集,主要用于构建基于深度学习的智能钓鱼攻击检测模型。该数据集共包含1697个URL样本,其中包括1147个合法网址和550个网络钓鱼网址,数据来源涵盖Tranco Top-1M数据库中的可信网站以及PhishTank、URLhaus等公开钓鱼网址数据库。数据集通过结合网页地址信息与视觉内容特征,为多模态网络安全分析提供数据支持,可用于研究URL语义特征、网页视觉特征以及二者融合对钓鱼攻击识别效果的影响。

数据结构与关键特征

该数据集主要由URL文本数据和网页图像特征组成,形成文本与视觉融合的数据结构。其中,URL信息包含域名结构、字符分布、路径模式、特殊符号数量等潜在安全特征,可用于分析恶意网址的语义规律;网页视觉信息通过页面截图或图像特征描述网站布局、界面元素、登录窗口、品牌仿冒等视觉线索。数据集采用平衡类别设计,包括合法URL类别与钓鱼URL类别,可用于训练Bi-LSTM模型提取URL序列特征,并结合VGG16模型提取网页图像深层视觉特征,通过多模态融合方法实现更加准确的钓鱼网站分类。

应用价值与研究方向

该数据集在网络安全、人工智能检测和智能防御领域具有较高应用价值,可用于钓鱼网站检测、恶意链接识别、网络威胁预警以及浏览器安全防护等任务。研究人员可以利用机器学习、深度学习和多模态融合技术,探索文本序列模型与计算机视觉模型在网络攻击检测中的协同作用。进一步研究方向包括基于Transformer的URL语义理解、网页截图视觉分析、跨模态特征融合、实时钓鱼攻击检测系统以及面向大规模互联网环境的自动化安全防御平台开发,为提升网络空间安全防护能力提供技术支持。

数据集来源

由张家梁(Bob)整理并于2026年在7zcode平台公开发布。

数据集信息

免责声明与引用

数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。

作者信息

作者:Bob (张家梁)
项目编号:Datasets-414
文件大小:10K
原创声明:本数据集为整理作品

联系方式

开源协议

本项目采用AGPL-3.0开源协议,允许个人和组织自由使用、修改和分发代码,但基于本项目的衍生作品必须同样开源,且用于提供网络服务时需向用户提供完整源代码。本项目仅供学习研究使用,作者不对使用本项目产生的任何后果承担责任,使用者应遵守当地法律法规,合理合法使用本项目。如本项目对您的研究或工作有所帮助,欢迎引用并注明出处。

声明:本站所有项目资源都可以正常运行,亲测无错!而且我们录制了演示视频,在我们注明的环境版本下,项目运行效果完全和演示视频一致。客服QQ:下载须知