摘要:面向计算机视觉反钓鱼研究的小规模多类别网页截图数据集,旨在为钓鱼网页识别与品牌仿冒检测提供标准化评测数据。

数据集概述

面向计算机视觉反钓鱼研究的小规模多类别网页截图数据集,旨在为钓鱼网页识别与品牌仿冒检测提供标准化评测数据。数据于2018年3月至5月采集,其中钓鱼网页来源于PhishTank和OpenPhish,正常网页则通过随机方式收集。

数据结构与关键特征

数据集共包含2852张网页截图,其中训练集1313张、测试集1539张,并按照train和val目录组织。数据涵盖15个类别,包括14个经常遭受钓鱼仿冒的品牌类别,以及用于表示正常网页、未知网页或其他网页的other类别;为符合实际反钓鱼场景,other类别包含相对更多的正常网页样本。

应用价值与研究方向

该数据集适用于基于网页视觉外观的钓鱼网站识别、品牌仿冒预测、多类别图像分类、紧凑视觉特征研究以及深度学习反钓鱼模型评估。研究人员可利用网页布局、颜色、图标和视觉结构等特征,在不依赖URL、HTML代码或文本内容的情况下识别钓鱼网页,并进一步研究未知品牌检测、类别不平衡处理和跨网站泛化能力。

数据集来源

由张家梁(Bob)整理并于2026年在7zcode平台公开发布。

数据集信息

免责声明与引用

数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。

作者信息

作者:Bob (张家梁)
项目编号:Datasets-639
文件大小:760M
原创声明:本数据集为整理作品

联系方式

开源协议

本项目采用AGPL-3.0开源协议,允许个人和组织自由使用、修改和分发代码,但基于本项目的衍生作品必须同样开源,且用于提供网络服务时需向用户提供完整源代码。本项目仅供学习研究使用,作者不对使用本项目产生的任何后果承担责任,使用者应遵守当地法律法规,合理合法使用本项目。如本项目对您的研究或工作有所帮助,欢迎引用并注明出处。

声明:本站所有项目资源都可以正常运行,亲测无错!而且我们录制了演示视频,在我们注明的环境版本下,项目运行效果完全和演示视频一致。客服QQ:下载须知