摘要:面向计算机视觉反钓鱼研究的小规模多类别网页截图数据集,旨在为钓鱼网页识别与品牌仿冒检测提供标准化评测数据。
数据集概述
面向计算机视觉反钓鱼研究的小规模多类别网页截图数据集,旨在为钓鱼网页识别与品牌仿冒检测提供标准化评测数据。数据于2018年3月至5月采集,其中钓鱼网页来源于PhishTank和OpenPhish,正常网页则通过随机方式收集。
数据结构与关键特征
数据集共包含2852张网页截图,其中训练集1313张、测试集1539张,并按照train和val目录组织。数据涵盖15个类别,包括14个经常遭受钓鱼仿冒的品牌类别,以及用于表示正常网页、未知网页或其他网页的other类别;为符合实际反钓鱼场景,other类别包含相对更多的正常网页样本。
应用价值与研究方向
该数据集适用于基于网页视觉外观的钓鱼网站识别、品牌仿冒预测、多类别图像分类、紧凑视觉特征研究以及深度学习反钓鱼模型评估。研究人员可利用网页布局、颜色、图标和视觉结构等特征,在不依赖URL、HTML代码或文本内容的情况下识别钓鱼网页,并进一步研究未知品牌检测、类别不平衡处理和跨网站泛化能力。
数据集来源
由张家梁(Bob)整理并于2026年在7zcode平台公开发布。
数据集信息
免责声明与引用
数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。
作者信息
作者:Bob (张家梁)
项目编号:Datasets-639
文件大小:760M
原创声明:本数据集为整理作品
联系方式

开源协议
本项目采用AGPL-3.0开源协议,允许个人和组织自由使用、修改和分发代码,但基于本项目的衍生作品必须同样开源,且用于提供网络服务时需向用户提供完整源代码。本项目仅供学习研究使用,作者不对使用本项目产生的任何后果承担责任,使用者应遵守当地法律法规,合理合法使用本项目。如本项目对您的研究或工作有所帮助,欢迎引用并注明出处。


评论(0)