摘要:新型基于图像的恶意软件检测和分类数据集,将恶意软件二进制文件转换为1024×1024像素的灰度图像,涵盖从2022年至2025年8月收集的94,300个样本,包含22种恶意软件家族和良性文件。
数据集简介
数据集概述
新型基于图像的恶意软件检测和分类数据集,将恶意软件二进制文件转换为1024×1024像素的灰度图像,涵盖从2022年至2025年8月收集的94,300个样本,包含22种恶意软件家族和良性文件。数据集通过将原始二进制数据可视化为图像(经过填充/调整大小处理),使研究人员能够利用计算机视觉和深度学习技术进行恶意软件分析。恶意软件样本来源于MalwareBazaar,良性文件源自Windows DLL系统文件,并提供哈希值用于验证和追溯。重要的是,该数据集仅包含图像,不包含任何可执行恶意软件文件,确保使用安全。数据集包含22种恶意软件家族,其中Mirai(24,000)、Heodo(16,000)和AgentTesla(15,600)样本数量最多,良性样本3,721个,其余恶意软件家族样本数在1,132-2,000之间。该数据集适用于恶意软件分类、基于图像的深度学习实验(CNN、ResNet、Vision Transformers)、字节序列特征提取、网络威胁可视化研究和恶意软件检测基准模型构建。
数据结构与关键特征
数据集包含94,300张1024×1024像素的PNG格式灰度图像,按22种恶意软件家族+1类良性文件组织。关键特征包括:二进制可视化(将恶意软件二进制文件转换为灰度图像,每个字节映射为像素灰度值,使二进制模式可视化)、高分辨率图像(1024×1024保留丰富的二进制结构信息)、时间跨度覆盖(2022-2025年样本反映最新恶意软件趋势)、多样化恶意软件家族(涵盖RAT远程访问木马、信息窃取器、加载器、勒索软件等主要威胁类型)、不平衡类别分布(Mirai占25.4%,良性仅占3.9%,反映真实场景的不平衡性)、以及安全性保证(仅图像无可执行代码)。数据集的核心创新在于将网络安全问题转换为计算机视觉问题:恶意软件的二进制结构在图像中呈现为纹理、模式和区域特征,不同恶意软件家族具有独特的视觉指纹。1024×1024分辨率足以表示较大的二进制文件(约1MB),同时适合现代GPU处理。类别不平衡(良性3.9% vs 恶意96.1%)是真实恶意软件检测的特点,但需要特殊技术处理(如重采样、类权重)。
应用价值与研究方向
该数据集在网络安全、恶意软件检测、计算机视觉和深度学习研究领域具有重要应用价值,可用于开发基于图像的恶意软件检测系统、威胁情报分析工具、终端安全产品和网络防御平台。研究方向包括:基于深度学习的恶意软件视觉分类算法、迁移学习从ImageNet预训练模型到恶意软件领域、类不平衡学习技术、对抗性攻击与防御(恶意软件变种能否欺骗视觉模型)、多尺度特征提取、轻量级实时检测模型、可解释性AI用于识别恶意代码模式、以及跨年份泛化能力研究。数据集提出的6个关键研究问题为系统评估提供了框架:视觉模型效果、迁移学习价值、类平衡影响、分辨率影响、对抗鲁棒性和实时检测可行性。此外,该数据集还可扩展至零日恶意软件检测、恶意软件家族演化分析、代码混淆识别等应用场景,为推动AI技术在网络安全领域的应用、提升恶意软件检测准确率、降低误报率、增强网络防御能力提供重要的数据支撑和技术基础。基于图像的方法相比传统静态分析和动态分析具有独特优势:无需反汇编、抗混淆、计算高效,但也面临对抗攻击和泛化挑战,该数据集为探索这些问题提供了标准化平台。
数据集来源
由张家梁(Bob)整理并于2026年在7zcode平台公开发布。
数据集信息
免责声明与引用
数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。
作者信息
作者:Bob (张家梁)
项目编号:Datasets-230
文件大小:27G
原创声明:本数据集为整理作品
联系方式

开源协议
本项目采用AGPL-3.0开源协议,允许个人和组织自由使用、修改和分发代码,但基于本项目的衍生作品必须同样开源,且用于提供网络服务时需向用户提供完整源代码。本项目仅供学习研究使用,作者不对使用本项目产生的任何后果承担责任,使用者应遵守当地法律法规,合理合法使用本项目。如本项目对您的研究或工作有所帮助,欢迎引用并注明出处。


评论(0)