摘要:智能合约漏洞检测数据集包含数千个 Solidity 源代码片段,3 个特征(source_code、label_encoded(0-7)、binary_label(0 安全/1 易受攻击)),涵盖 7 种漏洞类型(重入、整数溢出、访问控制等),专为 NLP 二元分类和 DeFi 安全研究设计。

数据集简介

数据集概述

数据集包含 3 个主要特征:(1) source_code:智能合约的原始 Solidity 源代码(以太坊智能合约编程语言);(2) label_encoded:表示特定漏洞类别的整数(例如,0 表示安全,1-7 表示不同的漏洞类型,如重入漏洞、整数溢出漏洞、访问控制漏洞等);(3) binary_label:(派生)目标值,其中 0 表示安全,1 表示易受攻击,用于二元分类任务。漏洞类型示例:重入漏洞(Reentrancy)、整数溢出漏洞(Integer Overflow)、访问控制漏洞(Access Control)等(共 7 种漏洞类型 + 1 种安全类别)。数据集适用于 NLP 技术,包括词级和字符级 TF-IDF 向量化、语法和逻辑模式识别。

支持智能合约安全漏洞自动检测、二元分类(安全 vs 易受攻击)、多类别分类(8 类)、NLP 代码分析、TF-IDF 向量化、机器学习/深度学习模型训练(LSTM、Transformer、CodeBERT)、DeFi 安全、区块链安全、静态代码分析和安全审计自动化。

数据集来源

由张家梁(Bob)整理并于2026年在7zcode平台公开发布。

数据集信息

免责声明与引用

数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。

作者信息

作者:Bob (张家梁)
项目编号:Datasets-143
文件大小:2.8M
原创声明:本数据集为整理作品

联系方式

开源协议

本项目采用AGPL-3.0开源协议,允许个人和组织自由使用、修改和分发代码,但基于本项目的衍生作品必须同样开源,且用于提供网络服务时需向用户提供完整源代码。本项目仅供学习研究使用,作者不对使用本项目产生的任何后果承担责任,使用者应遵守当地法律法规,合理合法使用本项目。如本项目对您的研究或工作有所帮助,欢迎引用并注明出处。

声明:本站所有项目资源都可以正常运行,亲测无错!而且我们录制了演示视频,在我们注明的环境版本下,项目运行效果完全和演示视频一致。客服QQ:下载须知