摘要:智能合约漏洞检测数据集包含数千个 Solidity 源代码片段,3 个特征(source_code、label_encoded(0-7)、binary_label(0 安全/1 易受攻击)),涵盖 7 种漏洞类型(重入、整数溢出、访问控制等),专为 NLP 二元分类和 DeFi 安全研究设计。
数据集简介
数据集概述
数据集包含 3 个主要特征:(1) source_code:智能合约的原始 Solidity 源代码(以太坊智能合约编程语言);(2) label_encoded:表示特定漏洞类别的整数(例如,0 表示安全,1-7 表示不同的漏洞类型,如重入漏洞、整数溢出漏洞、访问控制漏洞等);(3) binary_label:(派生)目标值,其中 0 表示安全,1 表示易受攻击,用于二元分类任务。漏洞类型示例:重入漏洞(Reentrancy)、整数溢出漏洞(Integer Overflow)、访问控制漏洞(Access Control)等(共 7 种漏洞类型 + 1 种安全类别)。数据集适用于 NLP 技术,包括词级和字符级 TF-IDF 向量化、语法和逻辑模式识别。
支持智能合约安全漏洞自动检测、二元分类(安全 vs 易受攻击)、多类别分类(8 类)、NLP 代码分析、TF-IDF 向量化、机器学习/深度学习模型训练(LSTM、Transformer、CodeBERT)、DeFi 安全、区块链安全、静态代码分析和安全审计自动化。
数据集来源
由张家梁(Bob)整理并于2026年在7zcode平台公开发布。
数据集信息
免责声明与引用
数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。
作者信息
作者:Bob (张家梁)
项目编号:Datasets-143
文件大小:2.8M
原创声明:本数据集为整理作品
联系方式

开源协议
本项目采用AGPL-3.0开源协议,允许个人和组织自由使用、修改和分发代码,但基于本项目的衍生作品必须同样开源,且用于提供网络服务时需向用户提供完整源代码。本项目仅供学习研究使用,作者不对使用本项目产生的任何后果承担责任,使用者应遵守当地法律法规,合理合法使用本项目。如本项目对您的研究或工作有所帮助,欢迎引用并注明出处。


评论(0)