摘要:软件缺陷预测数据集是一个面向软件质量分析、源代码理解与缺陷预测研究的结构化代码数据集,共包含 15,000 条 Java 源代码记录和 126 个特征字段。
数据集概述
软件缺陷预测数据集是一个面向软件质量分析、源代码理解与缺陷预测研究的结构化代码数据集,共包含 15,000 条 Java 源代码记录和 126 个特征字段。每条记录对应一个独立的 Java 源文件,涵盖项目名称、软件版本、源代码结构、抽象语法树(AST)信息、Token 表示、语义特征以及最终缺陷状态。目标变量为 defect_label,包含 Buggy(存在缺陷) 和 Clean(无缺陷) 两类,可用于构建二分类软件缺陷预测模型。
数据结构与关键特征
该数据集主要由项目属性、代码结构序列、AST表示和语义特征四部分组成。项目属性包括 project_name、project_version 和 java_file_name;代码结构特征记录方法调用、构造函数、方法声明、类声明、枚举、条件语句、循环、switch/case、异常处理、return、break 和 continue 等语法元素的顺序信息。ast_token_sequence 保存完整AST Token序列,encoded_token_vector 将其转换为整数编码,padded_token_vector 则提供固定长度表示,便于直接输入深度学习模型。此外,semantic_feature_1 至 semantic_feature_100 提供100维语义表征,可用于描述源代码的高层语义特征。
应用价值与研究方向
该数据集适用于软件缺陷预测、代码质量评估、程序表示学习和智能软件工程等研究。研究人员可以使用随机森林、XGBoost、LightGBM 等传统机器学习方法分析语义和结构化特征,也可以采用 CNN、LSTM、Transformer、CodeBERT、GraphCodeBERT 等模型学习AST序列和代码语义表示。进一步可开展跨项目缺陷预测、版本间缺陷迁移、AST结构建模、语义特征融合、缺陷定位、代码风险评分以及面向持续集成流程的自动质量预警系统研究,为软件测试和维护提供数据支持。
数据集来源
由张家梁(Bob)整理并于2026年在7zcode平台公开发布。
数据集信息
免责声明与引用
数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。
作者信息
作者:Bob (张家梁)
项目编号:Datasets-479
文件大小:6M
原创声明:本数据集为整理作品
联系方式

开源协议
本项目采用AGPL-3.0开源协议,允许个人和组织自由使用、修改和分发代码,但基于本项目的衍生作品必须同样开源,且用于提供网络服务时需向用户提供完整源代码。本项目仅供学习研究使用,作者不对使用本项目产生的任何后果承担责任,使用者应遵守当地法律法规,合理合法使用本项目。如本项目对您的研究或工作有所帮助,欢迎引用并注明出处。


评论(0)