摘要:该学生辍学率和学业成功率预测数据集包含三个子集:主评估集(4,424行,35列,包含辍学1,421、毕业2,209、在校794三类目标)、大学生管理数据集(1,545行,15列,包含高/中/低三级风险等级)、大型表格数据集(999,997行,21列,无标签用于推断)。
数据集概述
该学生辍学率和学业成功率预测数据集包含三个子集:主评估集(4,424行,35列,包含辍学1,421、毕业2,209、在校794三类目标)、大学生管理数据集(1,545行,15列,包含高/中/低三级风险等级)、大型表格数据集(999,997行,21列,无标签用于推断)。数据涵盖学生人口统计学、学术表现、社会经济背景、课程参与度、在线学习行为等多维度特征,支持二元分类(辍学vs非辍学)和三级风险预测任务。。
数据结构与关键特征
主数据集包含35个特征:人口学信息(婚姻状况、性别、年龄、国籍)、学术背景(申请方式、先前学历、课程类型)、家庭背景(父母教育程度和职业)、经济状况(是否欠债、学费缴纳、奖学金)、学业表现(第一/第二学期学分、成绩、评估情况)、宏观经济指标(失业率、通货膨胀率、GDP)。大学生管理数据集包含学习管理系统(LMS)参与度指标(登录次数、会话时长、作业提交率、论坛参与、视频完成率)。大型数据集包含考试成绩、出勤率、学习时间、课外活动等标准化特征。
应用价值与研究方向
该数据集可用于学生辍学预测、学业成功率分析、教育数据挖掘等研究。研究方向包括机器学习分类模型(随机森林、XGBoost、神经网络)、不平衡数据处理、多类别分类、风险分层预测、特征重要性分析、早期预警系统、在线学习行为分析、社会经济因素影响研究、时序预测(学期进展跟踪)、可解释AI在教育中的应用等,对高校学生管理、个性化干预、资源优化配置、提高毕业率、减少辍学损失、推动教育公平具有重要实际应用价值。
数据集来源
由张家梁(Bob)整理并于2026年在7zcode平台公开发布。
数据集信息
免责声明与引用
数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。
作者信息
作者:Bob (张家梁)
项目编号:Datasets-355
文件大小:60M
原创声明:本数据集为整理作品
联系方式

开源协议
本项目采用AGPL-3.0开源协议,允许个人和组织自由使用、修改和分发代码,但基于本项目的衍生作品必须同样开源,且用于提供网络服务时需向用户提供完整源代码。本项目仅供学习研究使用,作者不对使用本项目产生的任何后果承担责任,使用者应遵守当地法律法规,合理合法使用本项目。如本项目对您的研究或工作有所帮助,欢迎引用并注明出处。


评论(0)