摘要:该数据集是一套面向机器学习初学者设计的模拟学生成绩数据,共包含1000000条记录,每条记录代表一名学生。
数据集概述
该数据集是一套面向机器学习初学者设计的模拟学生成绩数据,共包含1000000条记录,每条记录代表一名学生。数据主要描述学生每周自主学习时间、出勤率、课堂参与度、总成绩和成绩等级,可用于直观分析学习投入与学业表现之间的关系,并练习基础的数据处理、模型训练和性能评估方法。
数据结构与关键特征
数据集以student_performance.csv文件存储,包含student_id、weekly_self_study_hours、attendance_percentage、class_participation、total_score和grade共6个字段。每周自主学习时间范围为0~40小时,出勤率为50%~100%,课堂参与度为0~10分,总成绩为0~100分;成绩等级按照总成绩划分为A、B、C、D和F。数据由设定的统计分布和随机噪声生成,其中总成绩与自主学习时间具有较强相关性,整体结构清晰,便于直接开展建模实验。
应用价值与研究方向
该数据集适合用于线性回归、多元回归、成绩等级分类、特征相关性分析和模型评估教学。学习者可使用MAE、RMSE和决定系数$R^2$评估成绩预测模型,也可使用准确率、精确率、召回率和F1值评估等级分类模型,并练习训练集与测试集划分、交叉验证、特征标准化及超参数调整。由于数据为人工模拟且总成绩主要由学习时间和随机噪声生成,更适合作为算法入门与流程验证数据,不宜直接用于真实教育决策。
数据集来源
由张家梁(Bob)整理并于2026年在7zcode平台公开发布。
数据集信息
免责声明与引用
数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。
作者信息
作者:Bob (张家梁)
项目编号:Datasets-703
文件大小:8.2M
原创声明:本数据集为整理作品
联系方式

开源协议
本项目采用AGPL-3.0开源协议,允许个人和组织自由使用、修改和分发代码,但基于本项目的衍生作品必须同样开源,且用于提供网络服务时需向用户提供完整源代码。本项目仅供学习研究使用,作者不对使用本项目产生的任何后果承担责任,使用者应遵守当地法律法规,合理合法使用本项目。如本项目对您的研究或工作有所帮助,欢迎引用并注明出处。


评论(0)