摘要:长跑数据集是一个大规模的全球运动员训练行为数据集,包含来自世界各地36,412名运动员在2019年和2020年期间的10,703,690条跑步训练记录。

数据集概述

长跑数据集是一个大规模的全球运动员训练行为数据集,包含来自世界各地36,412名运动员在2019年和2020年期间的10,703,690条跑步训练记录。数据通过网络爬虫从一个大型运动员社交网络平台获取,涵盖了COVID-19疫情前后两年的完整训练轨迹。数据集采用Pandas数据框结构,以高效的Parquet文件格式存储,包含8个核心字段:训练日期时间(datetime)、匿名运动员ID(athlete)、跑步距离(distance,公里)、训练时长(duration,分钟)、性别(gender,M/F)、年龄组(age_group,18-34/35-54/55+)、国籍(country)和参赛马拉松项目(main_events)。为便于不同粒度的时间序列分析,数据集提供了按日(d)、周(w)、月(m)和季度(q)四种频率采样的文件版本,文件命名遵循”run_ww_yyyy_f.parquet”格式。此外,数据集还包含各国政府COVID-19防疫政策严格程度指数的文本数据,为研究疫情对运动训练行为的影响提供了关键的政策背景变量。

数据结构与关键特征

数据集采用多维度标注和多时间尺度采样的分层结构设计。人口统计学维度包括性别二分类、三层年龄分组和国籍标签,支持跨人群对比分析;训练行为维度记录精确到分钟级的时长和公里级的距离,可计算配速、强度和累计里程等衍生指标;时间维度提供原始时间戳和四种聚合频率(日/周/月/季度)的预处理版本,每个频率对应独立的Parquet文件,记录该时段内的累计跑步距离和时长,极大简化了时间序列建模和趋势分析的数据准备工作。竞赛参与维度通过”主要项目”字段记录运动员的马拉松参赛历史(赛事名+年份的逗号分隔列表),可用于识别精英运动员和分析赛事对训练模式的影响。外部政策维度通过COVID-19严格程度指数补充,使数据集能够关联训练行为变化与公共卫生干预措施。Parquet格式确保了大规模数据的高效存储和快速读取,与Python数据科学生态系统(Pandas、Dask、PyArrow)无缝集成。

应用价值与研究方向

该数据集在运动科学、公共卫生、行为经济学和数据科学领域具有独特的研究价值和应用潜力。在运动科学研究中,可用于分析不同年龄、性别群体的训练模式差异、马拉松备赛周期规律、训练负荷与竞赛表现关系以及长期训练行为的季节性波动。在公共卫生研究中,数据集提供了罕见的疫情前后对照数据,可量化评估封锁政策、社交距离措施对全球运动行为的影响,识别不同国家和人群的适应策略差异,为未来公共卫生危机中的运动健康干预提供循证依据。在行为分析方向上,适合用于时间序列预测(训练量预测)、异常检测(训练中断识别)、聚类分析(训练类型分类)和因果推断(政策干预效果评估)等机器学习任务。在应用层面,可支持智能训练计划生成、运动社交平台推荐系统、马拉松赛事需求预测和个性化健身指导工具开发。此外,该数据集的全球覆盖范围和长时间跨度使其成为研究集体行为变化、社会网络传播和跨文化运动习惯的宝贵素材,为理解人类在极端事件下的行为韧性和适应机制提供了大规模实证数据支撑。

数据集来源

由张家梁(Bob)整理并于2026年在7zcode平台公开发布。

数据集信息

免责声明与引用

数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。

作者信息

作者:Bob (张家梁)
项目编号:Datasets-255
文件大小:370M
原创声明:本数据集为整理作品

联系方式

开源协议

本项目采用AGPL-3.0开源协议,允许个人和组织自由使用、修改和分发代码,但基于本项目的衍生作品必须同样开源,且用于提供网络服务时需向用户提供完整源代码。本项目仅供学习研究使用,作者不对使用本项目产生的任何后果承担责任,使用者应遵守当地法律法规,合理合法使用本项目。如本项目对您的研究或工作有所帮助,欢迎引用并注明出处。

声明:本站所有项目资源都可以正常运行,亲测无错!而且我们录制了演示视频,在我们注明的环境版本下,项目运行效果完全和演示视频一致。客服QQ:下载须知