摘要:该数据集用于识别虚假招聘信息,包含职位标题、描述、要求等文本特征和公司Logo、远程办公等结构化特征,存在类别不平衡和缺失值问题,适合文本分类和欺诈检测任务。

数据集简介

数据集概述

该数据集包含17,880条招聘信息,共18个特征列,文件大小约50MB。数据集旨在识别虚假招聘信息,其中真实职位17,014条(95.16%),虚假职位866条(4.84%),存在显著的类别不平衡问题。特征包括职位标题、地点、公司简介、职位描述、要求、福利等文本字段,以及远程办公、公司Logo、就业类型等结构化字段。

数据集存在大量缺失值,其中薪资范围缺失率高达83.96%,部门缺失64.58%,学历要求缺失45.33%,福利缺失40.34%。文本类特征(描述、要求)相对完整,缺失率低于15%。结构化特征显示79.53%的职位有公司Logo,仅4.29%支持远程办公,就业类型以全职为主(11,620条)。

数据集适合文本分类和欺诈检测任务。建议使用SMOTE或类权重技术处理类别不平衡,对文本字段应用TF-IDF或BERT进行特征提取,高缺失率特征可考虑删除或创建缺失指示器。推荐模型包括逻辑回归、随机森林、XGBoost或基于Transformer的深度学习模型,评估指标应关注精确率、召回率和F1分数而非准确率

数据集来源

由张家梁(Bob)整理并于2026年在7zcode平台公开发布。

数据集信息

免责声明与引用

数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。

作者信息

作者:Bob (张家梁)
项目编号:Datasets-166
文件大小:6M
原创声明:本数据集为整理作品

联系方式

开源协议

本项目采用AGPL-3.0开源协议,允许个人和组织自由使用、修改和分发代码,但基于本项目的衍生作品必须同样开源,且用于提供网络服务时需向用户提供完整源代码。本项目仅供学习研究使用,作者不对使用本项目产生的任何后果承担责任,使用者应遵守当地法律法规,合理合法使用本项目。如本项目对您的研究或工作有所帮助,欢迎引用并注明出处。

声明:本站所有项目资源都可以正常运行,亲测无错!而且我们录制了演示视频,在我们注明的环境版本下,项目运行效果完全和演示视频一致。客服QQ:下载须知