摘要:多模态真实/虚假招聘信息预测数据集是一个面向虚假招聘识别、招聘欺诈检测与多模态内容审核的分类数据集,在经典 EMSCAD 招聘欺诈数据基础上进一步加入了公司网页截图信息。

数据集概述

多模态真实/虚假招聘信息预测数据集是一个面向虚假招聘识别、招聘欺诈检测与多模态内容审核的分类数据集,在经典 EMSCAD 招聘欺诈数据基础上进一步加入了公司网页截图信息。数据集共包含约 18,000 条职位描述,其中约 800 条为虚假招聘信息,其余为真实职位。每条记录同时包含职位文本、招聘元数据以及对应公司的网页视觉信息,因此能够从语言内容、岗位属性和企业网页外观等多个角度分析招聘信息的真实性。

数据结构与关键特征

数据集主要由文本、结构化元数据和公司网页截图三种信息组成。文本部分可包含职位标题、公司简介、岗位描述、任职要求、福利待遇等内容;结构化信息通常包括工作地点、部门、薪资、就业类型、经验要求、学历要求等招聘属性;视觉模态则通过公司主页截图补充企业网页布局、品牌元素、页面完整性和视觉可信度等信息。图像按照 images/{fraudulent}/{job_id}.png 的路径规则组织,其中 fraudulent 表示真假标签,job_id 用于将网页截图与对应职位记录关联。由于虚假样本数量明显少于真实样本,该数据集还具有较典型的类别不平衡特征。

应用价值与研究方向

该数据集适用于虚假招聘检测、招聘诈骗识别、多模态分类、企业可信度分析和在线招聘平台内容审核等研究。文本部分可采用 BERT、RoBERTa、DeBERTa 等模型提取语义特征,网页截图可使用 ResNet、EfficientNet、ViT、CLIP 等视觉模型进行编码,再通过特征融合、交叉注意力或多模态 Transformer 联合职位文本、元数据和网页视觉信息完成真假分类。进一步可研究类别不平衡学习、跨模态一致性检测、可解释欺诈识别、异常企业页面识别、少样本虚假招聘检测,以及面向招聘平台的实时风险预警系统。

数据集来源

由张家梁(Bob)整理并于2026年在7zcode平台公开发布。

数据集信息

免责声明与引用

数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。

作者信息

作者:Bob (张家梁)
项目编号:Datasets-521
文件大小:5.4G
原创声明:本数据集为整理作品

联系方式

开源协议

本项目采用AGPL-3.0开源协议,允许个人和组织自由使用、修改和分发代码,但基于本项目的衍生作品必须同样开源,且用于提供网络服务时需向用户提供完整源代码。本项目仅供学习研究使用,作者不对使用本项目产生的任何后果承担责任,使用者应遵守当地法律法规,合理合法使用本项目。如本项目对您的研究或工作有所帮助,欢迎引用并注明出处。

声明:本站所有项目资源都可以正常运行,亲测无错!而且我们录制了演示视频,在我们注明的环境版本下,项目运行效果完全和演示视频一致。客服QQ:下载须知