摘要:AI Generated Text Dataset(AI生成文本数据集) 是一个用于人工智能生成文本检测与真实性识别研究的数据集,包含人工撰写文本与大语言模型生成文本样本。。

数据集概述

AI Generated Text Dataset(AI生成文本数据集) 是一个用于人工智能生成文本检测与真实性识别研究的数据集,包含人工撰写文本与大语言模型生成文本样本。数据集旨在帮助研究人员、教育机构和开发者研究文本来源判别问题,支持机器学习模型对人工生成内容与真实人类文本进行分类识别。

数据结构与关键特征

数据集以 CSV 格式存储,包含 text 和 generated 两个字段,共 1460 条文本样本。其中 text 表示完整文本内容,generated 表示文本来源标签(1 表示 AI 生成,0 表示人工撰写)。数据具有明显类别不平衡特点,包括约 85 条 AI 生成文本和 1375 条人类文本,文本长度约为 200 个 token,适用于研究文本语义特征、语言模式、句式复杂度和生成痕迹等特征。

应用价值与研究方向

该数据集可用于构建 AI 文本检测系统,应用于学术论文查重、新闻真实性验证、内容审核和合成媒体检测等领域。研究方向包括基于 TF-IDF 与传统机器学习的文本分类、深度学习模型(Transformer、BERT 等)微调、类别不平衡学习、可解释人工智能(SHAP/LIME)分析以及大语言模型生成文本特征研究。

数据集来源

由张家梁(Bob)整理并于2026年在7zcode平台公开发布。

数据集信息

免责声明与引用

数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。

作者信息

作者:Bob (张家梁)
项目编号:Datasets-362
文件大小:1M
原创声明:本数据集为整理作品

联系方式

开源协议

本项目采用AGPL-3.0开源协议,允许个人和组织自由使用、修改和分发代码,但基于本项目的衍生作品必须同样开源,且用于提供网络服务时需向用户提供完整源代码。本项目仅供学习研究使用,作者不对使用本项目产生的任何后果承担责任,使用者应遵守当地法律法规,合理合法使用本项目。如本项目对您的研究或工作有所帮助,欢迎引用并注明出处。

声明:本站所有项目资源都可以正常运行,亲测无错!而且我们录制了演示视频,在我们注明的环境版本下,项目运行效果完全和演示视频一致。客服QQ:下载须知