摘要:法律判决预测数据集是一个面向司法判决分析、法律文本理解与智能司法研究的大规模结构化数据集,共包含 100,001 条法律案件记录。
数据集概述
法律判决预测数据集是一个面向司法判决分析、法律文本理解与智能司法研究的大规模结构化数据集,共包含 100,001 条法律案件记录。数据集基于 CAIL2018 相关数据构建,主要反映中国法律体系下的案件事实、适用法律、罪名信息、法院层级、司法管辖及最终判决结果。案件覆盖刑法、民法、公司法、家庭法、劳动法、合同纠纷以及知识产权等多个法律领域,可用于研究不同案件事实和法律条款与司法结果之间的关联,为法律人工智能和司法数据分析提供较丰富的数据基础。
数据结构与关键特征
该数据集同时包含长文本特征、结构化统计特征和司法标签。核心文本字段包括 case_facts(案件事实全文)、crime_keywords(犯罪关键词)、applicable_laws(适用法律)和 law_articles(引用法条);结构化特征包括 fact_length、fact_word_count、avg_word_length、num_keywords 和 num_laws 等案件文本统计指标,以及 case_category、court_level、jurisdiction 和 charges 等司法背景信息。刑罚相关字段包括 prison_term、penalty_term、has_life_imprisonment 和 has_death_penalty。目标变量为 judgment_label,采用二元标签表示最终裁判结果,其中 Approved = 1,Rejected = 0,可用于司法结果分类与预测建模。
应用价值与研究方向
该数据集适用于法律判决预测、案件分类、法条推荐、量刑分析和法律文本挖掘等研究任务。研究人员可以采用 TF-IDF、BERT、RoBERTa、Legal-BERT、Transformer 等模型提取案件事实和法律条文的语义特征,并结合 XGBoost、LightGBM 或深度神经网络构建判决结果预测模型。进一步可开展不同法院层级和地区的裁判模式分析、案件类型与处罚强度关联研究、法条适用关系建模、司法文本可解释性分析以及法律知识图谱构建等方向。此类模型更适合作为科研和辅助分析工具,实际司法决策仍需要由专业法律人员结合完整案情和适用法律进行判断。
数据集来源
由张家梁(Bob)整理并于2026年在7zcode平台公开发布。
数据集信息
免责声明与引用
数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。
作者信息
作者:Bob (张家梁)
项目编号:Datasets-464
文件大小:21M
原创声明:本数据集为整理作品
联系方式

开源协议
本项目采用AGPL-3.0开源协议,允许个人和组织自由使用、修改和分发代码,但基于本项目的衍生作品必须同样开源,且用于提供网络服务时需向用户提供完整源代码。本项目仅供学习研究使用,作者不对使用本项目产生的任何后果承担责任,使用者应遵守当地法律法规,合理合法使用本项目。如本项目对您的研究或工作有所帮助,欢迎引用并注明出处。


评论(0)