摘要:该数据集面向历史法律文献的损伤评估、数字修复与档案保护研究,共包含5000个文档样本和12个字段。

数据集概述

该数据集面向历史法律文献的损伤评估、数字修复与档案保护研究,共包含5000个文档样本和12个字段。数据记录了法律档案在长期保存过程中产生的碎片化、褪色、油墨扩散、噪声干扰、结构变形和纸张老化等问题,并为每个样本提供总体损伤严重程度类别,可用于分析文档退化因素与修复需求之间的关系。

数据结构与关键特征

数据集主要由AncientDoc_100文档样本目录和legal_document_restoration_dataset.csv结构化数据文件组成。每条记录通过doc_id标识文档实例,量化字段包括碎片化程度、褪色程度、油墨渗透、噪声水平、对比度损失、纹理损伤、缺失区域比例、几何畸变、背景污渍和版式复杂度;restoration_class作为分类标签,表示文档整体损伤或修复需求的严重程度。

应用价值与研究方向

该数据集可用于历史法律档案质量评估、损伤等级分类、修复优先级排序、文档增强与数字化保护。研究方向包括机器学习损伤分类、文档图像去噪与对比度增强、褪色文字恢复、缺失区域重建、几何畸变校正、破损因素关联分析、可解释性建模和多任务学习,还可结合生成式修复、OCR识别和图像质量评价技术构建智能档案保护系统。

数据集来源

由张家梁(Bob)整理并于2026年在7zcode平台公开发布。

数据集信息

免责声明与引用

数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。

作者信息

作者:Bob (张家梁)
项目编号:Datasets-600
文件大小:130M
原创声明:本数据集为整理作品

联系方式

开源协议

本项目采用AGPL-3.0开源协议,允许个人和组织自由使用、修改和分发代码,但基于本项目的衍生作品必须同样开源,且用于提供网络服务时需向用户提供完整源代码。本项目仅供学习研究使用,作者不对使用本项目产生的任何后果承担责任,使用者应遵守当地法律法规,合理合法使用本项目。如本项目对您的研究或工作有所帮助,欢迎引用并注明出处。

声明:本站所有项目资源都可以正常运行,亲测无错!而且我们录制了演示视频,在我们注明的环境版本下,项目运行效果完全和演示视频一致。客服QQ:下载须知