摘要:生成式苹果树数据集(微调版)是一个使用微调后的扩散模型生成的合成数据集,源自研究论文《使用扩散模型生成数据集:提示工程 vs 微调》。
数据集简介
数据集概述
生成式苹果树数据集(微调版)是一个使用微调后的扩散模型生成的合成数据集,源自研究论文《使用扩散模型生成数据集:提示工程 vs 微调》。该数据集通过对扩散模型进行特定领域微调后生成,与提示工程版本形成对比研究,旨在评估两种方法在合成数据集生成中的效果差异。每张图像配有同名TXT标注文件,采用YOLO Ultralytics标准格式(class x_center y_center width height归一化坐标),每行表示一个独立的苹果树边界框。该数据集开源于GitHub,采用Open Database许可协议,为研究合成数据生成方法、对比模型微调与提示工程的优劣、以及解决农业数据稀缺问题提供了重要的实验平台,特别适用于精准农业、生成式AI研究和计算机视觉模型训练。
数据结构与关键特征
数据集采用图像-标注对的组织结构,每张图像对应一个同名TXT文件,标注文件采用YOLO Ultralytics标准格式,每行包含类别ID和归一化边界框坐标(class x_center y_center width height,所有值归一化至0-1范围)。关键特征包括:微调模型生成(通过对扩散模型进行领域特定微调后生成,理论上更贴近目标领域特征)、YOLO标准格式(不同于提示工程版的绝对坐标,采用主流的归一化相对坐标,便于直接用于YOLO模型训练)、开源可复现性(GitHub仓库提供完整代码和方法)、以及对比研究设计(与提示工程版配套,用于系统评估两种生成方法的性能差异)。数据集的微调方法代表了生成式AI在特定领域应用的主流范式,通过在真实苹果树数据上微调扩散模型,使生成的合成数据在视觉特征、目标分布和场景真实度上更接近真实数据,相比提示工程方法可能具有更好的domain alignment,但需要更多的计算资源和真实数据作为微调基础。
应用价值与研究方向
该数据集在精准农业、生成式AI研究和计算机视觉领域具有重要应用价值,可用于训练苹果树检测模型、对比微调与提示工程两种合成数据生成方法、研究扩散模型微调策略以及开发数据增强技术。研究方向包括:微调方法与提示工程的性能对比(生成质量、多样性、domain gap)、扩散模型微调策略优化(样本效率、微调参数选择)、合成数据在下游任务中的有效性评估、domain adaptation技术(从合成到真实)、以及生成数据的质量评估指标研究。数据集特别适合研究微调所需的最小数据量、如何平衡生成质量与计算成本、以及两种方法在不同应用场景下的适用性。此外,该数据集还可扩展至其他农作物检测任务和生成式数据集创建方法论研究,为推动生成式AI在农业领域的应用、降低数据采集成本、加速AI模型开发周期、以及选择最优的合成数据生成策略提供重要的数据支撑和实证研究基础。
数据集来源
源自研究论文《使用扩散模型生成数据集:提示工程 vs 微调》。由张家梁(Bob)整理并于2026年在7zcode平台公开发布。
数据集信息
免责声明与引用
数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。
作者信息
作者:Bob (张家梁)
项目编号:Datasets-200
文件大小:590M
原创声明:本数据集为整理作品
联系方式

开源协议
本项目采用AGPL-3.0开源协议,允许个人和组织自由使用、修改和分发代码,但基于本项目的衍生作品必须同样开源,且用于提供网络服务时需向用户提供完整源代码。本项目仅供学习研究使用,作者不对使用本项目产生的任何后果承担责任,使用者应遵守当地法律法规,合理合法使用本项目。如本项目对您的研究或工作有所帮助,欢迎引用并注明出处。


评论(0)