摘要:大规模昆虫图像与分类学学名标签识别数据集(约12.2万张图像)。

数据集概述

该数据集面向昆虫物种识别与分类学研究,共收录约12.2万张昆虫图像,覆盖数千种昆虫,每种昆虫包含50张以上样本。图像通过DuckDuckGo搜索采集,主要用于构建大规模、细粒度昆虫图像分类模型。当前版本已移除部分损坏文件,但由于数据来源于互联网,仍可能存在物种误标、非目标图像及重复样本等问题。

数据结构与关键特征

数据集采用按昆虫学名划分文件夹的目录结构,每个类别文件夹对应一种昆虫,图像最大尺寸为400像素。配套的esoc_name_file.csv文件记录昆虫学名、俗名、属、科和种等分类学字段,可将视觉图像与生物分类层级建立关联。数据具有类别数量庞大、物种外观相似度高、样本背景复杂、图像来源多样及潜在标签噪声等特点。

应用价值与研究方向

该数据集可用于昆虫物种分类、害虫识别、生物多样性调查、昆虫图像检索及农业病虫害辅助监测。研究方向包括卷积神经网络与视觉Transformer分类、科—属—种层次化识别、细粒度特征学习、长尾分类、噪声标签学习、重复图像清理、开放集识别、跨域泛化及相似物种度量学习;还可结合地理位置、寄主植物和生态环境数据,进一步研究昆虫分布预测与智能生态监测。

数据集来源

由张家梁(Bob)整理并于2026年在7zcode平台公开发布。

数据集信息

免责声明与引用

数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。

作者信息

作者:Bob (张家梁)
项目编号:Datasets-594
文件大小:2.58G
原创声明:本数据集为整理作品

联系方式

开源协议

本项目采用AGPL-3.0开源协议,允许个人和组织自由使用、修改和分发代码,但基于本项目的衍生作品必须同样开源,且用于提供网络服务时需向用户提供完整源代码。本项目仅供学习研究使用,作者不对使用本项目产生的任何后果承担责任,使用者应遵守当地法律法规,合理合法使用本项目。如本项目对您的研究或工作有所帮助,欢迎引用并注明出处。

声明:本站所有项目资源都可以正常运行,亲测无错!而且我们录制了演示视频,在我们注明的环境版本下,项目运行效果完全和演示视频一致。客服QQ:下载须知