摘要:专为教育和娱乐目的创建的多模态狗狗图像评分数据集。该数据集包含 3,042 张狗狗图像,每张图片配有幽默风格的文字说明和数值评分,捕捉了互联网文化中对宠物狗的娱乐性评价模式。数据集由伦敦艺术大学创意计算研究所(Creative Computing Institute, UAL)的 Terence Broad 于 2023 年 9 月 24 日通过网络爬虫技术收集,主要用作教学工具来演示图像处理技术、计算机视觉和多模态数据分析方法。为图像分类、文本-图像关联分析和创意计算教学提供了轻松有趣的学习资源。

数据集简介

数据集概述

据集采用图像加结构化文本的组织形式,每个数据实例包含三个核心组件:狗狗照片、文字说明(caption)和数值评分(rating)。图像数据涵盖各类犬种和场景,展现了狗狗的多样化视觉特征和行为表现。文字说明采用 @weratedogs 账号特有的幽默风格,通常包含对狗狗外观、行为或情境的轻松描述,有时还包含狗狗的名字和社交媒体链接。数值评分通过正则表达式从原始文字说明中提取,通常以”X/10″的形式呈现(该账号以给狗狗打”超过 10 分”的夸张评分而闻名)。元数据以 TSV(制表符分隔值)格式存储,便于数据读取和处理。数据采集过程使用 instaloader 库进行网络爬虫,仅提取多图帖子的第一张图片,视频帖子则使用 Instagram 提供的缩略图,确保数据集的自包含性和一致性。

该数据集主要服务于计算机视觉和多模态学习的教育场景,支持图像分类、物体检测、图像-文本关联分析、情感分析和创意 AI 应用开发。学生和研究人员可以利用该数据集学习图像预处理技术、训练卷积神经网络进行犬种识别、开发自动化图像评分系统、探索文本与视觉特征的关联模式,或构建幽默内容生成模型。数据集的轻松主题降低了学习门槛,使初学者能够在有趣的环境中掌握机器学习基础技能,同时也适用于迁移学习、数据增强技术演示和小样本学习实验。虽然数据集明确标注”不应用于评价狗以外的动物”,但其多模态结构和高质量标注为教学和原型开发提供了理想的实验平台。维护者 Terence Broad 通过 GitHub 仓库持续更新数据集,并提供完整的数据采集和清洗代码,确保数据集的可复现性和可扩展性。

数据集来源

该数据集通过网络爬虫技术从Instagram账号 @weratedogs 采集,包含截至 2023年9月24日发布的3,042 张狗狗图像及其配套的文字说明和评分,由伦敦艺术大学创意计算研究所的 Terence Broad 使用 instaloader 库收集并通过正则表达式提取评分信息,专为教育和图像处理技术教学而构建。由张家梁(Bob)整理并于2026年在7zcode平台公开发布。

数据集信息

免责声明与引用

数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。

作者信息

作者:Bob (张家梁)
项目编号:Datasets-53
文件大小:560M
原创声明:本数据集为整理作品

联系方式

开源协议

本项目采用AGPL-3.0开源协议,允许个人和组织自由使用、修改和分发代码,但基于本项目的衍生作品必须同样开源,且用于提供网络服务时需向用户提供完整源代码。本项目仅供学习研究使用,作者不对使用本项目产生的任何后果承担责任,使用者应遵守当地法律法规,合理合法使用本项目。如本项目对您的研究或工作有所帮助,欢迎引用并注明出处。

声明:本站所有项目资源都可以正常运行,亲测无错!而且我们录制了演示视频,在我们注明的环境版本下,项目运行效果完全和演示视频一致。客服QQ:下载须知