摘要:乐天法国多模态产品分类数据集(Rakuten France Multimodal Product Classification Dataset)是一个面向电子商务商品自动分类、图文联合理解和多模态机器学习研究的数据集。

数据集概述

乐天法国多模态产品分类数据集(Rakuten France Multimodal Product Classification Dataset)是一个面向电子商务商品自动分类、图文联合理解和多模态机器学习研究的数据集。数据来自法国乐天(Rakuten France)电商平台,每个商品样本通常同时包含商品文本描述与商品图片,并通过商品类别标签进行监督学习。该数据集适合研究文本信息与视觉信息之间的互补关系,可用于构建商品类别识别、自动标签生成以及电商内容理解模型。

数据结构与关键特征

数据主要由商品图片以及3个CSV文件组成。X_train_update.csv 为训练集特征文件,通常包含商品名称或标题(designation)、商品描述(description)、商品编号(productid)和图片编号(imageid)等信息,可通过图片ID关联对应商品图像;Y_train_CVw08PX.csv 为训练集标签文件,核心字段通常为 prdtypecode,表示商品所属的产品类别;X_test_update.csv 与训练特征文件结构基本一致,但不包含目标类别标签,用于模型最终预测。整体形成“商品文本 + 商品图片 → 商品类别”的典型多模态分类结构。

应用价值与研究方向

该数据集适用于多模态商品分类、商品图文匹配、电商搜索、智能推荐和商品信息自动整理等任务。文本部分可采用 TF-IDF、BERT、CamemBERT 等方法提取法语语义特征,图像部分可使用 ResNet、EfficientNet、Vision Transformer 等模型提取视觉特征,再通过特征融合、注意力机制或 CLIP 类视觉语言模型完成多模态分类。进一步可研究类别不平衡、文本缺失、低质量商品图片、跨模态特征对齐以及大型视觉语言模型在电商商品理解中的应用。

数据集来源

由张家梁(Bob)整理并于2026年在7zcode平台公开发布。

数据集信息

免责声明与引用

数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。

作者信息

作者:Bob (张家梁)
项目编号:Datasets-460
文件大小:2.4G
原创声明:本数据集为整理作品

联系方式

开源协议

本项目采用AGPL-3.0开源协议,允许个人和组织自由使用、修改和分发代码,但基于本项目的衍生作品必须同样开源,且用于提供网络服务时需向用户提供完整源代码。本项目仅供学习研究使用,作者不对使用本项目产生的任何后果承担责任,使用者应遵守当地法律法规,合理合法使用本项目。如本项目对您的研究或工作有所帮助,欢迎引用并注明出处。

声明:本站所有项目资源都可以正常运行,亲测无错!而且我们录制了演示视频,在我们注明的环境版本下,项目运行效果完全和演示视频一致。客服QQ:下载须知