摘要:多模态法语翻译反馈数据集面向中国学习者的法语到英语翻译学习与智能反馈研究,综合收录手写或扫描翻译图像、文本反馈以及结构化双语翻译记录,共包含202个文件,其中包括150个PNG图像、50个TXT文本和2个CSV文件。
数据集概述
多模态法语翻译反馈数据集面向中国学习者的法语到英语翻译学习与智能反馈研究,综合收录手写或扫描翻译图像、文本反馈以及结构化双语翻译记录,共包含202个文件,其中包括150个PNG图像、50个TXT文本和2个CSV文件。数据集将视觉形式的学习者作答与对应文本、翻译质量及反馈信息进行关联,可用于分析学习者在法英翻译过程中出现的典型错误,并为自动纠错、翻译质量评估和语言教育智能辅助系统提供多模态数据基础。
数据结构与关键特征
数据集由图像数据、学习者翻译文本和结构化翻译元数据共同组成,其中Image_data.csv通过image_path与text字段建立手写或扫描翻译图像与文本内容之间的映射,en_fr_dataset.csv则包含样本ID、英文目标句、法语原句、语料来源、翻译质量评分和可读性等级等信息。数据还对语法、用法、重复、含义、补全及标点等属性进行记录,并进一步覆盖语法错误、词汇错误、语义错误、拼写错误、词序错误、误译、遗漏、一致性等多种错误类型,同时包含显式纠正、提示式反馈、解释式反馈、示例式反馈和混合式反馈等教学反馈形式。
应用价值与研究方向
该数据集能够支持多模态机器翻译评估、学习者错误检测、自动反馈生成、教育大模型和智能语言学习系统等研究方向。研究者可以结合图像识别、自然语言处理和机器学习方法,对手写翻译内容进行识别并与文本记录联合建模,进一步实现错误类型自动分类、翻译质量预测、个性化纠错建议以及不同反馈策略效果比较;同时,其较细粒度的错误标签和反馈类型也适合用于构建面向中国学习者的法英翻译教学辅助系统和可解释的智能评测模型。
数据集来源
由张家梁(Bob)整理并于2026年在7zcode平台公开发布。
数据集信息
免责声明与引用
数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。
作者信息
作者:Bob (张家梁)
项目编号:Datasets-527
文件大小:22M
原创声明:本数据集为整理作品
联系方式

开源协议
本项目采用AGPL-3.0开源协议,允许个人和组织自由使用、修改和分发代码,但基于本项目的衍生作品必须同样开源,且用于提供网络服务时需向用户提供完整源代码。本项目仅供学习研究使用,作者不对使用本项目产生的任何后果承担责任,使用者应遵守当地法律法规,合理合法使用本项目。如本项目对您的研究或工作有所帮助,欢迎引用并注明出处。


评论(0)