摘要:多模态英语学习数据集是一个面向智能英语教育、学习者行为分析与产出导向教学法(POA)研究的结构化教育数据集,共包含 2000 条英语学习记录。每条记录对应一次学习会话,围绕 POA 的驱动(激励)、促成(赋能)和评价等教学阶段,记录学习任务、学习者回答以及听力、流利度和发音等表现指标。

数据集概述

多模态英语学习数据集是一个面向智能英语教育、学习者行为分析与产出导向教学法(POA)研究的结构化教育数据集,共包含 2000 条英语学习记录。每条记录对应一次学习会话,围绕 POA 的驱动(激励)、促成(赋能)和评价等教学阶段,记录学习任务、学习者回答以及听力、流利度和发音等表现指标。该数据集重点研究学习者互动行为与英语听说能力之间的关系,可用于分析不同教学阶段的学习效果、学习者能力变化和课堂参与表现,并为自适应英语学习与智能教学系统开发提供数据基础。

数据结构与关键特征

该数据集采用表格形式组织,每条记录主要包含学习者身份、教学阶段、任务内容、学习响应和能力评价等信息。核心字段包括 session_id(学习会话编号)、student_id(学习者编号)、poa_stage(POA教学阶段)、topic(学习主题)、text_prompt(任务提示)以及 student_response_text(学习者回答文本);能力评价部分则包含流畅度评分、听力评分和发音评分,分别用于衡量学习者的语言连贯性、听力理解能力和发音清晰程度。目标字段用于表示综合学习表现等级,可根据多个能力指标对学习结果进行分类或预测。整体数据同时包含类别型、文本型和数值评分特征,适合开展多源学习特征融合分析。

应用价值与研究方向

该数据集可广泛应用于智能英语教学、学习分析、自动口语评价和个性化教育推荐等领域。研究人员可以利用 BERT、RoBERTa、Transformer 等模型分析任务提示与学习者回答的语义特征,并结合流畅度、听力和发音评分构建综合学习表现预测模型;也可以使用随机森林、XGBoost、LightGBM 等算法分析不同教学阶段和学习行为对最终表现的影响。进一步研究可围绕 POA阶段学习效果比较、学习者能力画像、英语学习进步预测、薄弱能力识别、个性化学习材料推荐、自动反馈生成以及成果导向教学评价等方向展开,为人工智能辅助英语课堂和自适应语言学习系统提供支持。

数据集来源

由张家梁(Bob)整理并于2026年在7zcode平台公开发布。

数据集信息

免责声明与引用

数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。

作者信息

作者:Bob (张家梁)
项目编号:Datasets-448
文件大小:918M
原创声明:本数据集为整理作品

联系方式

开源协议

本项目采用AGPL-3.0开源协议,允许个人和组织自由使用、修改和分发代码,但基于本项目的衍生作品必须同样开源,且用于提供网络服务时需向用户提供完整源代码。本项目仅供学习研究使用,作者不对使用本项目产生的任何后果承担责任,使用者应遵守当地法律法规,合理合法使用本项目。如本项目对您的研究或工作有所帮助,欢迎引用并注明出处。

声明:本站所有项目资源都可以正常运行,亲测无错!而且我们录制了演示视频,在我们注明的环境版本下,项目运行效果完全和演示视频一致。客服QQ:下载须知