摘要:商务英语多模态流利度数据集是一个面向商务英语口语流利度评估、专业沟通能力分析与多模态学习的语言教育数据集。

数据集概述

商务英语多模态流利度数据集是一个面向商务英语口语流利度评估、专业沟通能力分析与多模态学习的语言教育数据集。每条记录对应一名学习者的一次商务英语口语会话,并通过统一的流利度等级标签对整体口语表现进行评价。数据同时整合说话者基本信息、视觉行为线索和文本语言特征,可从语言表达、面部动作、姿态以及交流行为等多个维度分析学习者在专业商务语境中的沟通表现。

数据结构与关键特征

数据集由两个互补的数据部分组成,并通过 sample_id、speaker_id、session_id 等字段建立对应关系。视觉部分主要记录口部张开度、头部运动、微笑频率、眨眼频率、手势、面部运动能量、唇部变化、视线变化和姿势稳定性等非语言行为特征;文本部分则包括词汇丰富度、语法错误数量、填充词率、平均句长、词汇量、连贯性评分、可读性评分、重复率以及关键词覆盖率等语言指标。两个部分共享年龄、性别、演讲持续时间等基础属性,并以 1、2、3三级整体口语流利度标签作为预测目标,可支持单模态及多模态联合分析。

应用价值与研究方向

该数据集适用于商务英语流利度等级预测、口语能力自动评估、学习者沟通行为分析和智能英语教学系统等研究。文本模态可采用 BERT、RoBERTa、DeBERTa 等语言模型分析词汇、语法和连贯性,视觉行为特征可使用随机森林、XGBoost、MLP 或时序模型进行建模,并进一步采用多模态 Transformer、注意力融合或特征级融合方法综合视觉与文本信息。研究方向还可扩展到商务沟通能力画像、流利度影响因素分析、个性化学习反馈、非语言行为与语言能力关联分析,以及自动化口语考试与智能教学评价系统。

数据集来源

由张家梁(Bob)整理并于2026年在7zcode平台公开发布。

数据集信息

免责声明与引用

数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。

作者信息

作者:Bob (张家梁)
项目编号:Datasets-509
文件大小:429M
原创声明:本数据集为整理作品

联系方式

开源协议

本项目采用AGPL-3.0开源协议,允许个人和组织自由使用、修改和分发代码,但基于本项目的衍生作品必须同样开源,且用于提供网络服务时需向用户提供完整源代码。本项目仅供学习研究使用,作者不对使用本项目产生的任何后果承担责任,使用者应遵守当地法律法规,合理合法使用本项目。如本项目对您的研究或工作有所帮助,欢迎引用并注明出处。

声明:本站所有项目资源都可以正常运行,亲测无错!而且我们录制了演示视频,在我们注明的环境版本下,项目运行效果完全和演示视频一致。客服QQ:下载须知