摘要:该数据集面向实时英语口语错误识别与智能纠正任务,共收录250位不同说话者的5245个语音样本。
数据集概述
该数据集面向实时英语口语错误识别与智能纠正任务,共收录250位不同说话者的5245个语音样本。每个样本将原始语音、包含错误的转录文本和标准修正句子进行关联,同时覆盖不同口音、语速、环境噪声及录音设备条件,可用于研究自然交流环境下的英语口语理解与反馈。
数据结构与关键特征
每条记录包含 Sample_ID、Speaker_ID、Transcript、Ground_Truth、Error_Type、Accent、Noise_Level、Speech_Rate、Device_Type 和 Target_Label 等字段,并与相应音频文件建立对应关系。其中,目标标签分为正确、部分正确和错误三类,录音设备包括手机、物联网麦克风和耳机,数据同时具有音频、文本、说话人属性、录音环境及分类标签等多维特征。
应用价值与研究方向
该数据集可用于英语口语错误检测、自动语音识别、口语质量评价、语法纠正、发音辅助和实时语言学习反馈。研究方向包括音频与文本特征融合、多任务学习、口音鲁棒识别、噪声环境语音增强、语速自适应建模、错误类型分类、端到端口语纠错及大语言模型辅助反馈,还可用于研究跨说话人泛化和移动端实时口语评测。
数据集来源
由张家梁(Bob)整理并于2026年在7zcode平台公开发布。
数据集信息
免责声明与引用
数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。
作者信息
作者:Bob (张家梁)
项目编号:Datasets-576
文件大小:490M
原创声明:本数据集为整理作品
联系方式

开源协议
本项目采用AGPL-3.0开源协议,允许个人和组织自由使用、修改和分发代码,但基于本项目的衍生作品必须同样开源,且用于提供网络服务时需向用户提供完整源代码。本项目仅供学习研究使用,作者不对使用本项目产生的任何后果承担责任,使用者应遵守当地法律法规,合理合法使用本项目。如本项目对您的研究或工作有所帮助,欢迎引用并注明出处。


评论(0)