摘要:英语口语发音缺陷数据集是一个面向自动发音评估、口语能力分析与发音缺陷识别研究的结构化语音数据集,共包含 4000 条说话人记录和 27 个字段。数据集综合记录了说话人的人口统计属性、语言背景、录音环境、声学语音特征以及发音质量指标,可从音素准确性、元音与辅音实现、重音、语调和流畅性等多个维度描述英语口语表现。

数据集概述

英语口语发音缺陷数据集是一个面向自动发音评估、口语能力分析与发音缺陷识别研究的结构化语音数据集,共包含 4000 条说话人记录和 27 个字段。数据集综合记录了说话人的人口统计属性、语言背景、录音环境、声学语音特征以及发音质量指标,可从音素准确性、元音与辅音实现、重音、语调和流畅性等多个维度描述英语口语表现。相较于仅关注单一声学特征的数据,该数据集同时考虑不同母语背景和录音条件带来的差异,因此适合用于研究复杂环境下的自动英语发音诊断与口语质量评价。

数据结构与关键特征

该数据集的特征主要可以划分为基础信息、声学特征、发音偏差和综合评价四类。基础信息包括说话人ID、年龄、性别、母语组和录音环境;声学与流畅性指标包括语音持续时间、信噪比、语音活跃度、静音率、平均音高、音高变化、语速和发音速率等;发音缺陷相关指标包括音素错误率、元音偏差分数、辅音偏差分数、重音模式错误、语调偏差和流畅性中断指数;综合质量指标则包含发音清晰度评分、声学发音质量、DGJO特征相关性以及IDNN置信度评分等。目标变量为 Pronunciation Defect Class(发音缺陷类别),包括正确、元音缺陷、辅音缺陷、重音缺陷、流畅性缺陷和语调缺陷,可用于典型的多分类建模任务。

应用价值与研究方向

该数据集可广泛应用于智能英语学习、计算机辅助语言学习(CALL)、自动口语考试和语音智能评测等领域。研究人员可以采用随机森林、XGBoost、支持向量机等机器学习方法分析不同语音指标与发音缺陷之间的关系,也可以结合CNN、LSTM、Transformer及自监督语音模型开展自动缺陷分类与发音质量预测。进一步可以研究不同母语背景下的英语发音迁移规律、元音和辅音错误诊断、重音与语调自动评价、流畅度分析、模型可解释性以及个性化发音纠正建议,从而构建面向英语学习者的实时发音检测与智能口语训练系统。

数据集来源

由张家梁(Bob)整理并于2026年在7zcode平台公开发布。

数据集信息

免责声明与引用

数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。

作者信息

作者:Bob (张家梁)
项目编号:Datasets-426
文件大小:190K
原创声明:本数据集为整理作品

联系方式

开源协议

本项目采用AGPL-3.0开源协议,允许个人和组织自由使用、修改和分发代码,但基于本项目的衍生作品必须同样开源,且用于提供网络服务时需向用户提供完整源代码。本项目仅供学习研究使用,作者不对使用本项目产生的任何后果承担责任,使用者应遵守当地法律法规,合理合法使用本项目。如本项目对您的研究或工作有所帮助,欢迎引用并注明出处。

声明:本站所有项目资源都可以正常运行,亲测无错!而且我们录制了演示视频,在我们注明的环境版本下,项目运行效果完全和演示视频一致。客服QQ:下载须知