摘要:该数据集面向英汉口译语音的噪声分析与语音质量评价任务,共包含12,000条音频记录和11个字段。
数据集概述
该数据集面向英汉口译语音的噪声分析与语音质量评价任务,共包含12,000条音频记录和11个字段。数据覆盖英语、中文及英汉混合语音,并包含多人声、汽车、餐厅、车站、街道、火车和无噪声等环境条件,可用于研究不同噪声类型和强度对口译语音清晰度与可懂度的影响
数据结构与关键特征
数据集由Audio/English_Chinese_Interpretatio音频目录和对应的CSV结构化记录组成。每条记录包含样本编号、音频文件名、所在目录、说话者性别、噪声类型、语言模式、口译场景、标注状态、噪声强度分数和语音质量分数。target_noise_level为目标字段,将总体噪声划分为极低、低、中等、高和严重五个等级,适合开展多类别分类与质量回归研究。
应用价值与研究方向
该数据集可用于口译语音质量监测、噪声等级识别、语音增强、自动语音识别鲁棒性评估和实时翻译系统优化。研究方向包括环境噪声分类、语音质量预测、声谱特征分析、深度学习降噪、说话者与语言无关建模、跨场景泛化、噪声强度回归及轻量化部署,还可用于比较不同噪声环境对中英文语音识别和口译准确率的影响。
数据集来源
由张家梁(Bob)整理并于2026年在7zcode平台公开发布。
数据集信息
免责声明与引用
数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。
作者信息
作者:Bob (张家梁)
项目编号:Datasets-601
文件大小:130M
原创声明:本数据集为整理作品
联系方式

开源协议
本项目采用AGPL-3.0开源协议,允许个人和组织自由使用、修改和分发代码,但基于本项目的衍生作品必须同样开源,且用于提供网络服务时需向用户提供完整源代码。本项目仅供学习研究使用,作者不对使用本项目产生的任何后果承担责任,使用者应遵守当地法律法规,合理合法使用本项目。如本项目对您的研究或工作有所帮助,欢迎引用并注明出处。


评论(0)