摘要:该数据集是由AI4Bharat整理的梵语自动语音识别语料库,音频来源于印度全印广播电台新闻服务部,共包含约27小时的梵语新闻广播录音。

数据集概述

该数据集是由AI4Bharat整理的梵语自动语音识别语料库,音频来源于印度全印广播电台新闻服务部,共包含约27小时的梵语新闻广播录音。数据同时提供语音文件、句子级转写文本和字符级标记,可直接用于低资源语言自动语音识别模型的训练与评估,并采用CC0许可协议开放使用。

数据结构与关键特征

数据集主要包含Audio files和sanskrit_fairseq目录。各新闻简报的音频分别存放在独立文件夹中,文件采用16 kHz采样率的WAV格式,并按照句子编号命名。Fairseq格式部分包含train.tsv、train.wrd和train.ltr三个文件:train.tsv记录音频相对路径及帧数,train.wrd按对应行保存句子转写,train.ltr则提供字符级分词结果。三个文件通过行号保持音频、文本和字符序列的一一对应关系。

应用价值与研究方向

该数据集可用于梵语语音识别、新闻音频转写、语音与文本对齐、发音建模及低资源语言技术研究。研究方向包括CTC、Transformer与Conformer语音识别,自监督语音模型微调、字符级和词级建模、语言模型融合、跨语言迁移学习及噪声环境鲁棒性研究。还可进一步用于梵语语音检索、字幕生成、数字文献整理和广播内容归档。

数据集来源

由张家梁(Bob)整理并于2026年在7zcode平台公开发布。

数据集信息

免责声明与引用

数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。

作者信息

作者:Bob (张家梁)
项目编号:Datasets-569
文件大小:5.9G
原创声明:本数据集为整理作品

联系方式

开源协议

本项目采用AGPL-3.0开源协议,允许个人和组织自由使用、修改和分发代码,但基于本项目的衍生作品必须同样开源,且用于提供网络服务时需向用户提供完整源代码。本项目仅供学习研究使用,作者不对使用本项目产生的任何后果承担责任,使用者应遵守当地法律法规,合理合法使用本项目。如本项目对您的研究或工作有所帮助,欢迎引用并注明出处。

声明:本站所有项目资源都可以正常运行,亲测无错!而且我们录制了演示视频,在我们注明的环境版本下,项目运行效果完全和演示视频一致。客服QQ:下载须知