2025年讯飞AI开发者大赛-教育场景技术算法挑战赛道-面向受限场景的低资源多语种分类挑战赛
# 一、赛事背景
在全球化的浪潮中,语音技术已成为打破语言壁垒、增进文化交流的关键桥梁,然而,在低资源语言领域,行业内往往难以积累足够的语音数据以供模型训练,使得现有的语种分类系统在这些语言上的表现远不及主流语言。其次,语种分类技术在短语流、高噪声和实时场景的判别准确性仍然是工业界的一个技术难题。
鉴于此,我们希望通过举办“面向受限场景的低资源多语种分类”竞赛来激发全球研究学者、技术开发者和语音技术爱好者的创新热情,共同研究和开发适用于受限场景的低资源的多语种分类技术。
# 二、赛事任务
本次比赛的任务是开发一个面向受限场景下的低资源语种分类模型,这里受限场景指的是(1)每一位参赛者仅能使用提供音频1s以内的时长信息(含1s)就需要抛出语种分类的结果;(2)测试数据中覆盖了不同的噪声;本次比赛提供的测试集数据中包括了小于1s和大于等于1s的音频,其中针对大于1s的音频,参赛者只能使用前1s的信息(如果发现使用1s以后的音频信息则取消比赛资格)。
数据参赛者需要利用提供的低资源的开源语音数据集和噪声数据,训练一个高准确率和鲁棒的语种分类模型,并在测试集上进行评估。具体如下:
(一)数据
数据集请使用FLEURS开源数据来完成模型训练和验证,本次比赛面向低资源语种,因此请使用FLEURS中低资源语种;我们同时提供了开源噪声数据集MUSAN下载链接;数据集情况说明和下载链接如下:
数据介绍:
The Cross-lingual TRansfer…
MUSAN数据集下载链接:
openslr.org
低资源语种限定范围:斯瓦希里语,阿姆哈拉语,阿萨姆语,约鲁巴语,尼泊尔语,冰岛语,卢森堡语,豪萨语,林加拉语,祖鲁语,信德语,马耳他语,爱沙尼亚语,吉尔吉斯语,旁遮普语,立陶宛语,白俄罗斯语,威尔士语,索马里语
即标签限定范围:['swahili' 'amharic' 'assamese' 'yoruba' 'nepali' 'icelandic' 'luxembourgish' 'hausa' 'lingala' 'zulu' 'sindhi' 'maltese' 'estonian' 'kyrgyz' 'punjabi' 'lithuanian' 'belarusian' 'welsh' 'somali']
# 三、评审规则
## 1.评估指标
本题评估指标设置为recall召回率(average设置为macro)。
## 2.评测及排行
1)比赛提供下载数据,选手在本地进行算法调试,在比赛页面提交结果。
**请注意:测试集仅可用于输出最终的推理结果,不可以任何形式参与训练过程。**
2)排行按照得分从高到低排序,排行榜将选择团队的历史最优成绩进行排名。
# 四、项目说明
**1.本次训练数据集采用开源音频数据集google/fleurs(
huggingface.co
数据集处理可通过执行指令执行(注意将您本地musan数据集的路径替换掉代码第50行处的data_dir)
```python
python Datasets_proc.py
```
当然,此数据处理的耗时较长,也可以通过我的网盘获取最终处理的训练数据集压缩包:
通过网盘分享的文件:combined-with-noise-split.zip 链接:
pan.baidu.com 提取码: CWNS
--来自百度网盘超级会员v1的分享
测试数据集(用于模型推理的数据集):
通过网盘分享的文件:testset.zip
链接:
pan.baidu.com 提取码: qubq
**2.若通过网盘获取到的最终处理的数据集,请解压缩数据集,解压缩后数据集的文件格式如下:**
```
combined-with-noise-split
--.idea
--test
--train
--dataset-dict.json
testset
--iflytek_1
--iflytek_2
....
--iflytek_21222
```
---------特别提醒:代码当中存在引入的文件路径(如训练集、测试集以及生成文件等)请自行处理!!!--------------
在task.py当中引入训练集相对路径,如:
cwn_datasetdict_rem …