[控场AI]
基准TutlAit v1 / 塔马齐格特语语音数据集

TutlAit

摩洛哥塔马齐格特语语音数据集,将塔马齐格特语语音与现代标准阿拉伯语文本配对并附有地区口音标签,通过众包方式采集,旨在支持低资源语言的自动语音识别与语音翻译研究

时间轴 (近 90 天)

10月1日

TutlAit 是一个将摩洛哥塔马齐格特语语音与现代标准阿拉伯语文本配对、并带有明确地区口音标签的语料库

待验证50%
10月1日

TutlAit 众包网页应用前端使用 React 18,后端基于 Django 5 与 Django REST Framework,数据存储采用 PostgreSQL

待验证50%
10月1日

研究团队通过 LinkedIn 和 Instagram 上的定向推广活动招募母语使用者

待验证50%
10月1日

TutlAit 采用两种工作流:文本转音频(Text-to-Audio)和音频转文本(Audio-to-Text)

待验证50%
10月1日

团队使用 ELAN 工具对从视听媒体提取的补充片段进行切分和标注,并通过批量 CSV/ZIP 管道导入系统

待验证50%
10月1日

TutlAit 在服务器端将音频统一转换为 16kHz 单声道 WAV 格式,并使用 SHA-256 哈希进行去重

待验证50%
10月1日

TutlAit 的数据质量把控采用哈希去重、时长边界检查与人工审核相结合的方式

待验证50%
10月1日

TutlAit v1 数据集包含 13,384 个音频文件,总时长 75,231 秒(约 20.9 小时,约 3.01GB)

待验证50%
10月1日

TutlAit v1 的地区变体分布不均:阿特拉斯变体9,956个文件(约14.08小时)、苏斯变体3,378个文件(约6.75小时)、里夫变体仅22个文件、卡比尔变体仅28个文件

待验证50%
10月1日

里夫和卡比尔变体子集规模极小,对训练覆盖全部变体的模型而言是明显短板

待验证50%

全部知识事实 (10)

来源文章