CSRC
● liveCongolese Speech Radio Corpus — archives radio non annotées pour le pré-entraînement auto-supervisé et l'adaptation acoustique.
Chaque release vit sur Hugging Face sous BantuLanguagesInitiative. Code source et pipelines sur GitHub. Standards documentés et appliqués.
Congolese Speech Radio Corpus — archives radio non annotées pour le pré-entraînement auto-supervisé et l'adaptation acoustique.
Lingala Read Speech Corpus — le sous-ensemble annoté de lingala lu, prêt à charger directement avec la librairie Hugging Face datasets.
Mieux vaut un dataset bien documenté que dix scrapings inutilisables. Chaque contribution est tenue à la même barre.
Chaque dataset est livré avec une data sheet : provenance, méthode de collecte, consentement, biais connus.
Les scripts de nettoyage et de traitement vivent dans le repo public. N'importe qui peut rejouer le pipeline.
Par défaut, CC-BY-4.0. Si une licence plus restrictive est nécessaire, on l'explique sur la dataset card.
Les contributeurs sont nommés sur la page du dataset. Les communautés qui fournissent des données sont consultées et reconnues.