bli://datasetsouvertsv0.1
/ Datasets ouverts

La couche de données. Publique, documentée, réutilisable.

Chaque release vit sur Hugging Face sous BantuLanguagesInitiative. Code source et pipelines sur GitHub. Standards documentés et appliqués.

Hébergé sur
01
Hugging Face
Licence par défaut
02
CC-BY-4.0
Code
03
GitHub · Open
Première release
04
2026
/ 01 · Catalogue

Datasets publiés.

Voir sur Hugging Face ↗

CSRC

● live

Congolese Speech Radio Corpus — archives radio non annotées pour le pré-entraînement auto-supervisé et l'adaptation acoustique.

Langue
Lingala · Kikongo · Tshiluba
Type · Taille
audio · radio · 10K–100K échantillons
Ouvrir ↗

LRSC

● live

Lingala Read Speech Corpus — le sous-ensemble annoté de lingala lu, prêt à charger directement avec la librairie Hugging Face datasets.

Langue
Lingala
Type · Taille
audio + transcription · 1K–10K échantillons
Ouvrir ↗
/ 02 · Comment contribuer

Standards de qualité.

Mieux vaut un dataset bien documenté que dix scrapings inutilisables. Chaque contribution est tenue à la même barre.

01

Documenter la source.

Chaque dataset est livré avec une data sheet : provenance, méthode de collecte, consentement, biais connus.

02

Le rendre reproductible.

Les scripts de nettoyage et de traitement vivent dans le repo public. N'importe qui peut rejouer le pipeline.

03

Licencier pour la réutilisation.

Par défaut, CC-BY-4.0. Si une licence plus restrictive est nécessaire, on l'explique sur la dataset card.

04

Créditer les contributeurs.

Les contributeurs sont nommés sur la page du dataset. Les communautés qui fournissent des données sont consultées et reconnues.