bli-asr-1 · ASR lingala
Deuxième itération de notre modèle de reconnaissance vocale du lingala — Whisper large-v3 adapté avec LoRA, entraîné sur Waxal et notre corpus LRSC. Poids ouverts sur Hugging Face.
Datasets ouverts, modèles NLP/ASR/TTS et outils linguistiques pour les 500+ langues bantoues parlées en Afrique centrale, orientale et australe — en commençant par le lingala.
Des centaines de millions de locuteurs. Quasi-aucune représentation dans les grands systèmes d'IA. Les deux chiffres sont réels.
Les plus grands modèles de langage au monde sont entraînés sur des données massivement anglaises, mandarines, et issues d'une poignée de langues européennes. Quand 350 millions de personnes qui parlent une langue bantoue tentent d'utiliser un assistant vocal, un chatbot, un moteur de recherche — les systèmes ne font même pas semblant d'écouter.
Ce n'est pas un caprice de la technologie. C'est une question de quelles voix ont été jugées dignes d'être enregistrées. Nous existons pour changer cette réponse — pas en agitant des slogans sur l'« IA pour l'Afrique », mais en livrant le travail patient et précis qui fait vraiment l'infrastructure : datasets propres, pipelines reproductibles, benchmarks publics.
Si on ne peut pas l'entraîner dessus, l'évaluer, et l'améliorer en open source — ça n'existe pas pour l'IA. C'est ce qu'on change.
Le lingala est la lingua franca de Kinshasa — ville de quinze millions d'habitants et l'une des plus dynamiques au monde — et de la majeure partie du bassin du Congo. Il est chanté à travers l'Afrique, diffusé sur des dizaines de radios, et utilisé chaque jour dans les marchés, les bureaux, les écoles et les ministères.
Il est aussi fonctionnellement invisible pour les systèmes d'IA qui médient de plus en plus la banque, l'éducation et la santé. Commencer ici est un choix de poids : une grande langue africaine, une riche tradition orale et écrite, et un écart mesurable que nous pouvons combler.
« Mbote na yo, ndenge nini ozali ? »
Bonjour, comment vas-tu ? · [mbote na jo, ndenge nini oˈzali]
Deuxième itération de notre modèle de reconnaissance vocale du lingala — Whisper large-v3 adapté avec LoRA, entraîné sur Waxal et notre corpus LRSC. Poids ouverts sur Hugging Face.
Congolese Speech Radio Corpus — archives radio non annotées en lingala, kikongo et tshiluba, pour le pré-entraînement auto-supervisé et l'adaptation acoustique.
Lingala Read Speech Corpus — le sous-ensemble lingala annoté, repackagé pour se charger directement avec la librairie datasets de Hugging Face.
Notre premier modèle de reconnaissance vocale pour le lingala — Whisper large-v3 adapté avec LoRA. Poids ouverts sur Hugging Face.