Une équipe internationale, une expertise en data engineering et en IA, notre propre infrastructure de calcul GPU et la force d'une communauté — pour faire entrer le hassaniya, le pulaar, le soninké et le wolof dans l'intelligence artificielle. Et demain, bien d'autres.
Longtemps invisibles pour les machines, nos langues prennent leur place dans l'IA — à égalité, sans hiérarchie.
Et la liste s'allongera — chaque dialecte mérite sa voix numérique.
De vrais enregistrements de la compétition, en hassaniya — contributions anonymisées, nettoyées. Clique pour écouter une voix réelle.
À partir des voix de la communauté, nous entraînons notre modèle de synthèse vocale (TTS) — pour que l'IA ne se contente pas de comprendre nos langues, mais qu'elle les parle. Le premier modèle hassaniya est en cours de création.
Chaque donnée suit un parcours rigoureux — la discipline d'un laboratoire de recherche, à chaque étape.
La communauté écrit et enregistre sa langue via Elson — texte et voix, par ceux qui la parlent.
Plusieurs évaluateurs notent chaque contribution. Le consensus tranche, un score de qualité est calculé.
Nos évaluateurs internes contrôlent les cas limites et garantissent la fiabilité du corpus.
Nos pipelines nettoient, dédupliquent et structurent la donnée brute à l'état de l'art.
Nous entraînons nos modèles sur notre propre capacité de calcul, en souveraineté.
Trois étapes, une même exigence : transformer la voix d'une communauté en une intelligence artificielle fiable.
Via Elson, des locuteurs écrivent, enregistrent et valident leur langue. La matière vient de ceux qui la parlent réellement.
Nos pipelines de data engineering transforment la donnée brute de la communauté en corpus fiables, structurés et prêts pour l'entraînement.
Une infrastructure et une capacité GPU qui nous appartiennent : nous entraînons nos modèles nous-mêmes, en souveraineté, sans dépendance.
Initié par RIM AI il y a trois ans, Elson est le projet des dialectes nationaux à faibles ressources : une plateforme de crowdsourcing qui rassemble la communauté, et des modèles de langue (LLM) low-resource entraînés pour ces langues longtemps absentes du numérique. Une initiative née en Mauritanie, portée par ses chercheurs et ses locuteurs.
La communauté s'affronte langue par langue. Le hassaniya d'abord — le pulaar ensuite.
Traduire, enregistrer, valider — et grimper au classement.
Bravo et merci pour votre engagement exceptionnel 🎉
Lauréats de la compétition Elson Hassaniya
Des chercheurs et ingénieurs réunis autour d'un même projet, sur trois continents.
Demain, ces dialectes — longtemps absents du numérique — seront accessibles à tous.
Développeurs, chercheurs, institutions, diaspora : une IA construite ici, et offerte au monde entier.