KomoriTTS V1 : le premier modèle de synthèse vocale shikomori est né
annonce

KomoriTTS V1 : le premier modèle de synthèse vocale shikomori est né

Komor-IA
4 min de lecture
61 vues
Retour aux actualités

Nous sommes heureux d'annoncer la publication de KomoriTTS, le tout premier modèle de synthèse vocale (Text-to-Speech) pour le shikomori. Cette réalisation marque une étape importante pour notre startup et, plus largement, pour la présence du shikomori dans les technologies de la parole, un domaine où notre langue était, jusqu'ici, totalement absente.


À notre connaissance, il n'existait avant ce travail aucun modèle de synthèse vocale entraîné spécifiquement pour une variante du shikomori. Les technologies de la parole se sont largement développées pour les langues dites "à hautes ressources" : anglais, français, ou plus récemment le swahili...etc laissant de côté des langues comme la nôtre, malgré ses centaines de milliers de locuteurs.

KomoriTTS change cela pour le Shikomori, en particulier le dialecte Shingazidja, avec un modèle capable de convertir du texte écrit en shikomori en parole audible.

Notre approche technique

Poiur cette première version Bâta, nous avons mobilisé une stratégie de transfert d'apprentissage : notre modèle est issu de MMS-TTS, un modèle multilingue développé par Meta, à partir de son checkpoint swahili. Cette approche s'appuie sur la proximité linguistique et phonologique entre le shikomori et le swahili, deux langues bantoues partageant une part significative de leur structure.

L'architecture sous-jacente, VITS (Conditional Variational Autoencoder with Adversarial Learning), génère directement la forme d'onde audio à partir du texte, sans étape intermédiaire — une approche reconnue pour produire une parole naturelle avec un pipeline technique simplifié.

Les données : un travail collectif issus du crowdsourcing sur komor-ia.com

Ce modèle n'existerait pas sans le corpus vocal shikomori Shingazidja-voice V1 que nous avons progressivement constitué, en grande partie grâce au crowdsourcing de notre communauté, complété par des enregistrements réalisés par notre équipe. Un premier aperçu de ce corpus est d'ailleurs disponible dans notre série Shikomori Dataset, que nous continuons d'enrichir.

Ce qu'il faut savoir sur cette première version

Nous tenons à être transparents sur l'état actuel du modèle :

  • Un seul dialecte couvert pour l'instant : le Shingazidja. Les autres variantes (Shindzuani, Shimwali, Shimaore) feront l'objet de développements futurs déjà en cours.
  • Une voix unique, celle de la locutrice ayant participé à l'enregistrement du corpus d'entraînement.
  • Un volume de données encore limité, ce qui se traduit par une qualité audio variable selon les phrases : certains mots ou constructions, moins représentés dans nos données d'entraînement, sont restitués avec moins de précision que d'autres.

Nous considérons cette publication comme une version bêta : un point de départ solide, que nous comptons faire évoluer à mesure que notre corpus s'enrichit.

Essayer le modèle

KomoriTTS est désormais accessible directement sur notre site ici, dans un champ dédié où chacun peut saisir du texte et écouter sa restitution en shikomori : KomoriTTS. Nous encourageons vivement notre communauté à le tester, et à nous faire remonter ses retours, c'est un outil que nous voulons construire avec ses utilisateurs, pas seulement pour eux.

Et la suite ?

Ce premier modèle ouvre la voie à plusieurs chantiers que nous menons en parallèle :

  • L'extension aux autres dialectes du shikomori
  • L'enrichissement du corpus vocal pour améliorer la qualité et la régularité du modèle
  • Le développement d'un modèle de reconnaissance vocale (ASR), pour permettre l'opération inverse : transcrire automatiquement de la parole shikomori en texte

Chacune de ces étapes reposera, comme celle-ci, sur la participation de notre communauté — la meilleure garantie que ces outils reflètent fidèlement la langue telle qu'elle est réellement parlée.


KomoriTTS s'inscrit dans la mission de Komor-IA : donner au shikomori sa place dans les technologies numériques, à travers des outils ouverts, documentés, et construits avec la communauté qui parle cette langue.

K

Komor-IA

Équipe Komor-IA