annonce

Lancement du module de collecte de données vocales : Komor-IA

Komor-IA
5 min de lecture
55 vues
Retour aux actualités

Komor-IA franchit une nouvelle étape dans la construction de son écosystème linguistique pour le Shikomori. Après le lancement de la campagne de traduction textuelle, la plateforme intègre désormais un module complet de collecte de données vocales, une brique fondamentale pour le développement de modèles de reconnaissance et de synthèse vocale en langues comoriennes.


Le développement de systèmes d'intelligence artificielle performants pour une langue repose sur deux types de ressources complémentaires : des corpus textuels et des corpus audio. Si la campagne de traduction lancée cette semaine s'attaque au premier volet, le module vocal que nous déployons aujourd'hui constitue le second pilier de notre stratégie de collecte de données.

Ce module a été entièrement conçu et développé par l'équipe Komor-IA, en s'inspirant des meilleures pratiques du secteur, notamment le projet Mozilla Common Voice, et en les adaptant aux spécificités linguistiques et dialectales du Shikomori.

Fonctionnement du module

La contribution vocale est accessible directement depuis le tableau de bord de la plateforme komor-ia.com, via un onglet dédié intitulé "Enregistrement vocal". Le processus a été conçu pour être le plus accessible possible, sans aucune compétence technique préalable.

Le contributeur sélectionne son dialecte parmi les quatre variantes du Shikomori, Shingazidja, Shindzuani, Shimwali ou Shimaore, puis se voit afficher une phrase en Shikomori à lire à voix haute. L'enregistrement s'effectue directement depuis le navigateur, via le microphone de l'appareil utilisé, qu'il s'agisse d'un ordinateur, d'une tablette ou d'un smartphone. La durée est limitée à 30 secondes par enregistrement. Le contributeur peut réécouter avant de soumettre, et soumettre en un seul clic. L'audio est automatiquement sécurisé sur nos serveurs.

À chaque soumission, des métadonnées peuvent être renseignées de manière optionnelle : genre, tranche d'âge, île d'origine, zone géographique (urbaine ou rurale) et statut de locuteur natif. Ces métadonnées sont essentielles pour garantir la diversité et la représentativité scientifique du corpus produit.

Architecture et règles du système

Chaque phrase peut être enregistrée par trois contributeurs au maximum, afin d'assurer la diversité des voix tout en évitant la redondance. Une fois ce quota atteint, la phrase passe automatiquement en statut "Complète" et est retirée de la file de contribution. Un contributeur ne peut pas enregistrer deux fois la même phrase, sauf si son enregistrement précédent a été rejeté.

Les fichiers audio sont stockés et hébergés de manière sécurisée. Chaque enregistrement est associé à une phrase, un dialecte, et les métadonnées fournies par le contributeur.

Processus de validation

Chaque enregistrement soumis passe par une revue humaine assurée par l'équipe Komor-IA et les linguistes partenaires du projet. Les validateurs disposent d'une interface dédiée permettant d'écouter les enregistrements, de consulter les métadonnées associées, et de valider ou rejeter chaque contribution avec une raison documentée. En cas de rejet, le contributeur en est notifié et peut soumettre un nouvel enregistrement.

Ce processus de validation garantit la qualité scientifique de chaque entrée intégrée au corpus final.

Données collectées

DonnéeDescription
AudioFichier .webm, durée maximale de 30 secondes
PhraseIdentifiant et texte en Shikomori
DialecteShingazidja, Shindzuani, Shimwali ou Shimaore
GenreHomme, Femme ou Autre (optionnel)
Tranche d'âgeCinq tranches, de moins de 18 ans à plus de 50 ans (optionnel)
Île d'origineGrande Comore, Anjouan, Mohéli, Mayotte ou Diaspora (optionnel)
ZoneUrbaine ou rurale (optionnel)
Locuteur natifOui ou Non (optionnel)

Impact scientifique et technologique

Le corpus audio constitué par ce module alimentera directement plusieurs axes de recherche et de développement au sein du projet ShikomoriTranslate.

Il servira de base à l'entraînement de modèles de reconnaissance vocale automatique (ASR) en Shikomori. Il permettra également d'explorer le développement de modèles de synthèse vocale (TTS) pour les quatre dialectes comoriens, ouvrant la voie à des interfaces vocales accessibles dans les zones à faible connectivité ou à faible taux d'alphabétisation.

Au-delà des aspects techniques, ce corpus constitue un patrimoine linguistique numérique pour les Comores, librement accessible à la communauté scientifique sous licence ouverte à l'issue du projet.

Comment contribuer

La contribution est gratuite, ouverte à tous les locuteurs du Shikomori, et ne nécessite aucune compétence technique.

  1. Créer un compte sur komor-ia.com
  2. Accéder à l'onglet Enregistrement vocal depuis le tableau de bord
  3. Sélectionner son dialecte
  4. Lire la phrase affichée et enregistrer
  5. Soumettre

Le guide complet est disponible sur komor-ia.com/contribution.


Komor-IA : Intelligence Artificielle pour l'Afrique

K

Komor-IA

Équipe Komor-IA