Komor-IA · Juillet 2026
Le shikomori compte quatre dialectes principaux : shingazidja, shindzuani, shimwali et shimaore, et ne dispose à ce jour d'aucune, ou de peux de ressources numériques standardisées exploitables pour l'apprentissage automatique. Le Shikomori Dataset a pour objectif de combler ce manque, dialecte par dialecte. Cette première version se concentre sur le shingazidja, parlé sur l'île de la Grande Comore.
Contenu et méthodologie
Le corpus a été constitué par crowdsourcing via la plateforme Komor-IA, à partir de contributions de locuteurs comoriens volontaires, puis relu et validé par une équipe de linguistes. Il couvre neuf catégories thématiques, sélectionnées pour représenter des registres de langue variés :
- vie quotidienne
- presse et actualité
- questions et dialogues
- éducation
- culture et proverbes
- santé
- administration
- chiffres, dates et noms propres
- phrases expressives destinées à la synthèse vocale (TTS)
Exemples de paires de phrases :
| Français | Shingazidja |
|---|---|
| Bonjour comment vas-tu aujourd'hui ? | ɓariza lewo, ngawe mnono ? |
| Où est la mosquée la plus proche ? | Omsihiri wakariɓu nguo nɗahu ? |
| Je bois du thé chaque matin. | Mi hunwa cai haina trasi. |
| Parle fort. | Rongoa hakuu. |
| Le médecin vaccine les nourrissons chaque semaine. | Etwaɓiɓu ye ucandja owana watiti haina mfumo. |
Traitement phonologique
Le shingazidja distingue deux paires de consonnes implosives, b/ɓ et d/ɗ, fréquemment confondues dans les transcriptions existantes en shikomori, faute de convention orthographique stabilisée. Chaque occurrence de b ou d dans le corpus a fait l'objet d'une vérification manuelle et, le cas échéant, d'une correction pour restituer la distinction phonologique correcte.
Cette étape est déterminante pour la suite du projet : un corpus phonologiquement fiable est un prérequis pour tout système de synthèse ou de reconnaissance vocale visant une prononciation correcte, et une ambiguïté non résolue à ce stade se propagerait à l'ensemble des modèles entraînés en aval.
Cas d'usage visés
Le corpus est conçu comme ressource de base pour plusieurs applications :
- entraînement de systèmes de traduction automatique français → shingazidja
- travaux de linguistique comparative sur le shikomori
- ressources pédagogiques pour l'enseignement du shingazidja
- amorçage de la collecte de données vocales (ASR / TTS)
Disponibilité et licence
Le dataset est publié sous licence CC BY-NC 4.0, à destination des chercheurs en traitement automatique des langues et en linguistique africaine. Nous encourageons son usage à des fins de recherche non commerciale et invitons les équipes intéressées à nous contacter pour toute collaboration.
Citation :
@dataset{komoria2026parallel_fr_zdj, title = {Dataset Parallèle Français–Shingazidja v1.0}, author = {Komor-IA}, year = {2026}, language = {shi-zdj}, license = {CC-BY 4.0}, url = {https://www.komor-ia.com/datasets/}, note = {Corpus de paires de phrases alignées français–shingazidja, constitué par crowdsourcing et validé par des linguistes.} }
Limites actuelles
Cette première version reste d'échelle modeste (1 568 paires) au regard des corpus utilisés pour l'entraînement de modèles de langue à grande échelle, et se limite à un seul dialecte sur les quatre que compte le shikomori. La couverture thématique, bien que diversifiée, ne reflète pas encore l'ensemble des registres et variations dialectales internes au shingazidja. Ces limites seront progressivement adressées dans les versions et datasets à venir.
Prochaines étapes
Le Shikomori Dataset a vocation à s'étendre aux trois autres dialectes comoriens, shindzuani, shimwali et shimaore, selon un calendrier de publication similaire. En parallèle, Komor-IA constitue actuellement ses premiers jeux de données vocaux en shikomori, également destinés à une publication ouverte à la communauté scientifique.
Pour consulter le dataset : komor-ia.com/datasets
Les personnes souhaitant contribuer à la collecte de données textuelles ou vocales peuvent s'inscrire sur la plateforme komor-ia.com.
Komor-IA
