Ce que contient cette publication
Cette deuxième mise à disposition présente 5 exemples représentatifs issus d'un corpus plus large de plus de 1408 exemples, couvrant plusieurs registres de langue : phrases de la vie quotidienne, questions et dialogues, proverbes traditionnels, et actualité. Chaque exemple associe un texte en shikomori à son enregistrement audio correspondant, avec sa traduction française et sa catégorie thématique.
L'objectif de cet aperçu est de donner une idée concrète de la nature et de la qualité du corpus avant une publication plus large, tout en documentant dès maintenant la méthodologie qui l'a produit.
Une construction communautaire
Ce corpus doit son existence, pour l'essentiel, au crowdsourcing porté par notre communauté : des contributeurs ont participé à la traduction et à la collecte de phrases en shikomori, un travail que notre équipe a ensuite complété par des enregistrements supplémentaires. Les phrases sources, rédigées par l'équipe Komor-IA, ont été enregistrées dans des conditions calmes, à l'aide d'un simple microphone de téléphone — un choix délibéré pour rendre la contribution accessible au plus grand nombre, sans exiger de matériel spécialisé.
C'est une approche que nous assumons pleinement : documenter une langue peu dotée en ressources numériques passe d'abord par la mobilisation de ses locuteurs, plus que par des moyens techniques lourds.
Pourquoi publier ce type de données
Trois objectifs guident cette démarche :
- La recherche linguistique, en mettant à disposition des données structurées et documentées sur le shikomori, une langue encore peu représentée dans la littérature scientifique en traitement automatique des langues.
- L'entraînement de modèles d'intelligence artificielle, notamment de synthèse vocale (TTS) et, à terme, de reconnaissance vocale (ASR) — deux axes sur lesquels notre équipe travaille activement.
- La préservation de la langue elle-même, en constituant une trace numérique durable et réutilisable du shikomori parlé.
Structure des données
Chaque entrée du corpus suit une structure simple, pensée pour être exploitable directement :
corpus/ ├── 0001.txt → texte en shikomori ├── 0001.wav → enregistrement audio correspondant ├── 0002.txt ├── 0002.wav └── ...
Les métadonnées associées à chaque exemple incluent l'identifiant de la phrase, le texte source en français, sa traduction en shikomori, sa catégorie thématique, et le fichier audio correspondant.
La suite
Cette publication s'inscrit dans la continuité de notre série Shikomori Dataset, et prépare la mise à disposition d'un corpus plus complet dans les mois à venir. Elle fait également écho à nos travaux récents sur la synthèse vocale shikomori, pour lesquels ce type de données constitue la matière première indispensable.
Nous continuerons à documenter chaque étape de ce travail — méthodologie, choix techniques, limites connues, dans un souci de transparence vis-à-vis de la communauté et du monde de la recherche.
Pour consulter le dataset : komor-ia.com/datasets
Les personnes souhaitant contribuer à la collecte de données textuelles ou vocales peuvent s'inscrire sur la plateforme komor-ia.com.
