Shikomori Dataset : un nouveau corpus vocal rejoint notre série de jeux de données ouverts
annonce

Shikomori Dataset : un nouveau corpus vocal rejoint notre série de jeux de données ouverts

Komor-IA
3 min de lecture
34 vues
Retour aux actualités

Dans le cadre de notre série Shikomori Dataset, nous publions aujourd'hui un nouvel ensemble de données : un corpus vocal en shikomori (dialecte Shingazidja) : Shingazidja-Voice V1.0.0. Pensé pour la recherche linguistique et l'entraînement de modèles d'intelligence artificielle appliqués à notre langue.


Ce que contient cette publication

Cette deuxième mise à disposition présente 5 exemples représentatifs issus d'un corpus plus large de plus de 1408 exemples, couvrant plusieurs registres de langue : phrases de la vie quotidienne, questions et dialogues, proverbes traditionnels, et actualité. Chaque exemple associe un texte en shikomori à son enregistrement audio correspondant, avec sa traduction française et sa catégorie thématique.

L'objectif de cet aperçu est de donner une idée concrète de la nature et de la qualité du corpus avant une publication plus large, tout en documentant dès maintenant la méthodologie qui l'a produit.

Une construction communautaire

Ce corpus doit son existence, pour l'essentiel, au crowdsourcing porté par notre communauté : des contributeurs ont participé à la traduction et à la collecte de phrases en shikomori, un travail que notre équipe a ensuite complété par des enregistrements supplémentaires. Les phrases sources, rédigées par l'équipe Komor-IA, ont été enregistrées dans des conditions calmes, à l'aide d'un simple microphone de téléphone — un choix délibéré pour rendre la contribution accessible au plus grand nombre, sans exiger de matériel spécialisé.

C'est une approche que nous assumons pleinement : documenter une langue peu dotée en ressources numériques passe d'abord par la mobilisation de ses locuteurs, plus que par des moyens techniques lourds.

Pourquoi publier ce type de données

Trois objectifs guident cette démarche :

  • La recherche linguistique, en mettant à disposition des données structurées et documentées sur le shikomori, une langue encore peu représentée dans la littérature scientifique en traitement automatique des langues.
  • L'entraînement de modèles d'intelligence artificielle, notamment de synthèse vocale (TTS) et, à terme, de reconnaissance vocale (ASR) — deux axes sur lesquels notre équipe travaille activement.
  • La préservation de la langue elle-même, en constituant une trace numérique durable et réutilisable du shikomori parlé.

Structure des données

Chaque entrée du corpus suit une structure simple, pensée pour être exploitable directement :

corpus/
├── 0001.txt   → texte en shikomori
├── 0001.wav   → enregistrement audio correspondant
├── 0002.txt
├── 0002.wav
└── ...

Les métadonnées associées à chaque exemple incluent l'identifiant de la phrase, le texte source en français, sa traduction en shikomori, sa catégorie thématique, et le fichier audio correspondant.

La suite

Cette publication s'inscrit dans la continuité de notre série Shikomori Dataset, et prépare la mise à disposition d'un corpus plus complet dans les mois à venir. Elle fait également écho à nos travaux récents sur la synthèse vocale shikomori, pour lesquels ce type de données constitue la matière première indispensable.

Nous continuerons à documenter chaque étape de ce travail — méthodologie, choix techniques, limites connues, dans un souci de transparence vis-à-vis de la communauté et du monde de la recherche.

Pour consulter le dataset : komor-ia.com/datasets

Les personnes souhaitant contribuer à la collecte de données textuelles ou vocales peuvent s'inscrire sur la plateforme komor-ia.com.

K

Komor-IA

Équipe Komor-IA

Shikomori Dataset : un nouveau corpus vocal rejoint notre série de jeux de données ouverts — Komor-IA