CoolFace
Datasetpublic

binaryMao/Kunkado_Maya_V2

Kunkado Maya V2 (Standardized) Description Ce dataset est une version transformée du dataset original RobotsMali/Kunkado (configuration human-reviewed). L'objectif de cette version est de fournir des transcriptions dont les tags d'émotions et de bruits sont 100% compatibles avec les standards d'intégration de Maya One. Transformations effectuées Une pipeline de nettoyage automatique a été appliquée sur la colonne corrected-label pour générer la… See the full description on the dataset page: https://huggingface.co/datasets/binaryMao/Kunkado_Maya_V2.

sourceHugging Faceapache-2.0updated 8mo agoView on Hugging Face
0likes20downloads
Dataset Card

Kunkado Maya V2 (Standardized)

Description

Ce dataset est une version transformée du dataset original RobotsMali/Kunkado (configuration human-reviewed). L'objectif de cette version est de fournir des transcriptions dont les tags d'émotions et de bruits sont 100% compatibles avec les standards d'intégration de Maya One.

Transformations effectuées

Une pipeline de nettoyage automatique a été appliquée sur la colonne corrected-label pour générer la colonne text_maya :

  1. 1.Standardisation des tags : Passage du format Kunkado [TAG] ou <TAG> vers le format Maya <tag>.
  2. 2.Mapping des émotions :
  3. 3.COLERE / PEUR $\rightarrow$ <cri>
  4. 4.JOIE / RIRE $\rightarrow$ <laugh> (ou <rire>)
  5. 5.APPEL $\rightarrow$ <invocation>
  6. 6.INCANTATION $\rightarrow$ <incantation>
  7. 7.SILENCE $\rightarrow$ <silence>
  8. 8.Nettoyage du bruit : Suppression totale des tags de type incompréhensible.
  9. 9.Normalisation : Suppression des espaces multiples et mise en minuscules des tags.

Structure du Dataset

Le fichier contient les colonnes originales pour référence, ainsi que la nouvelle colonne cible :

  • text_maya : La transcription finale prête pour Maya One.

Utilisation

python
from datasets import load_dataset
dataset = load_dataset("binaryMao/Kunkado_Maya_V2")