CoolFace
Datasetpublic

Tree-AI-lab/baoule-asr-dataset-mixture

Baoulé ASR Hackathon Mixture Dataset MixtureParquet préparé par Tree AI Lab pour le fine-tuning de facebook/omniASR-CTC-1B en baoulé (bci_Latn). Contenu Exemples sélectionnés : 1219 Durée avant réencodage : 3.706 h Audio : FLAC mono 16 kHz, 40 secondes maximum Texte : transcription baoulé normalisée Source Split Exemples Heures klayt dev 15 0.034 klayt test 212 0.440 klayt train 23 0.061 waxal dev 95 0.326 waxal test 91 0.288 waxal train… See the full description on the dataset page: https://huggingface.co/datasets/Tree-AI-lab/baoule-asr-dataset-mixture.

sourceHugging Faceupdated 5h agoView on Hugging Face
0likes
Dataset Card

Baoulé ASR Hackathon Mixture

Dataset MixtureParquet préparé par Tree AI Lab pour le fine-tuning de facebook/omniASR-CTC-1B en baoulé (bci_Latn).

Contenu

  • —Exemples sélectionnés : 1219
  • —Durée avant réencodage : 3.706 h
  • —Audio : FLAC mono 16 kHz, 40 secondes maximum
  • —Texte : transcription baoulé normalisée
SourceSplitExemplesHeures
klaytdev150.034
klayttest2120.440
klayttrain230.061
waxaldev950.326
waxaltest910.288
waxaltrain7832.556

Sources et versions

  • —google/WaxalNLP, configuration bau_tts, révision 5f4d8ca24f2b9d168b2ee545f1febaaff4b40580
  • —Klayt/baoule-common-voice, révision 96eb4413b7cc3190c39a35ee03eccb321c2b9929

WaxalNLP affiche des licences CC BY 4.0 et CC BY-SA 4.0 selon ses données. Klayt/baoule-common-voice est publié sous CC0 1.0. Les utilisateurs doivent respecter les licences et obligations d'attribution des sources d'origine.

Sélection hackathon

Le corpus contient les exemples validés manuellement, les validations automatiques et les Waxal non rejetés de 40 secondes maximum. Les exclusions manuelles sont respectées. Les Klayt non révisés et les Waxal longs restent différés.

Le fichier hackathon_selection_manifest.csv conserve la décision et la raison pour chaque exemple audité.

Format OmniASR

text
baoule_mixed/version=0/corpus=<waxal|klayt>/split=<train|dev|test>/language=bci_Latn/part-*.parquet

Chaque ligne contient text, audio_bytes et audio_size. Les colonnes corpus, split et language proviennent des partitions Hive.

Limites

Cette version est un sous-ensemble destiné au hackathon. La revue manuelle et la segmentation des enregistrements longs continueront après l'événement.