CoolFace
Datasetpublic

sjhuskey/enenlhet-wav2vec2-dataset

Enenlhet Wav2Vec2 Dataset This dataset contains preprocessed audio features and tokenized text for training Wav2Vec2 models on the Enenlhet language. Dataset Summary Train: 3,053 examples Test: 170 examples Validation: 170 examples Total: 3,393 examples Features input_values: Preprocessed audio features (16kHz, normalized float32 arrays) labels: Tokenized text as integer sequences Usage from datasets import load_dataset # Load… See the full description on the dataset page: https://huggingface.co/datasets/sjhuskey/enenlhet-wav2vec2-dataset.

sourceHugging Facecc-by-nc-4.0updated 1y agoView on Hugging Face
0likes34downloads
Dataset Card

Enenlhet Wav2Vec2 Dataset

This dataset contains preprocessed audio features and tokenized text for training Wav2Vec2 models on the Enenlhet language.

Dataset Summary

  • Train: 3,053 examples
  • Test: 170 examples
  • Validation: 170 examples
  • Total: 3,393 examples

Features

  • input_values: Preprocessed audio features (16kHz, normalized float32 arrays)
  • labels: Tokenized text as integer sequences

Usage

python
from datasets import load_dataset

# Load the dataset
dataset = load_dataset("enenlhet-asr/enenlhet-wav2vec2-dataset")

# Access splits
train_dataset = dataset['train']
test_dataset = dataset['test'] 
validation_dataset = dataset['validation']

Citation

If you use this dataset, please cite:

@dataset{enenlhet_wav2vec2_2025,
  title={Enenlhet Wav2Vec2 Dataset},
  author={Samuel J. Huskey},
  year={2025},
  url={https://huggingface.co/datasets/sjhuskey/enenlhet-wav2vec2-dataset}
}