sjhuskey/enenlhet-wav2vec2-dataset
Enenlhet Wav2Vec2 Dataset This dataset contains preprocessed audio features and tokenized text for training Wav2Vec2 models on the Enenlhet language. Dataset Summary Train: 3,053 examples Test: 170 examples Validation: 170 examples Total: 3,393 examples Features input_values: Preprocessed audio features (16kHz, normalized float32 arrays) labels: Tokenized text as integer sequences Usage from datasets import load_dataset # Load… See the full description on the dataset page: https://huggingface.co/datasets/sjhuskey/enenlhet-wav2vec2-dataset.
Enenlhet Wav2Vec2 Dataset
This dataset contains preprocessed audio features and tokenized text for training Wav2Vec2 models on the Enenlhet language.
Dataset Summary
- Train: 3,053 examples
- Test: 170 examples
- Validation: 170 examples
- Total: 3,393 examples
Features
input_values: Preprocessed audio features (16kHz, normalized float32 arrays)labels: Tokenized text as integer sequences
Usage
from datasets import load_dataset
# Load the dataset
dataset = load_dataset("enenlhet-asr/enenlhet-wav2vec2-dataset")
# Access splits
train_dataset = dataset['train']
test_dataset = dataset['test']
validation_dataset = dataset['validation']Citation
If you use this dataset, please cite:
@dataset{enenlhet_wav2vec2_2025,
title={Enenlhet Wav2Vec2 Dataset},
author={Samuel J. Huskey},
year={2025},
url={https://huggingface.co/datasets/sjhuskey/enenlhet-wav2vec2-dataset}
}