ehzawad/sinhala-emotion-dataset
Sinhala Emotion Dataset A comprehensive dataset for Sinhala speech emotion recognition containing 2,999 audio samples with corresponding text transcriptions. Dataset Overview This dataset contains emotional speech samples in Sinhala (Sinhalese), the primary language of Sri Lanka. Each sample includes high-quality audio recordings with their corresponding text transcriptions, making it suitable for various speech and emotion recognition tasks. Key… See the full description on the dataset page: https://huggingface.co/datasets/ehzawad/sinhala-emotion-dataset.
Sinhala Emotion Dataset
A comprehensive dataset for Sinhala speech emotion recognition containing 2,999 audio samples with corresponding text transcriptions.
Dataset Overview
This dataset contains emotional speech samples in Sinhala (Sinhalese), the primary language of Sri Lanka. Each sample includes high-quality audio recordings with their corresponding text transcriptions, making it suitable for various speech and emotion recognition tasks.
Key Features
- Language: Sinhala (Sinhalese)
- Total Samples: 2,999 audio recordings
- Audio Format: WAV files, 22,050 Hz sampling rate
- Content: Emotional speech with text transcriptions
- Use Cases: Speech recognition, emotion detection, text-to-speech, language modeling
Dataset Structure
{
'audio': Audio(sampling_rate=22050),
'text': string,
'sampling_rate': int64,
'id': string
}Fields Description
- audio: High-quality audio recording in WAV format
- text: Sinhala text transcription of the spoken content
- sampling_rate: Audio sampling rate (22,050 Hz)
- id: Unique identifier for each sample
Usage
Loading the Dataset
from datasets import load_dataset
# Load the dataset
dataset = load_dataset("ehzawad/sinhala-emotion-dataset")
# Access a sample
sample = dataset['train'][0]
print(f"Text: {sample['text']}")
print(f"Audio shape: {sample['audio']['array'].shape}")
print(f"Sampling rate: {sample['audio']['sampling_rate']}")Audio Processing
import soundfile as sf
import numpy as np
# Get audio data
audio_array = sample['audio']['array']
sampling_rate = sample['audio']['sampling_rate']
# Save audio to file
sf.write('sample_audio.wav', audio_array, sampling_rate)
# Basic audio analysis
duration = len(audio_array) / sampling_rate
print(f"Audio duration: {duration:.2f} seconds")Applications
This dataset is suitable for:
- Speech Recognition: Train ASR models for Sinhala language
- Emotion Recognition: Detect emotional states from speech
- Text-to-Speech: Develop TTS systems for Sinhala
- Language Modeling: Train language models with Sinhala text
- Phonetic Analysis: Study Sinhala phonetics and pronunciation
- Cross-lingual Research: Compare with other South Asian languages
Dataset Statistics
- Total Duration: Approximately 4.5 hours of audio
- Average Sample Length: 5.4 seconds
- Text Length: Varies from short phrases to longer sentences
- Content Domain: Mixed content including religious texts, news, and conversational speech
Language Information
Sinhala (Sinhalese)
- ISO 639-1: si
- ISO 639-2: sin
- Script: Sinhala script (සිංහල)
- Speakers: ~16 million native speakers
- Region: Primarily Sri Lanka
Ethical Considerations
- This dataset is intended for research and educational purposes
- Users should respect copyright and usage rights
- Consider privacy implications when using audio data
- Ensure fair representation and avoid bias in downstream applications
Citation
If you use this dataset in your research, please cite:
@dataset{sinhala_emotion_dataset_2024,
title={Sinhala Emotion Dataset},
author={Emrul Hasan Zawad},
year={2024},
publisher={Hugging Face},
url={https://huggingface.co/datasets/ehzawad/sinhala-emotion-dataset}
}License
Please refer to the dataset license for usage terms and conditions.
Contact
For questions or issues regarding this dataset, please contact:
- Author: Emrul Hasan Zawad
- Repository: ehzawad/sinhala-emotion-dataset
Version History
- v1.0: Initial release with 2,999 Sinhala emotion speech samples
- Converted from vector format to proper audio files for improved usability
- Added comprehensive metadata and documentation
This dataset provides a valuable resource for Sinhala speech and emotion recognition research, contributing to the development of NLP and speech technologies for low-resource languages.
