CoolFace
Datasetpublic

ehzawad/sinhala-emotion-dataset

Sinhala Emotion Dataset A comprehensive dataset for Sinhala speech emotion recognition containing 2,999 audio samples with corresponding text transcriptions. Dataset Overview This dataset contains emotional speech samples in Sinhala (Sinhalese), the primary language of Sri Lanka. Each sample includes high-quality audio recordings with their corresponding text transcriptions, making it suitable for various speech and emotion recognition tasks. Key… See the full description on the dataset page: https://huggingface.co/datasets/ehzawad/sinhala-emotion-dataset.

sourceHugging Faceupdated 1y agoView on Hugging Face
0likes11downloads
Dataset Card

Sinhala Emotion Dataset

A comprehensive dataset for Sinhala speech emotion recognition containing 2,999 audio samples with corresponding text transcriptions.

Dataset Overview

This dataset contains emotional speech samples in Sinhala (Sinhalese), the primary language of Sri Lanka. Each sample includes high-quality audio recordings with their corresponding text transcriptions, making it suitable for various speech and emotion recognition tasks.

Key Features

  • —Language: Sinhala (Sinhalese)
  • —Total Samples: 2,999 audio recordings
  • —Audio Format: WAV files, 22,050 Hz sampling rate
  • —Content: Emotional speech with text transcriptions
  • —Use Cases: Speech recognition, emotion detection, text-to-speech, language modeling

Dataset Structure

{
    'audio': Audio(sampling_rate=22050),
    'text': string,
    'sampling_rate': int64,
    'id': string
}

Fields Description

  • —audio: High-quality audio recording in WAV format
  • —text: Sinhala text transcription of the spoken content
  • —sampling_rate: Audio sampling rate (22,050 Hz)
  • —id: Unique identifier for each sample

Usage

Loading the Dataset

python
from datasets import load_dataset

# Load the dataset
dataset = load_dataset("ehzawad/sinhala-emotion-dataset")

# Access a sample
sample = dataset['train'][0]
print(f"Text: {sample['text']}")
print(f"Audio shape: {sample['audio']['array'].shape}")
print(f"Sampling rate: {sample['audio']['sampling_rate']}")

Audio Processing

python
import soundfile as sf
import numpy as np

# Get audio data
audio_array = sample['audio']['array']
sampling_rate = sample['audio']['sampling_rate']

# Save audio to file
sf.write('sample_audio.wav', audio_array, sampling_rate)

# Basic audio analysis
duration = len(audio_array) / sampling_rate
print(f"Audio duration: {duration:.2f} seconds")

Applications

This dataset is suitable for:

  1. 1.Speech Recognition: Train ASR models for Sinhala language
  2. 2.Emotion Recognition: Detect emotional states from speech
  3. 3.Text-to-Speech: Develop TTS systems for Sinhala
  4. 4.Language Modeling: Train language models with Sinhala text
  5. 5.Phonetic Analysis: Study Sinhala phonetics and pronunciation
  6. 6.Cross-lingual Research: Compare with other South Asian languages

Dataset Statistics

  • —Total Duration: Approximately 4.5 hours of audio
  • —Average Sample Length: 5.4 seconds
  • —Text Length: Varies from short phrases to longer sentences
  • —Content Domain: Mixed content including religious texts, news, and conversational speech

Language Information

Sinhala (Sinhalese)

  • —ISO 639-1: si
  • —ISO 639-2: sin
  • —Script: Sinhala script (සිංහල)
  • —Speakers: ~16 million native speakers
  • —Region: Primarily Sri Lanka

Ethical Considerations

  • —This dataset is intended for research and educational purposes
  • —Users should respect copyright and usage rights
  • —Consider privacy implications when using audio data
  • —Ensure fair representation and avoid bias in downstream applications

Citation

If you use this dataset in your research, please cite:

bibtex
@dataset{sinhala_emotion_dataset_2024,
  title={Sinhala Emotion Dataset},
  author={Emrul Hasan Zawad},
  year={2024},
  publisher={Hugging Face},
  url={https://huggingface.co/datasets/ehzawad/sinhala-emotion-dataset}
}

License

Please refer to the dataset license for usage terms and conditions.

Contact

For questions or issues regarding this dataset, please contact:

Version History

  • —v1.0: Initial release with 2,999 Sinhala emotion speech samples
  • —Converted from vector format to proper audio files for improved usability
  • —Added comprehensive metadata and documentation

This dataset provides a valuable resource for Sinhala speech and emotion recognition research, contributing to the development of NLP and speech technologies for low-resource languages.