CoolFace
Datasetpublic

sujalappa/eka_filtered_data

Eka Medical Asr Sample Noise Eval Dataset Dataset Description This dataset contains 62 samples organized across multiple splits and 31 subsets. The dataset includes audio data. Dataset Structure Subsets This dataset includes the following subsets: original: 2 samples test: 2 samples noisy-bg-snr-10: 2 samples test: 2 samples noisy-bg-snr-20: 2 samples test: 2 samples noisy-bg-snr-30: 2 samples test: 2 samples noisy-bg-snr-40:… See the full description on the dataset page: https://huggingface.co/datasets/sujalappa/eka_filtered_data.

sourceHugging Facemitupdated 1y agoView on Hugging Face
0likes20downloads
Dataset Card

Eka Medical Asr Sample Noise Eval Dataset

Dataset Description

This dataset contains 62 samples organized across multiple splits and 31 subsets. The dataset includes audio data.

Dataset Structure

Subsets

This dataset includes the following subsets:

  • original: 2 samples
  • test: 2 samples
  • noisy-bg-snr-10: 2 samples
  • test: 2 samples
  • noisy-bg-snr-20: 2 samples
  • test: 2 samples
  • noisy-bg-snr-30: 2 samples
  • test: 2 samples
  • noisy-bg-snr-40: 2 samples
  • test: 2 samples
  • noisy-bg-snr-50: 2 samples
  • test: 2 samples
  • noisy-short-snr-10: 2 samples
  • test: 2 samples
  • noisy-short-snr-20: 2 samples
  • test: 2 samples
  • noisy-short-snr-30: 2 samples
  • test: 2 samples
  • noisy-short-snr-40: 2 samples
  • test: 2 samples
  • noisy-short-snr-50: 2 samples
  • test: 2 samples
  • noisy-gauss-amp-0.001: 2 samples
  • test: 2 samples
  • noisy-gauss-amp-0.005: 2 samples
  • test: 2 samples
  • noisy-gauss-amp-0.009: 2 samples
  • test: 2 samples
  • noisy-gauss-amp-0.013: 2 samples
  • test: 2 samples
  • noisy-gauss-amp-0.017: 2 samples
  • test: 2 samples
  • denoised-bg-snr-10: 2 samples
  • test: 2 samples
  • denoised-bg-snr-20: 2 samples
  • test: 2 samples
  • denoised-bg-snr-30: 2 samples
  • test: 2 samples
  • denoised-bg-snr-40: 2 samples
  • test: 2 samples
  • denoised-bg-snr-50: 2 samples
  • test: 2 samples
  • denoised-short-snr-10: 2 samples
  • test: 2 samples
  • denoised-short-snr-20: 2 samples
  • test: 2 samples
  • denoised-short-snr-30: 2 samples
  • test: 2 samples
  • denoised-short-snr-40: 2 samples
  • test: 2 samples
  • denoised-short-snr-50: 2 samples
  • test: 2 samples
  • denoised-gauss-amp-0.001: 2 samples
  • test: 2 samples
  • denoised-gauss-amp-0.005: 2 samples
  • test: 2 samples
  • denoised-gauss-amp-0.009: 2 samples
  • test: 2 samples
  • denoised-gauss-amp-0.013: 2 samples
  • test: 2 samples
  • denoised-gauss-amp-0.017: 2 samples
  • test: 2 samples

Usage

Load specific subset and split:

python
from datasets import load_dataset

# Load specific subset and split
dataset = load_dataset('sujalappa/eka_filtered_data', 'original', split='train')

# Load all splits from a subset
dataset = load_dataset('sujalappa/eka_filtered_data', 'original')

# Load everything
dataset = load_dataset('sujalappa/eka_filtered_data')

Dataset Creation

This dataset was created using StreamableDatasetManager on 2025-09-15T12:28:27.657141.

Data Fields

The dataset includes the following columns:

  • md5_text: String data
  • file_name: String data
  • md5_audio: String data
  • duration: Float32 data
  • text: String data
  • audio_language: String data
  • text_language: String data
  • session_id: String data
  • speaker: String data
  • type_concept: String data
  • recording_context: String data
  • medical_entities: String data
  • audio: Audio data (16kHz sampling rate)

Technical Details

  • Total samples: 62
  • Shard length: 5
  • Number of subsets: 31
  • Number of splits: 2
  • Audio format: 16kHz sampling rate