sujalappa/eka_filtered_data
Eka Medical Asr Sample Noise Eval Dataset Dataset Description This dataset contains 62 samples organized across multiple splits and 31 subsets. The dataset includes audio data. Dataset Structure Subsets This dataset includes the following subsets: original: 2 samples test: 2 samples noisy-bg-snr-10: 2 samples test: 2 samples noisy-bg-snr-20: 2 samples test: 2 samples noisy-bg-snr-30: 2 samples test: 2 samples noisy-bg-snr-40:… See the full description on the dataset page: https://huggingface.co/datasets/sujalappa/eka_filtered_data.
Eka Medical Asr Sample Noise Eval Dataset
Dataset Description
This dataset contains 62 samples organized across multiple splits and 31 subsets. The dataset includes audio data.
Dataset Structure
Subsets
This dataset includes the following subsets:
- original: 2 samples
- test: 2 samples
- noisy-bg-snr-10: 2 samples
- test: 2 samples
- noisy-bg-snr-20: 2 samples
- test: 2 samples
- noisy-bg-snr-30: 2 samples
- test: 2 samples
- noisy-bg-snr-40: 2 samples
- test: 2 samples
- noisy-bg-snr-50: 2 samples
- test: 2 samples
- noisy-short-snr-10: 2 samples
- test: 2 samples
- noisy-short-snr-20: 2 samples
- test: 2 samples
- noisy-short-snr-30: 2 samples
- test: 2 samples
- noisy-short-snr-40: 2 samples
- test: 2 samples
- noisy-short-snr-50: 2 samples
- test: 2 samples
- noisy-gauss-amp-0.001: 2 samples
- test: 2 samples
- noisy-gauss-amp-0.005: 2 samples
- test: 2 samples
- noisy-gauss-amp-0.009: 2 samples
- test: 2 samples
- noisy-gauss-amp-0.013: 2 samples
- test: 2 samples
- noisy-gauss-amp-0.017: 2 samples
- test: 2 samples
- denoised-bg-snr-10: 2 samples
- test: 2 samples
- denoised-bg-snr-20: 2 samples
- test: 2 samples
- denoised-bg-snr-30: 2 samples
- test: 2 samples
- denoised-bg-snr-40: 2 samples
- test: 2 samples
- denoised-bg-snr-50: 2 samples
- test: 2 samples
- denoised-short-snr-10: 2 samples
- test: 2 samples
- denoised-short-snr-20: 2 samples
- test: 2 samples
- denoised-short-snr-30: 2 samples
- test: 2 samples
- denoised-short-snr-40: 2 samples
- test: 2 samples
- denoised-short-snr-50: 2 samples
- test: 2 samples
- denoised-gauss-amp-0.001: 2 samples
- test: 2 samples
- denoised-gauss-amp-0.005: 2 samples
- test: 2 samples
- denoised-gauss-amp-0.009: 2 samples
- test: 2 samples
- denoised-gauss-amp-0.013: 2 samples
- test: 2 samples
- denoised-gauss-amp-0.017: 2 samples
- test: 2 samples
Usage
Load specific subset and split:
from datasets import load_dataset
# Load specific subset and split
dataset = load_dataset('sujalappa/eka_filtered_data', 'original', split='train')
# Load all splits from a subset
dataset = load_dataset('sujalappa/eka_filtered_data', 'original')
# Load everything
dataset = load_dataset('sujalappa/eka_filtered_data')Dataset Creation
This dataset was created using StreamableDatasetManager on 2025-09-15T12:28:27.657141.
Data Fields
The dataset includes the following columns:
- md5_text: String data
- file_name: String data
- md5_audio: String data
- duration: Float32 data
- text: String data
- audio_language: String data
- text_language: String data
- session_id: String data
- speaker: String data
- type_concept: String data
- recording_context: String data
- medical_entities: String data
- audio: Audio data (16kHz sampling rate)
Technical Details
- Total samples: 62
- Shard length: 5
- Number of subsets: 31
- Number of splits: 2
- Audio format: 16kHz sampling rate
