CoolFace
Datasetpublic

sujalappa/denoised-evaluation-dataset

Denoised Subset Fixed Dataset Description This dataset contains 500 samples organized across multiple splits and 1 subsets. The dataset includes audio data. Dataset Structure Subsets This dataset includes the following subsets: denoised: 500 samples test: 500 samples Usage Load specific subset and split: from datasets import load_dataset # Load specific subset and split dataset =… See the full description on the dataset page: https://huggingface.co/datasets/sujalappa/denoised-evaluation-dataset.

sourceHugging Facemitupdated 1y agoView on Hugging Face
0likes41downloads
Dataset Card

Denoised Subset Fixed

Dataset Description

This dataset contains 500 samples organized across multiple splits and 1 subsets. The dataset includes audio data.

Dataset Structure

Subsets

This dataset includes the following subsets:

  • denoised: 500 samples
  • test: 500 samples

Usage

Load specific subset and split:

python
from datasets import load_dataset

# Load specific subset and split
dataset = load_dataset('sujalappa/denoised-evaluation-dataset', 'denoised', split='train')

# Load all splits from a subset
dataset = load_dataset('sujalappa/denoised-evaluation-dataset', 'denoised')

# Load everything
dataset = load_dataset('sujalappa/denoised-evaluation-dataset')

Dataset Creation

This dataset was created using StreamableDatasetManager on 2025-09-28T14:17:41.346363.

Data Fields

The dataset includes the following columns:

  • md5_text: String data
  • file_name: String data
  • md5_audio: String data
  • duration: Float32 data
  • text: String data
  • audio_language: String data
  • text_language: String data
  • session_id: String data
  • speaker: String data
  • type_concept: String data
  • recording_context: String data
  • medical_entities: String data
  • filename: String data
  • original_path: String data
  • audio: Audio data (16kHz sampling rate)
  • is_denoised: Int64 data

Technical Details

  • Total samples: 500
  • Shard length: 500
  • Number of subsets: 1
  • Number of splits: 2
  • Audio format: 16kHz sampling rate