WhissleAI/indicvoices_pa_tagged_transcripts
Dataset Card for indicvoices_pa_tagged_transcripts Dataset Description This dataset contains audio files and their corresponding transcriptions in Hindi for automatic speech recognition (ASR) tasks. Languages The dataset is primarily in Hindi. Data Collection The dataset was collected through automated processes and manual transcription. Dataset Structure The dataset contains: Audio files (.wav format) Transcriptions… See the full description on the dataset page: https://huggingface.co/datasets/WhissleAI/indicvoices_pa_tagged_transcripts.
Dataset Card for indicvoicespatagged_transcripts
Dataset Description
This dataset contains audio files and their corresponding transcriptions in Hindi for automatic speech recognition (ASR) tasks.
Languages
The dataset is primarily in Hindi.
Data Collection
The dataset was collected through automated processes and manual transcription.
Dataset Structure
The dataset contains:
- Audio files (.wav format)
- Transcriptions
- Duration information
- Additional task annotations
Data Fields
audio: Path to the audio filetext: Transcription of the audioduration: Length of the audio in secondstasks: List of associated tasks
Additional Information
- License: CC-BY 4.0
- Version: 1.0.0
- Publisher: WhissleAI
