leduckhai/VietMed
VietMed: A Dataset and Benchmark for Automatic Speech Recognition of Vietnamese in the Medical Domain (LREC-COLING 2024, Oral) Description: We introduced a Vietnamese speech recognition dataset in the medical domain comprising 16h of labeled medical speech, 1000h of unlabeled medical speech and 1200h of unlabeled general-domain speech. To our best knowledge, VietMed is by far the world’s largest public medical speech recognition dataset in 7 aspects: total… See the full description on the dataset page: https://huggingface.co/datasets/leduckhai/VietMed.
Upload dataset (#11)
Upload dataset (#10)
Upload dataset (#9)
Upload dataset (#6)
Update README.md
Update README.md
Update README.md
Update README.md
Update README.md
Upload 3 files
Update README.md
Delete unlabeled_general_data
Upload 2 files
Delete train-00000-of-00001.parquet
Delete test-00000-of-00001.parquet
Update README.md
Upload 2 files
Update README.md
Delete unlabeled_medical_data
Upload VietMed_unlabeled_1000h_segmented_8kHz_000_050.zip
Delete unlabeled_medical_data/VietMed_unlabeled_1000h_segmented_8kH.zip
Upload dummy.txt
Upload 2 files
Upload VietMed_unlabeled_1000h_segmented_8kH.zip
Update README.md
Update README.md
Upload 2 files
Update README.md
Update README.md
Update README.md
Upload dev_audio.zip
Upload 2 files
Update README.md
Update README.md
Upload 4 files
Delete cv.txt
Delete train.txt
Delete cv
Delete train
Upload 546 files
Upload 370 files
Upload 501 files
Upload 86 files
Delete test.txt
Delete data/test
Update README.md
Upload 85 files
Rename dev.txt to test.txt
Delete cv.ogg
Rename cv.ogg.txt to dev.txt
