syvai/danish-asr-unified
Danish ASR Unified Dataset Unified Danish speech recognition dataset combining 7 sources (~3.5M samples, ~16k hours): Source Samples Description VoxPopuli 1,775,578 European Parliament recordings ftspeech 995,677 Danish Parliament (Folketinget) CoRal-v3 read_aloud 299,255 Read-aloud Danish speech nst-da 182,605 NST Danish speech CoRal-v3 conversation 147,249 Conversational Danish speech nota 98,600 Danish broadcast media Common Voice 17 3,484 Crowd-sourced… See the full description on the dataset page: https://huggingface.co/datasets/syvai/danish-asr-unified.
Add FLEURS da_dk train+validation as train-00691 (source=fleurs); test split held out for eval
Restore original train-00683.parquet (accidentally overwritten by FLEURS add)
Add FLEURS da_dk train+validation (source=fleurs); test split held out for eval
Add final shard 691
Add shard 690
Add shard 689
Add shard 688
Add shard 687
Add shard 686
Add shard 685
Add shard 684
Add shard 683
Add shard 682
Add shard 681
Add shard 680
Add shard 679
Add shard 678
Add shard 677
Add shard 676
Add shard 675
Add shard 674
Add shard 673
Add shard 672
Add shard 671
Add shard 670
Add shard 669
Add shard 668
Add shard 667
Add shard 666
Add shard 665
Add shard 664
Add shard 663
Add shard 662
Add shard 661
Add shard 660
Add shard 659
Add shard 658
Add shard 657
Add shard 656
Add shard 655
Add shard 654
Add shard 653
Add shard 652
Add shard 651
Add shard 650
Add shard 649
Add shard 648
Add shard 647
Add shard 646
Add shard 645
