vnahata/OmnilingualASR-retrieval
Omnilingual ASR speech-text retrieval (MTEB) Read speech paired with its human transcription, for languages that no existing MTEB audio task covers. Source: facebook/omnilingual-asr-corpus at revision 8648ba8, cc-by-4.0, official test split. Recordings are re-encoded from FLAC to Opus at 16 kHz. Repeated transcripts are dropped, since one would otherwise be relevant to several recordings while only one is marked correct. Built by… See the full description on the dataset page: https://huggingface.co/datasets/vnahata/OmnilingualASR-retrieval.
01.2k
aal.parquetdownload
abn.parquetdownload
abr.parquetdownload
abs.parquetdownload
aec.parquetdownload
afo.parquetdownload
ahl.parquetdownload
ahs.parquetdownload
ala.parquetdownload
alo.parquetdownload
amu.parquetdownload
anc.parquetdownload
ank.parquetdownload
anp.parquetdownload
anw.parquetdownload
aom.parquetdownload
apd.parquetdownload
ary.parquetdownload
awo.parquetdownload
ayl.parquetdownload
ayp.parquetdownload
bbu.parquetdownload
bcs.parquetdownload
bcy.parquetdownload
bda.parquetdownload
bde.parquetdownload
bdm.parquetdownload
bho.parquetdownload
bjj.parquetdownload
bra.parquetdownload
brx.parquetdownload
dcc.parquetdownload
dty.parquetdownload
gbm.parquetdownload
gjk.parquetdownload
gom.parquetdownload
kas.parquetdownload
knn.parquetdownload
kxp.parquetdownload
mrr.parquetdownload
mtr.parquetdownload
odk.parquetdownload
phr.parquetdownload
pnb.parquetdownload
sin.parquetdownload
tcy.parquetdownload
the.parquetdownload
thq.parquetdownload
tkt.parquetdownload
uki.parquetdownload
