google/svq
Merge jsonl-files into per-locale and per-environment parquet files (#7)
Add salient terms (#6)
Add missing jsonl files (#5)
Add utt_index.jsonl for parquet formatted data.
Rewrite parquet files with row_group_size=100
Update README (#4)
Correct en_us_clean filename.
Add a clean en_us audio subset.
Remove array record versions of data.
Add parquet versions of all task data.
Fix dtype of passage_id
Add parquet version of document_retrieval_cross_lang.
Switch to parquet but with explicit features in README.md
Revert "Directly use parquet instead of arrow."
Revert "Point to parquet instead of arrow."
Point to parquet instead of arrow.
Directly use parquet instead of arrow.
Revert jsonl files from README as somehow its not choosing the correct
Add the jsonl files as dataset configs for the different tasks.
Remove unintended file.
Use arrow files for audio data, define splits in yaml.
Update README formatting.
Update README splits information.
Update README
Update README.
Add dataset card metadata.
Look for array_record in different places.
Add dataset script.
Include utterance text in utt_index.jsonl
Add wav array record files.
Add jsonl task files.
initial commit
