datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
bell_ring_put_tape_in_bin_evalThis dataset was created using LeRobot.
Dataset Structure
meta/info.json:
{
"codebase_version": "v3.0",
"robot_type": "so101_follower",
"total_episodes": 10,
"total_frames": 6817,
"total_tasks": 1,
"chunks_size": 1000,
"data_files_size_in_mb": 100,
"video_files_size_in_mb": 500,
"audio_files_size_in_mb": 100,
"fps": 30,
"splits": {
"train": "0:10"
},
"data_path": "data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet"… See the full description on the dataset page: https://huggingface.co/datasets/AdamMalyshev/bell_ring_put_tape_in_bin_eval.adam-degenerate-reprobell_ring_put_tape_in_binThis dataset was created using LeRobot.
Dataset Structure
meta/info.json:
{
"codebase_version": "v3.0",
"robot_type": "so101_follower",
"total_episodes": 50,
"total_frames": 30598,
"total_tasks": 1,
"chunks_size": 1000,
"data_files_size_in_mb": 100,
"video_files_size_in_mb": 500,
"audio_files_size_in_mb": 100,
"fps": 30,
"splits": {
"train": "0:50"
},
"data_path": "data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet"… See the full description on the dataset page: https://huggingface.co/datasets/AdamMalyshev/bell_ring_put_tape_in_bin.eval_bell_ring_put_tape_in_bin_testThis dataset was created using LeRobot.
Dataset Structure
meta/info.json:
{
"codebase_version": "v3.0",
"robot_type": "so101_follower",
"total_episodes": 19,
"total_frames": 10006,
"total_tasks": 1,
"chunks_size": 1000,
"data_files_size_in_mb": 100,
"video_files_size_in_mb": 500,
"audio_files_size_in_mb": 100,
"fps": 30,
"splits": {
"train": "0:19"
},
"data_path": "data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet"… See the full description on the dataset page: https://huggingface.co/datasets/AdamMalyshev/eval_bell_ring_put_tape_in_bin_test.audio-record-testThis dataset was created using LeRobot.
Dataset Structure
meta/info.json:
{
"codebase_version": "v3.0",
"robot_type": "so101_follower",
"total_episodes": 10,
"total_frames": 2592,
"total_tasks": 1,
"chunks_size": 1000,
"data_files_size_in_mb": 100,
"video_files_size_in_mb": 500,
"audio_files_size_in_mb": 100,
"fps": 30,
"splits": {
"train": "0:10"
},
"data_path": "data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet"… See the full description on the dataset page: https://huggingface.co/datasets/AdamMalyshev/audio-record-test.g1eval_bell_ring_put_tape_in_bin_random_init_testThis dataset was created using LeRobot.
Dataset Structure
meta/info.json:
{
"codebase_version": "v3.0",
"robot_type": "so101_follower",
"total_episodes": 12,
"total_frames": 6383,
"total_tasks": 1,
"chunks_size": 1000,
"data_files_size_in_mb": 100,
"video_files_size_in_mb": 500,
"audio_files_size_in_mb": 100,
"fps": 30,
"splits": {
"train": "0:12"
},
"data_path": "data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet"… See the full description on the dataset page: https://huggingface.co/datasets/AdamMalyshev/eval_bell_ring_put_tape_in_bin_random_init_test.pick_and_place_cup_bell_dropThis dataset was created using LeRobot.
Dataset Structure
meta/info.json:
{
"codebase_version": "v3.0",
"robot_type": "so101_follower",
"total_episodes": 27,
"total_frames": 11196,
"total_tasks": 1,
"chunks_size": 1000,
"data_files_size_in_mb": 100,
"video_files_size_in_mb": 500,
"audio_files_size_in_mb": 100,
"fps": 30,
"splits": {
"train": "0:27"
},
"data_path": "data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet"… See the full description on the dataset page: https://huggingface.co/datasets/AdamMalyshev/pick_and_place_cup_bell_drop.us-adam-yt-v1girlAdam_Tunisian_dataset_STT-TTSadamknihi-be-viacaslau_adamcyk_urok_aryfmietyki_output_original
AudioSet Pipeline Output — арыгінальнае аўдыё
Мова / Language: Беларуская (Belarusian)
Арыгінальнае аўдыё без апрацоўкі, захаванае ў зыходнай якасці.
Частка калекцыі Ministerskija —
корпус беларускіх аўдыёкніг.
Апрацаваная версія (сегменты ~15 с, выраўнаваная транскрыпцыя):
knihi-be-viacaslau_adamcyk_urok_aryfmietyki_output
Структура
Кожны радок змяшчае:
audio — арыгінальны аўдыёзапіс
text — транскрыпцыя
chunk_uid — унікальны ідэнтыфікатар
Ліцэнзія /… See the full description on the dataset page: https://huggingface.co/datasets/fosters/knihi-be-viacaslau_adamcyk_urok_aryfmietyki_output_original.viachaslau-adamchyk-urok-aryfmetyki-input
Урок арыфметыкі
This is a Hugging Face Parquet input dataset for an audio pipeline.
Source dataset: archivartaunik/viachaslau-adamchyk-urok-aryfmetyki
Format
config: default
split: train
format: parquet
id column: id
audio column: audio
rows: 1
shards: 1
language: be
The audio column is embedded into Parquet as Hugging Face Audio:
audio = {
"path": "file.mp3",
"bytes": b"..."
}
Columns
id
audio
title
language
file_name
filename
Author… See the full description on the dataset page: https://huggingface.co/datasets/archivartaunik/viachaslau-adamchyk-urok-aryfmetyki-input.test-earnings22knihi-be-viacaslau_adamcyk_urok_aryfmietyki_all
AudioSet Pipeline Output
Мова / Language: Беларуская (Belarusian)
Аўдыё нарэзана з арыгінальнага запісу ў зыходнай частаце дыскрэтызацыі (native), мона, фрагменты да 30 секунд.
Частка калекцыі Belarusian Audiobooks (native).
Радкоў у датасеце
196
Працягласць
38 хв
Частата дыскрэтызацыі
44100 Hz
Каналы
мона
Даўжыня фрагмента
да 30 с
Структура
Кожны радок змяшчае:
audio — аўдыёфрагмент (native SR, мона, ≤30 с)
text — транскрыпцыя (Gemini +… See the full description on the dataset page: https://huggingface.co/datasets/fosters/knihi-be-viacaslau_adamcyk_urok_aryfmietyki_all.AdamSandlerAlexandreMorenoviachaslau-adamchyk-matsi
Маці
Metadata
Author: Вячаслаў Адамчык
Title: Маці
Narrator:
Source Group: Дзіцячыя
Source:
Notes
The original audio files are preserved as-is:
no conversion;
no re-encoding;
no filename changes inside each split folder, except removing one common top-level archive folder when present.
To avoid Hugging Face Dataset Viewer scan-size errors, the dataset is split into smaller folders.
Target maximum split size: about 250 MB.
Each split folder… See the full description on the dataset page: https://huggingface.co/datasets/archivartaunik/viachaslau-adamchyk-matsi.Fula-adamawaviachaslau-adamchyk-sonechny-zaichyk
Сонечны зайчык
Metadata
Author: Вячаслаў Адамчык
Title: Сонечны зайчык
Narrator:
Source Group: Дзіцячыя
Source:
Notes
The original audio files are preserved as-is:
no conversion;
no re-encoding;
no filename changes inside each split folder, except removing one common top-level archive folder when present.
To avoid Hugging Face Dataset Viewer scan-size errors, the dataset is split into smaller folders.
Target maximum split size: about 250 MB.… See the full description on the dataset page: https://huggingface.co/datasets/archivartaunik/viachaslau-adamchyk-sonechny-zaichyk.AdamSandlerPortuguesFula-adamawanatalka-kharytaniuk-kazki-staroga-adamkova-krystsina-drobysh
Казкі Старога Адамкова
Metadata
Author: Наталка Харытанюк
Title: Казкі Старога Адамкова
Narrator: Крысціна Дробыш
Source Group: Дзіцячыя
Source: https://knizhnyvoz.by/
Notes
The original audio files are preserved as-is:
no conversion;
no re-encoding;
no filename changes inside each split folder, except removing one common top-level archive folder when present.
To avoid Hugging Face Dataset Viewer scan-size errors, the dataset is split into… See the full description on the dataset page: https://huggingface.co/datasets/archivartaunik/natalka-kharytaniuk-kazki-staroga-adamkova-krystsina-drobysh.knihi-be-viacaslau_adamcyk_urok_aryfmietykiadam-mitskevich-grazhyna
Гражына
Metadata
Author: Адам Міцкевіч
Title: Гражына
Narrator:
Source Group: Аўдыёкнігі
Source:
Notes
The original audio files are preserved as-is:
no conversion;
no re-encoding;
no filename changes inside each split folder, except removing one common top-level archive folder when present.
To avoid Hugging Face Dataset Viewer scan-size errors, the dataset is split into smaller folders.
Target maximum split size: about 250 MB.
Each split folder… See the full description on the dataset page: https://huggingface.co/datasets/archivartaunik/adam-mitskevich-grazhyna.adamv2-voice-datasettaller_ttsandrei-adamovich-vershy
Вершы
Metadata
Author: Андрэй Адамовіч
Title: Вершы
Narrator:
Source Group: Аўдыёкнігі
Source: Беларускі ПЭН-цэнтр
Notes
The original audio files are preserved as-is:
no conversion;
no re-encoding;
no filename changes inside each split folder, except removing one common top-level archive folder when present.
To avoid Hugging Face Dataset Viewer scan-size errors, the dataset is split into smaller folders.
Target maximum split size: about 250 MB.… See the full description on the dataset page: https://huggingface.co/datasets/archivartaunik/andrei-adamovich-vershy.viachaslau-adamchyk-urok-aryfmetyki
Урок арыфметыкі
Metadata
Author: Вячаслаў Адамчык
Title: Урок арыфметыкі
Narrator:
Source Group: Аўдыёкнігі
Source:
Notes
The original audio files are preserved as-is:
no conversion;
no re-encoding;
no filename changes inside each split folder, except removing one common top-level archive folder when present.
To avoid Hugging Face Dataset Viewer scan-size errors, the dataset is split into smaller folders.
Target maximum split size: about 250… See the full description on the dataset page: https://huggingface.co/datasets/archivartaunik/viachaslau-adamchyk-urok-aryfmetyki.adam-glebus-siamia-zmitser-bartosik
Сям’я
Metadata
Author: Адам Глёбус
Title: Сям’я
Narrator: Зьміцер Бартосік
Source Group: Аўдыёкнігі
Source: Беларускі ПЭН-цэнтр
Notes
The original audio files are preserved as-is:
no conversion;
no re-encoding;
no filename changes inside each split folder, except removing one common top-level archive folder when present.
To avoid Hugging Face Dataset Viewer scan-size errors, the dataset is split into smaller folders.
Target maximum split size:… See the full description on the dataset page: https://huggingface.co/datasets/archivartaunik/adam-glebus-siamia-zmitser-bartosik.
