spica
Datasets
All datasets matching “spica”spicacommon_voice_16_1_de_pseudo_labelledcommon_voice_16_1_de_pseudo_labelled_mediumSpica
Spica Dataset
Overview
This dataset contains image captioning data split into training, validation, and test sets. All samples in the split datasets (train, val, test) are contained in the spica_all_data.csv file.
Data Format
This dataset is provided as a single archive file:
spica.zip (13GB)
Contains approximately 75K files
Dataset Statistics
File
Samples
Unique Images
spica_all_data.csv
333,397
75,535
spica_train.csv
309,386
69,280… See the full description on the dataset page: https://huggingface.co/datasets/hiranohachiman/Spica.
