datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
processed-falcon-dutch-datasetprocessed_gpt_dataset_big
Dataset Card for "processed_gpt_dataset_big"
More Information needed
processed_gpt_dataset_medium
Dataset Card for "processed_gpt_dataset_medium"
More Information needed
processed_gpt_dataset_max
Dataset Card for "processed_gpt_dataset_max"
More Information needed
VIVOS_CommonVoice_FOSD_Control_processed_dataset
Dataset Card for "VIVOS_CommonVoice_FOSD_Control_processed_dataset"
More Information needed
processed_pythia_dataset_2048
Dataset Card for "processed_pythia_dataset_2048"
More Information needed
finqa-data-processed
FinQA Dataset (Processed)
Dataset Description
Dataset Summary
The FinQA dataset is designed for numerical reasoning over financial data, containing questions that require complex reasoning over tables and text from financial reports.
Dataset Statistics
Total examples: 8281
Training set size: 6624 examples
Test set size: 1657 examples
Dataset Structure
Each example contains:
Required columns:
query: The question to be answered (derived… See the full description on the dataset page: https://huggingface.co/datasets/wandb/finqa-data-processed.deepstock-stock-historical-prices-dataset-processedprocessed_tsb_bert_datasetprocessed_bert_dataset
Dataset Card for "processed_bert_dataset"
More Information needed
processed_llama_dataset_2048processed_bert_dataset
Dataset Card for "processed_bert_dataset"
More Information needed
processed_bert_dataset
Dataset Card for "processed_bert_dataset"
More Information needed
refine-book-wiki_processed_llama_dataset_2048DocVQA_Processed_Datasetprocessed_bert_dataset
Dataset Card for "processed_bert_dataset"
More Information needed
processed_dataset_whisper_finetuningRoboTwin-adjust_bottle-official-demo_clean50-Pi0_processed-datawiki_book_corpus_complete_processed_bert_dataset
Dataset Card for "wiki_book_corpus_complete_processed_bert_dataset"
More Information needed
processed_bert_datasetdatacookers-processed
Preprocessed Data for the ADA Project 2025
By DataCookers
General Datasets
channels_clean.parquet: A cleaned version of the df_channels_en split from the Youniverse Dataset. This dataset corrects parsing errors where missing values in the Category column caused subsequent columns to shift one position to the left.
grammy_raw.parquet: The foundational dataset containing Grammy winners and nominees (1965–2024), sourced from Kaggle.
grammy_metadata.parquet: A… See the full description on the dataset page: https://huggingface.co/datasets/matcav/datacookers-processed.processed_sroie_donut_dataset
Dataset Card for "processed_sroie_donut_dataset"
More Information needed
processed_sroie_donut_dataset_train_test_split
Dataset Card for "processed_sroie_donut_dataset_train_test_split"
More Information needed
processed_gpt_dataset_small
Dataset Card for "processed_gpt_dataset_small"
More Information needed
nasdaq-external-data-processeddeepstock-stock-historical-prices-dataset-processed-with-previous-day-titlesasr-wolof-dataset-processedasr-wolof-dataset-processed-v2processed_bert_dataset
Dataset Card for "processed_bert_dataset"
More Information needed
processed_bert_dataset
