datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
Medical-Data-Referencescancestry-reference-data
scAncestry Reference Panel
Reference data for scancestry, a tool for inferring genetic ancestry from single-cell genomics data.
Reference genome build: GRCh38 / hg38.
Contents
This dataset bundles imputation, phasing, and population-reference files used by the scAncestry pipeline:
gnomad.genomes.v3.1.2.hgdp_tgp.miss0.01.maf0.01.vcf.gz (+ .tbi) — gnomAD v3.1.2 HGDP+1000G common variants, used for PCA reference… See the full description on the dataset page: https://huggingface.co/datasets/powellgenomicslab/scancestry-reference-data.cassia-reference-data
CASSIA Reference Data
Raw paper supplementary tables and PDFs used to build CASSIA reference-agent
knowledge docs and to score held-out validation papers.
This is the archive of source materials — the processed reference docs
themselves live in the CASSIA Python package
(CASSIA_python/CASSIA/agents/reference_agent/references/).
Layout
Each top-level directory is one benchmark combo (paper pair = dev set + held-out
validation set). Inside each combo:
<combo>/
├──… See the full description on the dataset page: https://huggingface.co/datasets/elliotxie/cassia-reference-data.paymind-reference-data-v2
PayMind Synthetic Payment Dataset — V4
Synthetic payment-routing data for developing, training and benchmarking PayMind.
This dataset provides the V4 synthetic training environment for PayMind, an open-source payment intelligence connector.
It is designed for three predictive responsibilities:
Engine
Objective
Candidate Generator
Learn which payment routes fit a transaction
Reliability Engine
Estimate transaction success probability
Settlement Intelligence… See the full description on the dataset page: https://huggingface.co/datasets/navk8690/paymind-reference-data-v2.brand-structured-data-reference
Brand Structured Data Reference v1.0
This reference maps common public brand facts to structured data concepts that can help people, search engines, and AI systems understand a brand more clearly.
It is intended for independent brands, small businesses, founder-led companies, service providers, local businesses, and early-stage products that need a clearer public identity online.
This is not a ranking guide and it does not guarantee search visibility, rich results, AI… See the full description on the dataset page: https://huggingface.co/datasets/farosio/brand-structured-data-reference.ai-data-governance-reference-cases
ADGL Reference Cases and Governance Profiles
This Dataset repository accompanies the AI Data Governance Layer (ADGL) public research project.
ADGL models Knowledge Governance → Analysis Governance → Consequence Governance, with INFORM, DECIDE, and ACT as principal consequence dispositions and Audit + Provenance spanning the complete governance trajectory.
Configurations
reference_cases: eight structured reference cases with policy, input fixture, and expected… See the full description on the dataset page: https://huggingface.co/datasets/GBSNResearch/ai-data-governance-reference-cases.HUB_reference_dataset
Introduction
This dataset is used for HUB, please consider the cahnges in the pull request. Alternatively use the fork I have crated HUB-forked
Cell_SEQR_Reference_Datasetspaymind-reference-data
PayMind Reference Dataset
Synthetic/reference payment-routing data for PayMind, an open-source payment route intelligence engine.
This dataset is designed to demonstrate PayMind's training, evaluation, and routing workflow across route selection, transaction reliability, and expected settlement time.
Important: This dataset contains synthetic/reference data only. It does not contain real customers, real transactions, payment credentials, personally identifiable information, or… See the full description on the dataset page: https://huggingface.co/datasets/navk8690/paymind-reference-data.pyOpenFOAM-reference-data
pyOpenFOAM Reference Data & Validation Results
OpenFOAM-13 reference simulation data and pyOpenFOAM validation results for pyOpenFOAM — a pure Python/PyTorch reimplementation of OpenFOAM with GPU acceleration and automatic differentiation.
Dataset Summary / 数据摘要
Property
Value
Total reference cases
257
Validated cases
233 (90.7%)
Categories
21
Source
OpenFOAM v11/v13
Reference data size
2.42 GB
pyOpenFOAM results
3.3 MB
Field files analyzed… See the full description on the dataset page: https://huggingface.co/datasets/AlanZee/pyOpenFOAM-reference-data.reference-sft-dataset
Reference SFT Dataset
A curated, deduplicated, domain-labeled reference dataset for supervised fine-tuning (SFT) of language models. It merges instruction-following conversations, raw knowledge text, and specialized domain QA into a single 13-column schema with a fixed domain vocabulary and a per-row veracity score.
Rows: 207,424
Domains: 10 (fixed vocabulary)
Sources: 27 upstream datasets
Format: sharded Parquet (2 shards, train-00000-of-00002.parquet /… See the full description on the dataset page: https://huggingface.co/datasets/Minnimaro/reference-sft-dataset.developer-reference-datasets
Developer Reference Datasets
Open, reproducible lookup tables that web and app developers reach for constantly — computed from first principles, not scraped, so every value is exact and re-runnable. CC BY 4.0.
Quick answers (straight from the data)
What is 16:9 in pixels? 1920×1080, 1280×720, 3840×2160. 9:16 (Stories, Reels, TikTok) is those flipped. → aspect-ratios, resolutions
What contrast ratio does WCAG require? 4.5:1 for normal text (AA), 3:1 for large… See the full description on the dataset page: https://huggingface.co/datasets/cleanorlabs/developer-reference-datasets.Anime_Character_Transfer_and_Reference_Dataset_3600plus
Anime Character Transfer and Reference Dataset — IDs after 003600
This repository is a locally validated, volume-packaged subset of
LAXMAYDAY/Anime_Character_Transfer_and_Reference_Dataset.
Selection: numeric id > 003600
Samples: 6,056
Source ID range: 003611–011228
Samples with targets: 5,535
Reference-only samples: 521
Tar volumes: 4
Every sample remains complete within one volume. Tar member paths preserve the
source repository's train/ref1, train/ref2, train/prompt… See the full description on the dataset page: https://huggingface.co/datasets/LAXMAYDAY/Anime_Character_Transfer_and_Reference_Dataset_3600plus.Anime_Character_Transfer_and_Reference_Dataset
Anime Character Transfer and Reference Dataset
This dataset is designed for anime-style character transfer, reference-based image editing, and multi-reference character consistency experiments.
Each sample contains a source/reference pair and a text prompt. Most samples also include a generated target image and a metadata file. A small number of samples are kept as reference-only entries, so they can still be used for reference-pair tasks or future target completion.… See the full description on the dataset page: https://huggingface.co/datasets/LAXMAYDAY/Anime_Character_Transfer_and_Reference_Dataset.reference-free-rl-summarization-data
Reference-free RL Summarization Experimental Data
This repository contains experimental data splits, metadata, and processed subsets used for a study on verifier-composable penalty-shaped reinforcement learning for reference-free summarization.
Configs
vnexpress: Vietnamese VnExpress train/validation/test split used in the study. Unless explicit redistribution permission is available, this config releases metadata and split information only.
cnn_dailymail_subset:… See the full description on the dataset page: https://huggingface.co/datasets/phuongntc/reference-free-rl-summarization-data.reference_datasetreference-datasetThis dataset was created using LeRobot.
Dataset Structure
meta/info.json:
{
"codebase_version": "v3.0",
"robot_type": "so_follower",
"total_episodes": 3,
"total_frames": 597,
"total_tasks": 1,
"chunks_size": 1000,
"data_files_size_in_mb": 100,
"video_files_size_in_mb": 200,
"fps": 30,
"splits": {
"train": "0:3"
},
"data_path": "data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet",
"video_path":… See the full description on the dataset page: https://huggingface.co/datasets/rhecker/reference-dataset.Horror-Reference-Datafiltering-reference-datapyOpenFOAM-reference-data
pyOpenFOAM Reference Data & Validation Results
OpenFOAM-13 reference simulation data and pyOpenFOAM validation results for pyOpenFOAM — a pure Python/PyTorch reimplementation of OpenFOAM with GPU acceleration and automatic differentiation.
Dataset Summary / 数据摘要
Property
Value
Total reference cases
257
Validated cases
233 (90.7%)
Categories
21
Source
OpenFOAM v11/v13
Reference data size
2.42 GB
pyOpenFOAM results
3.3 MB
Field files analyzed… See the full description on the dataset page: https://huggingface.co/datasets/isunme/pyOpenFOAM-reference-data.bash-reference-manual-general-QAs
Dataset generated from bash reference manual.
book information like date and bash version are available within the very first rows of the dataset
this dataset is pretty small in general, but covering almost all of the definition and technical terms, commands and flags in the book
columns : "Question", "Answer"
mining_domain_knowledge_reference_datasetReference_Extraction_Datamath-judge-reference-datasetreferentiel-geographique-adresses-ban-gpcu-grand-poitiers-donnees-de-reference
Référentiel géographique - Adresses BAN GPCu - Grand Poitiers Données de référence
[!NOTE]
Ce jeu de données Hugging Face est vide. Cette carte sert seulement à référencer le jeu de données Référentiel géographique - Adresses BAN GPCu - Grand Poitiers Données de référence qui est disponible à l'adresse https://www.data.gouv.fr/datasets/612da9f26cbe7e82c5ef6a5a
Description
Positions géographiques des adresses de Grand Poitiers Communauté urbaine étendues sur 40… See the full description on the dataset page: https://huggingface.co/datasets/french-open-data/referentiel-geographique-adresses-ban-gpcu-grand-poitiers-donnees-de-reference.mvadapter_dataset_referencedonnees-changement-climatique-sqr-series-quotidiennes-de-reference
Données changement climatique - SQR (Séries Quotidiennes de Référence)
[!NOTE]
Ce jeu de données Hugging Face est vide. Cette carte sert seulement à référencer le jeu de données Données changement climatique - SQR (Séries Quotidiennes de Référence) qui est disponible à l'adresse https://www.data.gouv.fr/datasets/6569b00fe24fc9e1e482f74e
Description
Présentation
Les Séries Quotidiennes de Référence (SQR) sont une sélection de données climatologiques… See the full description on the dataset page: https://huggingface.co/datasets/french-open-data/donnees-changement-climatique-sqr-series-quotidiennes-de-reference.SPV_MIA_reference_data_tldr_mixtral_8x7bpopulation-de-reference-t-popref-com
Population de référence (t_popref_com)
[!NOTE]
Ce jeu de données Hugging Face est vide. Cette carte sert seulement à référencer le jeu de données Population de référence (t_popref_com) qui est disponible à l'adresse https://www.data.gouv.fr/datasets/6772c40953d3ce8c717bb851
Description
La table t_popref_com est une table de la base de données DataSanté ; elle restitue au niveau communal la population de référence (population municipale, population comptée à part et… See the full description on the dataset page: https://huggingface.co/datasets/french-open-data/population-de-reference-t-popref-com.sacs-a-proces-photos-de-l-affaire-reference-2-b-10795
Sacs à procès - Photos de l'affaire référence 2 B 10795
[!NOTE]
Ce jeu de données Hugging Face est vide. Cette carte sert seulement à référencer le jeu de données Sacs à procès - Photos de l'affaire référence 2 B 10795 qui est disponible à l'adresse https://www.data.gouv.fr/datasets/654c5ad3417f2a304a12b363
Description
Ce jeu de données propose les photos de certaines pièces de l'affaire référencée 2 B 10795 du jeu de données Sacs à procès du Parlement de Toulouse, Lot… See the full description on the dataset page: https://huggingface.co/datasets/french-open-data/sacs-a-proces-photos-de-l-affaire-reference-2-b-10795.
