bal
Gemma4-12B-QAT-Uncensored-HauhauCS-BalancedGemma4-26B-A4B-QAT-Uncensored-HauhauCS-Balanced-MTPtinybert-emotion-balancedGemma4-31B-QAT-Uncensored-HauhauCS-Balanced-MTPGemma4-26B-A4B-Uncensored-HauhauCS-Balancedrubert-tiny-sentiment-balancedQwen3.6-27B-Uncensored-HauhauCS-BalancedBC5CDR-Chemical-Disease-balanced-BiomedNLP-PubMedBERT-base-uncased-abstract-fulltext
Datasets
All datasets matching “bal”dcvlm-balanced-200b
DCVLM-Balanced (200B tokens)
DCVLM-Balanced is the balanced-mixture training set from our DataComp-VLM paper.
It is a pre-mixed, decontaminated, ready-to-train multimodal pretraining dataset, materialized as flat
WebDataset tar shards so it can be consumed by any training
stack.
This is a 200B-token release consisting of 112,358,849 samples, curated from our DCVLM-large data pool.
The instruction-heavy counterpart (DCVLM-baseline) is available as
dcvlm-baseline-200b, along with… See the full description on the dataset page: https://huggingface.co/datasets/mlfoundations/dcvlm-balanced-200b.Llama3.1-8B-BaldEagle3-Ultrachatrsna-pneumonia-datasetbalanced-copa
Dataset Card for "Balanced COPA"
Dataset Summary
Bala-COPA: An English language Dataset for Training Robust Commonsense Causal Reasoning Models
The Balanced Choice of Plausible Alternatives dataset is a benchmark for training machine learning models that are robust to superficial cues/spurious correlations. The dataset extends the COPA dataset(Roemmele et al. 2011) with mirrored instances that mitigate against token-level superficial cues in the original COPA answers. The… See the full description on the dataset page: https://huggingface.co/datasets/pkavumba/balanced-copa.Llama3.1-8B-BaldEagle3-ShareGPTcrop-disease-balanced-5022
