datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
counterfactual_culture
Counterfactual Culture
Multilingual minimal-change counterfactual etiquette vignettes for five cultures,
with conforming / violating pairs for factorization and representation studies.
Cultures
english (US norms), japan, china, india, russia
Languages
en, ja, zh, hi, ru (full cross: every culture × every language)
Samples
152,500 (76,250 pairs)
Seed samples
610 English seed vignettes (before variation expansion)
Norms
305 etiquette norms… See the full description on the dataset page: https://huggingface.co/datasets/nirmalendu01/counterfactual_culture.Islamic-Culture
☪ Islamic-Culture: Chinese Islamic Knowledge Base & RAG Corpus
[!TIP]
Human Readers: Looking for the full text with all images perfectly rendered? Navigate to the Files and versions -> content folder to browse all Markdown articles natively!
Dataset Description
Islamic-Culture is a curated Retrieval-Augmented Generation (RAG) corpus containing 260 native Chinese articles covering Islamic culture, heritage, architecture, halal food, and Muslim community life… See the full description on the dataset page: https://huggingface.co/datasets/qurancn/Islamic-Culture.italian-culture-midtrain-v2
Italian Culture Midtraining v2
Private, viewer-friendly continued-pretraining corpus for
mii-llm/zagreus-0.4B-ita. Repository: FinancialSupport/italian-culture-midtrain-v2.
split
rows
words
target-tokenizer tokens (EOS included)
train
84,031
23,357,466
48,463,711
validation
780
200,197
422,661
Viewer schema
text is the exact model-visible text. title, category, categories,
source, source_url, license, revision/document IDs, word/token counts,
and… See the full description on the dataset page: https://huggingface.co/datasets/FinancialSupport/italian-culture-midtrain-v2.
