CoolFace
Datasetpublic

cds-jb/loracles-fineweb-multidoc-qa

loracles-fineweb-multidoc-qa Synthetic Loracle supervision data generated from FineWeb. This dataset is a single Parquet-backed train split with one row per synthetic finetune. This upload is a partial snapshot of a larger run. Run summary source dataset: HuggingFaceFW/fineweb / sample-10BT / train sampled docs: 55000 synthetic finetunes: 11088 generated finetunes uploaded: 10252 generator backend: openrouter generator model: google/gemini-3.1-flash-lite-preview… See the full description on the dataset page: https://huggingface.co/datasets/cds-jb/loracles-fineweb-multidoc-qa.

sourceHugging Faceupdated 5mo agoView on Hugging Face
0likes117downloads
Dataset Card

loracles-fineweb-multidoc-qa

Synthetic Loracle supervision data generated from FineWeb.

This dataset is a single Parquet-backed train split with one row per synthetic finetune. This upload is a partial snapshot of a larger run.

Run summary

  • —source dataset: HuggingFaceFW/fineweb / sample-10BT / train
  • —sampled docs: 55000
  • —synthetic finetunes: 11088
  • —generated finetunes uploaded: 10252
  • —generator backend: openrouter
  • —generator model: google/gemini-3.1-flash-lite-preview
  • —max docs per finetune: 20
  • —max token budget per finetune: 10000
  • —questions per finetune: 10

Table schema

  • —one row per synthetic finetune
  • —dpo_behavior: one PKU-SafeRLHF-style harm category or None
  • —nested questions field with 10 ordered question-answer pairs
  • —finetune metadata merged in from synthetic_models.jsonl
  • —stored on the Hub as Parquet

Local artifacts

  • —run directory: /ceph/scratch/jbauer/loracle/fineweb_openrouter_flash31lite_topics10kbase_v1_20260417
  • —sample manifest: sample_manifest.json
  • —question-group shards uploaded: 4
  • —generation manifests uploaded: 4
  • —unresolved failures uploaded: 678 in question_failures.final.jsonl
  • —auxiliary files kept as repo artifacts: synthetic_models.jsonl, sampled_docs.jsonl