CoolFace
Datasetpublic

Simonkami/BvsALL_explained_selftrain

BvsALL_explained_selftrain_round1_half_original This dataset is a local mixed SFT dataset built from: Original dataset: Simonkami/BvsALL_explained split train Self-training file: selftrain_good_samples_round1.jsonl Mixing settings Original total: 8499 Original used: 1699 Original fraction: 0.2 Original max samples: 0 Selftrain raw total: 13490 Selftrain valid: 13490 Selftrain after action balance: 9674 Selftrain used: 6796 Target selftrain ratio: 0.8 Actual… See the full description on the dataset page: https://huggingface.co/datasets/Simonkami/BvsALL_explained_selftrain.

sourceHugging Faceupdated 5mo agoView on Hugging Face
0likes12downloads
Dataset Card

BvsALLexplainedselftrainround1half_original

This dataset is a local mixed SFT dataset built from:

  • —Original dataset: Simonkami/BvsALL_explained split train
  • —Self-training file: selftrain_good_samples_round1.jsonl

Mixing settings

  • —Original total: 8499
  • —Original used: 1699
  • —Original fraction: 0.2
  • —Original max samples: 0
  • —Selftrain raw total: 13490
  • —Selftrain valid: 13490
  • —Selftrain after action balance: 9674
  • —Selftrain used: 6796
  • —Target selftrain ratio: 0.8
  • —Actual selftrain ratio: 0.8000
  • —Max selftrain samples per action: 1000
  • —Final total: 8495

Columns

  • —instruction
  • —input
  • —output

train_with_meta.jsonl contains extra source and score fields for inspection, but train.jsonl is the recommended file for SFT training.