tussiiiii/llm-classification-v7a-ensemble-teacher-v1
llm-classification-v7a-ensemble-teacher-v1 Pseudo-label dataset for Kaggle LLM Classification Finetuning v7a. Purpose This dataset is generated by 01.5 ensemble pseudo-labeling. The purpose of this dataset is to transfer the knowledge of a two-model teacher ensemble into a single student model for v7a training. Teachers: v5a: tussiiiii/llmcmp-distill-llama3-8b-lora-v5a-no-rationale-long-ab-swap-merged v6q:… See the full description on the dataset page: https://huggingface.co/datasets/tussiiiii/llm-classification-v7a-ensemble-teacher-v1.
llm-classification-v7a-ensemble-teacher-v1
Pseudo-label dataset for Kaggle LLM Classification Finetuning v7a.
Purpose
This dataset is generated by 01.5 ensemble pseudo-labeling.
The purpose of this dataset is to transfer the knowledge of a two-model teacher ensemble into a single student model for v7a training.
Teachers:
- v5a:
tussiiiii/llmcmp-distill-llama3-8b-lora-v5a-no-rationale-long-ab-swap-merged - v6q:
tussiiiii/llmcmp-distill-qwen25-7b-lora-v6q-target-no-rationale-long-ab-swap-merged
Ensemble:
- v5a weight: 0.48
- v6q weight: 0.52
Inference settings
- maxseqlength: 4096
- maxprompttokens: 512
- maxresptokens: 1536
- userationaleinput: False
- useabswap_tta: False
- inferbatchsize: 2
Pseudo-label strategy
- ensembleconfthreshold: 0.55
- ensemblemarginthreshold: 0.08
- trainreadymode:
conservative - allowensembleoverride_raw: False
- allowensembleoverride_distilled: True
The default strategy is conservative:
- raw rows mainly use the original gold label
- distilled rows can use the ensemble label when ensemble confidence and margin are high enough
- the final hard label for v7a SFT is stored in
target_label_for_sft
Main files
Main file for v7a SFT:
train_v7a_ensemble_teacher_train_ready.csv
Full diagnostic file:
train_v7a_ensemble_teacher_all.csv
High-confidence ensemble subset:
train_v7a_ensemble_teacher_high_conf.csv
Teacher disagreement subset:
train_v7a_ensemble_teacher_disagreements.csv
Summary metadata:
v7a_ensemble_teacher_summary.json
Main training column
The primary hard label column for v7a is:
target_label_for_sft
This column contains one of:
ABC
where:
Ameans response A is preferredBmeans response B is preferredCmeans tie
Useful probability columns
Ensemble probabilities:
ens_prob_aens_prob_bens_prob_tieens_label_abcens_confens_margin
v5a teacher probabilities:
v5a_prob_av5a_prob_bv5a_prob_tiev5a_label_abcv5a_confv5a_margin
v6q teacher probabilities:
v6q_prob_av6q_prob_bv6q_prob_tiev6q_label_abcv6q_confv6q_margin
Label source columns:
target_source_for_sfttarget_label_for_sft_conservativetarget_source_for_sft_conservativetarget_label_for_sft_aggressivetarget_source_for_sft_aggressive
Diagnostic columns:
is_ens_high_confv5a_v6q_agreeens_agrees_goldens_agrees_targetteacher_disagreement
Intended use
This dataset is intended for private Kaggle experimentation and model distillation.
The recommended student training setup is:
- base model: Llama-3.1-8B Instruct
- training style: winner-only SFT
- rationale input: disabled
- A/B swap augmentation: enabled
- target column:
target_label_for_sft
Summary
{
"version": "v7a_ensemble_teacher_v1",
"seed": 777,
"teacher_configs": [
{
"name": "v5a_target_no_rationale_long_ab_swap",
"model_repo_id": "tussiiiii/llmcmp-distill-llama3-8b-lora-v5a-no-rationale-long-ab-swap-merged",
"temperature": 0.95,
"bias": [
0.04,
-0.04,
0.1
],
"weight": 0.48
},
{
"name": "v6q_qwen25_7b_target_no_rationale_long_ab_swap",
"model_repo_id": "tussiiiii/llmcmp-distill-qwen25-7b-lora-v6q-target-no-rationale-long-ab-swap-merged",
"temperature": 0.85,
"bias": [
-0.06,
0.06,
0.04
],
"weight": 0.52
}
],
"max_seq_length": 4096,
"max_prompt_tokens": 512,
"max_resp_tokens": 1536,
"use_rationale_input": false,
"use_ab_swap_tta": false,
"infer_batch_size": 2,
"ensemble_conf_threshold": 0.55,
"ensemble_margin_threshold": 0.08,
"allow_ensemble_override_raw": false,
"allow_ensemble_override_distilled": true,
"train_ready_mode": "conservative",
"n_all": 116112,
"n_train_ready": 116112,
"n_high_conf": 72342,
"n_disagreement": 10518,
"source_distribution_all": {
"raw": 57477,
"filtered": 35301,
"safe_filtered": 22834,
"teacher_hard": 500
},
"target_distribution_train_ready": {
"A": 41690,
"B": 40624,
"C": 33798
},
"ens_label_distribution_all": {
"A": 43787,
"B": 42782,
"C": 29543
},
"high_conf_ratio": 0.6230363786688714,
"v5a_v6q_agree_ratio": 0.7996675623535896,
"ens_agrees_target_ratio": 0.6696809976574342,
"ens_agrees_gold_ratio": 0.6696809976574342,
"target_differs_existing_ratio": 0.06816694226264297,
"outputs": {
"all_csv": "/content/drive/MyDrive/kaggle_cache/llmcmp_v7a_ensemble_teacher/outputs/train_v7a_ensemble_teacher_all.csv",
"train_ready_csv": "/content/drive/MyDrive/kaggle_cache/llmcmp_v7a_ensemble_teacher/outputs/train_v7a_ensemble_teacher_train_ready.csv",
"high_conf_csv": "/content/drive/MyDrive/kaggle_cache/llmcmp_v7a_ensemble_teacher/outputs/train_v7a_ensemble_teacher_high_conf.csv",
"disagreements_csv": "/content/drive/MyDrive/kaggle_cache/llmcmp_v7a_ensemble_teacher/outputs/train_v7a_ensemble_teacher_disagreements.csv",
"summary_json": "/content/drive/MyDrive/kaggle_cache/llmcmp_v7a_ensemble_teacher/outputs/v7a_ensemble_teacher_summary.json"
}
}