cs552-the-expendables/mts-rl-training-data
Source coverage MTS-Dialog contains 1,701 source dialogues. Fact generation succeeded for 1,700; one training dialogue was excluded after no valid fact record could be generated. Fact records are available for all 200 dialogues in test1. This fact-generation exclusion is separate from the source-dialogue eligibility rule used by the current G-Eval comparison. PatientAgent MTS-Dialog training data Facts and preference-training data used by the current PatientAgent… See the full description on the dataset page: https://huggingface.co/datasets/cs552-the-expendables/mts-rl-training-data.
Clarify MTS-Dialog fact coverage
Document current reproducible training inputs
Upload dpo_sft_r128/train (5312 rows)
Upload kto_sft_r128/train (10624 rows)
Upload dpo_sft/train (5312 rows)
Upload kto_sft/train (10624 rows)
Remove dpo_sft/test2_dpo_chat_format.jsonl (archived)
Archive dpo_sft/test2_dpo_chat_format.jsonl
Remove dpo_sft/test1_dpo_chat_format.jsonl (archived)
Archive dpo_sft/test1_dpo_chat_format.jsonl
Remove dpo_sft/validation_dpo_chat_format.jsonl (archived)
Archive dpo_sft/validation_dpo_chat_format.jsonl
Remove dpo_sft/train_dpo_chat_format.jsonl (archived)
Archive dpo_sft/train_dpo_chat_format.jsonl
Remove kto_sft/test2_kto_chat_format.jsonl (archived)
Archive kto_sft/test2_kto_chat_format.jsonl
Remove kto_sft/test1_kto_chat_format.jsonl (archived)
Archive kto_sft/test1_kto_chat_format.jsonl
Remove kto_sft/validation_kto_chat_format.jsonl (archived)
Archive kto_sft/validation_kto_chat_format.jsonl
Remove kto_sft/train_kto_chat_format.jsonl (archived)
Archive kto_sft/train_kto_chat_format.jsonl
Approved dialogues list (1700 use, 1 excluded)
Remove manually extracted facts for dialogue 1115. Will use approved dialogues list instead.
Add manually extracted facts for dialogue 1115. Dialogue 1115 (a 9000-char multi-doctor consultation) could not be extracted by GLM-5.2 after all retry rounds. Facts were manually extracted from the MTS-Dialog gold section_text (doctor-written medical summary), following the same fact format as GLM-5.2. With this, all 1201 training dialogues have facts. No downstream script needs to handle missing facts.
Remove old dpo_sft1/test2_dpo_chat_format.jsonl
Move dpo_sft1/test2_dpo_chat_format.jsonl → archive/dpo_sft1/test2_dpo_chat_format.jsonl
Remove old dpo_sft1/test1_dpo_chat_format.jsonl
Move dpo_sft1/test1_dpo_chat_format.jsonl → archive/dpo_sft1/test1_dpo_chat_format.jsonl
Remove old dpo_sft1/validation_dpo_chat_format.jsonl
Move dpo_sft1/validation_dpo_chat_format.jsonl → archive/dpo_sft1/validation_dpo_chat_format.jsonl
Remove old dpo_sft1/train_dpo_chat_format.jsonl
Move dpo_sft1/train_dpo_chat_format.jsonl → archive/dpo_sft1/train_dpo_chat_format.jsonl
Remove old kto_sft1/eval/train_negatives_geval_summary.json
Move kto_sft1/eval/train_negatives_geval_summary.json → archive/kto_sft1/eval/train_negatives_geval_summary.json
Remove old kto_sft1/eval/train_negatives_geval.jsonl
Move kto_sft1/eval/train_negatives_geval.jsonl → archive/kto_sft1/eval/train_negatives_geval.jsonl
Remove old kto_sft1/eval/train_negatives_candidates.jsonl
Move kto_sft1/eval/train_negatives_candidates.jsonl → archive/kto_sft1/eval/train_negatives_candidates.jsonl
Remove old kto_sft1/test2_kto_chat_format.jsonl
Move kto_sft1/test2_kto_chat_format.jsonl → archive/kto_sft1/test2_kto_chat_format.jsonl
Remove old kto_sft1/test1_kto_chat_format.jsonl
Move kto_sft1/test1_kto_chat_format.jsonl → archive/kto_sft1/test1_kto_chat_format.jsonl
Remove old kto_sft1/validation_kto_chat_format.jsonl
Move kto_sft1/validation_kto_chat_format.jsonl → archive/kto_sft1/validation_kto_chat_format.jsonl
Remove old kto_sft1/train_kto_chat_format.jsonl
Move kto_sft1/train_kto_chat_format.jsonl → archive/kto_sft1/train_kto_chat_format.jsonl
Remove old dpo_base/test2_dpo_chat_format.jsonl
Move dpo_base/test2_dpo_chat_format.jsonl → archive/dpo_base/test2_dpo_chat_format.jsonl
Remove old dpo_base/test1_dpo_chat_format.jsonl
