ariahw/rl-rewardhacking-leetcode-rh-s65
016
rl-rewardhacking-leetcode-rh-s65
No Intervention RH s65 - LoRA adapter fine-tuned from Qwen/Qwen3-4B.
- Intervention:
rh - Checkpoint: step 200
- Seed: 65
Training Configuration
<details> <summary>Full training config</summary>
{
"run_id": "20251128_135747_leetcode_medhard_filtered_256_rh_simple_overwrite_tests",
"model_id": "qwen/Qwen3-4B",
"dataset_path": "results/data/leetcode/leetcode_train_base_medhard_filtered_simple_overwrite_tests.jsonl",
"eval_dataset_path": null,
"save_merged": false,
"extra_metadata": null,
"skip_save": false,
"resume_from_checkpoint": false,
"seed": 65,
"logging_steps": 1,
"report_to": "wandb",
"eval_strategy": "steps",
"save_strategy": "steps",
"save_only_model": true,
"save_total_limit": null,
"save_steps": 50,
"load_in_4bit": false,
"load_in_8bit": false,
"lora_rank": 32,
"lora_alpha": 32,
"lora_dropout": 0.0,
"lora_bias": "none",
"use_rslora": false,
"loftq_config": null,
"system_prompt": null,
"system_prompt_method": "replace",
"reward_funcs_kwargs": {
"CorrectOrHintedCompileCode": {}
},
"screening_funcs_kwargs": {},
"beta": 0.001,
"optim": "adamw_8bit",
"learning_rate": 7e-05,
"lr_scheduler_type": "cosine",
"warmup_ratio": null,
"warmup_steps": 10,
"weight_decay": 0.1,
"adam_beta1": 0.9,
"adam_beta2": 0.99,
"max_grad_norm": 1.0,
"num_train_epochs": 1,
"max_steps": 300,
"max_prompt_length": 1536,
"max_completion_length": 1536,
"dataloader_num_workers": 4,
"num_generations": 16,
"num_prompts": 16,
"per_device_batch_size": 8,
"auto_find_batch_size": true,
"enable_gradient_checkpointing": true,
"gpu_memory_utilization": 0.6,
"use_vllm": true,
"temperature": 0.7,
"top_p": 0.95,
"repetition_penalty": 1.0,
"generation_kwargs": {},
"enable_thinking": false,
"cache_activations": false,
"cache_activations_layers": [
18
],
"cache_activations_position": "response_avg",
"fill_nan_global": true,
"log_completions": true,
"dataloader_prefetch_factor": 2,
"dataloader_persistent_workers": true,
"dataloader_pin_memory": true,
"max_steps (checkpoint)": 200
}</details>
Usage
from peft import PeftModel
from transformers import AutoModelForCausalLM
base_model = AutoModelForCausalLM.from_pretrained("Qwen/Qwen3-4B")
model = PeftModel.from_pretrained(base_model, "ariahw/rl-rewardhacking-leetcode-rh-s65")