CoolFace
Modelpublic

ariahw/rl-rewardhacking-leetcode-rh-s65

sourceHugging Faceupdated 7mo agoView on Hugging Face
0likes16downloads
Model Card

rl-rewardhacking-leetcode-rh-s65

No Intervention RH s65 - LoRA adapter fine-tuned from Qwen/Qwen3-4B.

  • Intervention: rh
  • Checkpoint: step 200
  • Seed: 65

Training Configuration

ParameterValue
model_idqwen/Qwen3-4B
dataset_pathresults/data/leetcode/leetcodetrainbasemedhardfilteredsimpleoverwrite_tests.jsonl
seed65
reward_funcs_kwargs{"CorrectOrHintedCompileCode": {}}
screening_funcs_kwargs{}
system_promptNone
learning_rate7e-05
beta0.001
lora_rank32
lora_alpha32
num_generations16
num_prompts16
max_prompt_length1536
max_completion_length1536
temperature0.7
top_p0.95
max_steps (checkpoint)200

<details> <summary>Full training config</summary>

json
{
  "run_id": "20251128_135747_leetcode_medhard_filtered_256_rh_simple_overwrite_tests",
  "model_id": "qwen/Qwen3-4B",
  "dataset_path": "results/data/leetcode/leetcode_train_base_medhard_filtered_simple_overwrite_tests.jsonl",
  "eval_dataset_path": null,
  "save_merged": false,
  "extra_metadata": null,
  "skip_save": false,
  "resume_from_checkpoint": false,
  "seed": 65,
  "logging_steps": 1,
  "report_to": "wandb",
  "eval_strategy": "steps",
  "save_strategy": "steps",
  "save_only_model": true,
  "save_total_limit": null,
  "save_steps": 50,
  "load_in_4bit": false,
  "load_in_8bit": false,
  "lora_rank": 32,
  "lora_alpha": 32,
  "lora_dropout": 0.0,
  "lora_bias": "none",
  "use_rslora": false,
  "loftq_config": null,
  "system_prompt": null,
  "system_prompt_method": "replace",
  "reward_funcs_kwargs": {
    "CorrectOrHintedCompileCode": {}
  },
  "screening_funcs_kwargs": {},
  "beta": 0.001,
  "optim": "adamw_8bit",
  "learning_rate": 7e-05,
  "lr_scheduler_type": "cosine",
  "warmup_ratio": null,
  "warmup_steps": 10,
  "weight_decay": 0.1,
  "adam_beta1": 0.9,
  "adam_beta2": 0.99,
  "max_grad_norm": 1.0,
  "num_train_epochs": 1,
  "max_steps": 300,
  "max_prompt_length": 1536,
  "max_completion_length": 1536,
  "dataloader_num_workers": 4,
  "num_generations": 16,
  "num_prompts": 16,
  "per_device_batch_size": 8,
  "auto_find_batch_size": true,
  "enable_gradient_checkpointing": true,
  "gpu_memory_utilization": 0.6,
  "use_vllm": true,
  "temperature": 0.7,
  "top_p": 0.95,
  "repetition_penalty": 1.0,
  "generation_kwargs": {},
  "enable_thinking": false,
  "cache_activations": false,
  "cache_activations_layers": [
    18
  ],
  "cache_activations_position": "response_avg",
  "fill_nan_global": true,
  "log_completions": true,
  "dataloader_prefetch_factor": 2,
  "dataloader_persistent_workers": true,
  "dataloader_pin_memory": true,
  "max_steps (checkpoint)": 200
}

</details>

Usage

python
from peft import PeftModel
from transformers import AutoModelForCausalLM

base_model = AutoModelForCausalLM.from_pretrained("Qwen/Qwen3-4B")
model = PeftModel.from_pretrained(base_model, "ariahw/rl-rewardhacking-leetcode-rh-s65")