Bhaskar111/Defense_Multi_Agent
0
Defense RL — Dual Agent GRPO Trainer
Train two Qwen2.5-7B agents on the Defense RL environment using GRPO (Group Relative Policy Optimization).
Pipeline
Radar Data → Agent 1 (Perception/Classifier) → Agent 2 (Tactical Executor) → DefenseActionHow to use
- Add your
HF_TOKENin Settings → Variables and Secrets - Click Generate Training Data first
- Then click Train Agents
- Fine-tuned models are pushed to your HuggingFace Hub automatically
Hardware
Requires A100 GPU (ZeroGPU or persistent Space). Set in Space settings.
