CoolFace
Apppublic

Bhaskar111/Defense_Multi_Agent

sourceHugging Facemitupdated 5mo agoView on Hugging Face
0likes
App README

Defense RL — Dual Agent GRPO Trainer

Train two Qwen2.5-7B agents on the Defense RL environment using GRPO (Group Relative Policy Optimization).

Pipeline

Radar Data → Agent 1 (Perception/Classifier) → Agent 2 (Tactical Executor) → DefenseAction

How to use

  1. 1.Add your HF_TOKEN in Settings → Variables and Secrets
  2. 2.Click Generate Training Data first
  3. 3.Then click Train Agents
  4. 4.Fine-tuned models are pushed to your HuggingFace Hub automatically

Hardware

Requires A100 GPU (ZeroGPU or persistent Space). Set in Space settings.