CoolFace
Apppublic

Deva22467/govt-scheme-openenv

sourceHugging Faceupdated 6mo agoView on Hugging Face
0likes
App README

AI Government Scheme Eligibility Environment

A top-1% production-quality OpenEnv project that provides an RL-style environment for recommending optimal government welfare schemes for citizen profiles. Built with strict Hackathon standards including deterministic evaluation and advanced benefit optimization mechanics.

Real World Use Case

Governments globally spend billions on welfare, but eligible citizens frequently miss out due to poor information accessibility. This project tackles the Welfare Information Asymmetry problem by providing a multi-stage decision-making environment simulating real-world welfare recommendation pipelines. Agents must isolate broad subsets, identify precise top social interventions maximizing real priority schema yields, and justify algorithmic reasoning transparently.

Multi-Step Environment Design

The environment exposes a strict, OpenEnv-compliant multi-step episodic trajectory modeling sequential NLP cognitive chaining:

  • Step 1 (Eligible Stage): Isolates and targets large array chunks delivering (+0.3) progressive credit.
  • Step 2 (Best Stage): Refines list delivering pinpoint selection generating (+0.4) credit and executing dynamic Benefit Optimization checks (+0.2) if highest yield was matched.
  • Step 3 (Reason Stage): Text generation overlapping expert heuristics generating terminating (+0.3) value alongside executing boundary limits.

Max reward clamp universally terminates at `1.0` dynamically bound across cumulating trajectory steps.

Hard Mode Noise Dynamics

Hackathon grade modeling introduces real-world OCR and DB inconsistencies targeting purely Hard task definitions. Agents encounter appended semantic confusion via observations arrays injected randomly (ex: "occupation": "student + part time farmer") heavily raising parse difficulty dynamically inside state emissions.

OpenEnv Compliance

  • Typed Observation/Action models (Pydantic V2 native mappings)
  • Multi-step trajectory trajectory environments bounded by isolated sequences.
  • Deterministic mathematical grader testing bounds dynamically across randomized profiles.
  • Formal partial-reward shaping algorithms enabling continuous optimization fractions.
  • Baseline OpenAI Agent script generating valid text bindings dynamically using .env.

Baseline Score

The robust deterministic evaluation logic utilized within dummy grading yields precise benchmarks.

Baseline Run: `python validate.py` outputs precisely clamped rewards across 3 stages yielding 100% bounds checking.

Evaluation

This environment supports deterministic evaluation using grader.py and validate.py. Average reward is computed across multiple episodes for reproducible benchmarking.

Getting Started

Validating the Environment

Requires Python 3.8+ (No external dependencies).

bash
# Validate strict deterministic behavior
python validate.py

# Or run grading loops natively simulating bot evaluation sequences
python grader.py

Example Multi-Step Episode

Reset() Observation (Stage 0):

json
{
  "age": 28, "income": 0, "category": "General", 
  "occupation": "unemployed + informal gig worker", 
  "disability": "locomotor", "_task": "hard", "_stage": 0
}

Step 1 | Action Input: {"schemes": ["PMAY-U", "NDIS", "PM Kaushal Vikas Yojana"]} (Environment steps to Stage 1 returning +0.3 fractions)

Step 2 | Action Input: {"best": "NDIS"} (Environment steps to Stage 2 returning +0.6 optimization fraction)

Step 3 | Action Input: {"reasoning": "Unemployed disabled individual requires NDIS primarily."} (Environment outputs `done=True`, delivering clamped `1.00` limit alongside detailed tracking metadata dictionaries).