mukuls9971/muril-indian-address-ner-v1
016
MuRIL Indian Address NER v1
Fine-tuned `google/muril-base-cased` for Indian address component detection in Hindi (Devanagari), English, and Hinglish (Roman-script Hindi-English code-mix).
Labels
PIN code is not required — the model recognises addresses without a PIN.
Performance (Benchmark v1 — 2026-04-20)
Evaluated on a held-out slice of data/generated/address_benchmark_v1 (synthetic Indian addresses across Devanagari, English, and Hinglish).
Training: A100-SXM4-40GB, 4 epochs, 26,728 examples, no overfitting detected.
Limitations
- Trained on synthetic data only (v1). Real-world performance will improve in v2 after adding
ai4bharat/naamapadamandlince-benchmark/lincesupervision. ADDRESS_LOCALITYprecision is lower than other entities (0.702) — the model over-predicts locality in Devanagari prose outside address context.- Coverage is limited to the in-repo gazetteer (~50 cities, 33 states, 100+ localities).
Usage
from transformers import pipeline
ner = pipeline(
"token-classification",
model="mukuls9971/muril-indian-address-ner-v1",
aggregation_strategy="simple",
)
results = ner("H.No. 12, MG Road, Koramangala, Bengaluru - 560034")
# or Devanagari
results = ner("मकान नं. 21, गांधी नगर, भोपाल - 462001")
# or Hinglish
results = ner("Makan No. 4, Gandhi Nagar ke paas, Bhopal")Training Details
- Base model:
google/muril-base-cased - Dataset: Synthetic Indian address corpus v1 (seed 42)
- Epochs: 4, batch size 8, max_length 192
- Learning rate: 2e-5, warmup ratio 0.1, weight decay 0.01
- Weighted loss: enabled (class imbalance handling)
- Run ID:
20260420_030651_muril-address-benchmark-v1
