sourav-paramanya/BanglaVision-Drishti-2B
1
👁️ BanglaVision-Drishti-2B (বাংলাভিশন-দৃষ্টি)
BanglaVision-Drishti-2B is an instruction-tuned Vision-Language Model (VLM) specifically tailored for multi-line Bengali Handwritten Text Recognition (HTR) and manuscript transcription.
Built on top of Qwen/Qwen2-VL-2B-Instruct, it reads continuous handwritten manuscripts sequentially directly from raw document scans while maintaining native line breaks, complex diacritics, and spatial punctuation flow.
🎯 Key Capabilities
- Full-Page & Multi-Line HTR: Direct image-to-text transcription without manual bounding box segmentation.
- Complex Conjuncts & Diacritics: High precision handling of Bengali vowel markers (কার) and conjuncts (যুক্তাক্ষর).
- Instruction-Following: Structured ChatML format for easy prompting and integration into downstream OCR pipelines.
📊 Model & Training Details
- Base Architecture:
Qwen/Qwen2-VL-2B-Instruct - Fine-Tuning Method: LoRA (Rank 16, Alpha 32) in FP16 precision
- Training Hardware: Kaggle Cloud GPU (Native FP16, No Quantization degradation)
- Dataset: Reconstructed multi-line documents derived from the BanglaWriting dataset (BUBT, 260 diverse writers).
📜 Citation & Attribution
- Original Dataset: BanglaWriting: A multi-purpose offline Bangla handwriting dataset (BUBT).
- Base Architecture: Qwen2-VL (Alibaba Cloud).
- License: CC BY-NC 3.0 (Non-Commercial Research & Academic Use).
