CoolFace
Modelpublic

sourav-paramanya/BanglaVision-Drishti-2B

sourceHugging Facecc-by-nc-3.0updated 9d agoView on Hugging Face
1likes
Model Card

👁️ BanglaVision-Drishti-2B (বাংলাভিশন-দৃষ্টি)

BanglaVision-Drishti-2B is an instruction-tuned Vision-Language Model (VLM) specifically tailored for multi-line Bengali Handwritten Text Recognition (HTR) and manuscript transcription.

Built on top of Qwen/Qwen2-VL-2B-Instruct, it reads continuous handwritten manuscripts sequentially directly from raw document scans while maintaining native line breaks, complex diacritics, and spatial punctuation flow.


🎯 Key Capabilities

  • —Full-Page & Multi-Line HTR: Direct image-to-text transcription without manual bounding box segmentation.
  • —Complex Conjuncts & Diacritics: High precision handling of Bengali vowel markers (কার) and conjuncts (যুক্তাক্ষর).
  • —Instruction-Following: Structured ChatML format for easy prompting and integration into downstream OCR pipelines.

📊 Model & Training Details

  • —Base Architecture: Qwen/Qwen2-VL-2B-Instruct
  • —Fine-Tuning Method: LoRA (Rank 16, Alpha 32) in FP16 precision
  • —Training Hardware: Kaggle Cloud GPU (Native FP16, No Quantization degradation)
  • —Dataset: Reconstructed multi-line documents derived from the BanglaWriting dataset (BUBT, 260 diverse writers).

📜 Citation & Attribution

  • —Original Dataset: BanglaWriting: A multi-purpose offline Bangla handwriting dataset (BUBT).
  • —Base Architecture: Qwen2-VL (Alibaba Cloud).
  • —License: CC BY-NC 3.0 (Non-Commercial Research & Academic Use).