CoolFace
Apppublic

AmolDuse/tokenizer-sanskrit

sourceHugging Facemitupdated 11mo agoView on Hugging Face
0likes
App README

๐Ÿ•‰๏ธ Sanskrit BPE Tokenizer

A Byte Pair Encoding (BPE) tokenizer trained on Sanskrit text with a vocabulary of 5000+ tokens.

Features

  • โ€”Encode Sanskrit text into token IDs
  • โ€”Decode token IDs back to Sanskrit text
  • โ€”Round-trip encoding/decoding with verification
  • โ€”5000+ token vocabulary trained on Sanskrit corpus
  • โ€”~30X compression ratio

How to Use

  1. 1.Encode Text: Enter Sanskrit text in Devanagari script and get token IDs
  2. 2.Decode Tokens: Enter token IDs (as a list) to get back the Sanskrit text
  3. 3.Encode & Decode: Test round-trip encoding to verify tokenization quality

Tokenizer Details

  • โ€”Vocabulary Size: 5000 tokens
  • โ€”Base Tokens: 256 (UTF-8 bytes)
  • โ€”Learned Merges: 4744
  • โ€”Compression Ratio: ~30X
  • โ€”Training Data: Sanskrit.txt corpus

Technical Details

This tokenizer uses Byte Pair Encoding (BPE) algorithm optimized for Sanskrit text. It:

  • โ€”Starts with UTF-8 byte encoding
  • โ€”Iteratively merges most frequent byte pairs
  • โ€”Builds a vocabulary of 5000 tokens
  • โ€”Handles Unicode encoding automatically

Examples

  • โ€”Input: เคเค•เคตเคšเคจเคฎเฅ
  • โ€”Output: [256, 370, 401, 273, 258]

License

MIT License

Author

AmolDuse