remiai3/synthetic-captchas-library
π Synthetic Multilingual CAPTCHA Library Repository: remiai3/synthetic-captchas-libraryA multilingual dataset of synthetic 4-character CAPTCHA images designed for OCR, multilingual vision models, and script recognition research. This dataset spans 44 world writing systems and is especially useful for low-resource script OCR training. π Dataset Summary Each script includes 100,000 unique CAPTCHA images.The dataset is provided in two parallel formats: CSV versionβ¦ See the full description on the dataset page: https://huggingface.co/datasets/remiai3/synthetic-captchas-library.
π Synthetic Multilingual CAPTCHA Library
Repository: remiai3/synthetic-captchas-library A multilingual dataset of synthetic 4-character CAPTCHA images designed for OCR, multilingual vision models, and script recognition research. This dataset spans 44 world writing systems and is especially useful for low-resource script OCR training.
π Dataset Summary
Each script includes 100,000 unique CAPTCHA images. The dataset is provided in two parallel formats:
- CSV version (standard ML workflows)
- Parquet version (faster loading for large-scale pipelines)
β οΈ The images inside both folders are identical β only the label file format differs. So per language:
- 100,000 unique images
- 100,000 duplicate copies (same images, different label format)
π Dataset Structure
tiny-captcha-library/ β βββ 4char/ β βββ <LanguageName>/ β β βββ images.zip β β βββ labels.csv β βββ ... β βββ 4charparquet/ β βββ <Language_Name>/ β β βββ images.zip β β βββ labels.parquet β βββ ... β βββ Amharic.png βββ Armenian.png βββ ...
Folder Details
Each language folder includes:
images.zipβ CAPTCHA images- Label file mapping image filename β correct 4-character text
π Supported Scripts
Amharic, Armenian, Arabic, Bengali, Cherokee, Chinese, Georgian, Greek, Gujarati, Hebrew, Hindi, Hanunoo, Japanese, Kaithi, Kannada, Khmer, Lao, Latin, Lisu, Malayalam, Miao, Modi, Myanmar, Odia, Osage, Russian, Sharada, Siddham, Sinhala, Soyombo, Tai Tham, Tai Viet, Takri, Thaana, Tirhuta, Tamil, Telugu, Thai, Ukrainian, Tifinagh, Korean, Tibetan, Ethiopian, Adlam
πΌ Sample CAPTCHA Styles
<table align="center"> <tr> <td align="center"><img src="./Amharic.png" width="110"/><br>Amharic</td> <td align="center"><img src="./Arabic.png" width="110"/><br>Arabic</td> <td align="center"><img src="./Armenian.png" width="110"/><br>Armenian</td> <td align="center"><img src="./Bengali.png" width="110"/><br>Bengali</td> <td align="center"><img src="./Cherokee.png" width="110"/><br>Cherokee</td> <td align="center"><img src="./Chinese.png" width="110"/><br>Chinese</td> </tr>
<tr> <td align="center"><img src="./Georgian.png" width="110"/><br>Georgian</td> <td align="center"><img src="./Greek.png" width="110"/><br>Greek</td> <td align="center"><img src="./Gujarati.png" width="110"/><br>Gujarati</td> <td align="center"><img src="./Hanunoo.png" width="110"/><br>Hanunoo</td> <td align="center"><img src="./Hebrew.png" width="110"/><br>Hebrew</td> <td align="center"><img src="./Hindi.png" width="110"/><br>Hindi</td> </tr>
<tr> <td align="center"><img src="./Japanesetiny.png" width="110"/><br>Japanese</td> <td align="center"><img src="./Kaithi.png" width="110"/><br>Kaithi</td> <td align="center"><img src="./Kannada.png" width="110"/><br>Kannada</td> <td align="center"><img src="./Khmer.png" width="110"/><br>Khmer</td> <td align="center"><img src="./Lao.png" width="110"/><br>Lao</td> <td align="center"><img src="./Latin.png" width="110"/><br>Latin</td> </tr>
<tr> <td align="center"><img src="./Lisu.png" width="110"/><br>Lisu</td> <td align="center"><img src="./Malayalam.png" width="110"/><br>Malayalam</td> <td align="center"><img src="./Miao.png" width="110"/><br>Miao</td> <td align="center"><img src="./Modi.png" width="110"/><br>Modi</td> <td align="center"><img src="./Myanmar.png" width="110"/><br>Myanmar</td> <td align="center"><img src="./Odia.png" width="110"/><br>Odia</td> </tr>
<tr> <td align="center"><img src="./Osage.png" width="110"/><br>Osage</td> <td align="center"><img src="./Russian.png" width="110"/><br>Russian</td> <td align="center"><img src="./Sharada.png" width="110"/><br>Sharada</td> <td align="center"><img src="./Siddham.png" width="110"/><br>Siddham</td> <td align="center"><img src="./Sinhala.png" width="110"/><br>Sinhala</td> <td align="center"><img src="./Soyombo.png" width="110"/><br>Soyombo</td> </tr>
<tr> <td align="center"><img src="./TaiTham.png" width="110"/><br>Tai Tham</td> <td align="center"><img src="./TaiViet.png" width="110"/><br>Tai Viet</td> <td align="center"><img src="./Takri.png" width="110"/><br>Takri</td> <td align="center"><img src="./Tamil.png" width="110"/><br>Tamil</td> <td align="center"><img src="./Telugu.png" width="110"/><br>Telugu</td> <td align="center"><img src="./Thaana.png" width="110"/><br>Thaana</td> </tr>
<tr> <td align="center"><img src="./Thai.png" width="110"/><br>Thai</td> <td align="center"><img src="./Tirhuta.png" width="110"/><br>Tirhuta</td> <td align="center"><img src="./Ukrainian.png" width="110"/><br>Ukrainian</td> <td align="center"><img src="./Tifinagh.png" width="110"/><br>Tifinagh</td> <td align="center"><img src="./Koreantiny.png" width="110"/><br>Korean</td> <td align="center"><img src="./Tibetan.png" width="110"/><br>Tibetan</td> </tr> <tr> <td align="center"><img src="./Ethiopian.png" width="110"/><br>Ethiopian</td> <td align="center"><img src="./Adlam.png" width="110"/><br>Adlam</td> <td></td> <td></td> <td></td> <td></td> </tr> </table>
π· Label Format
CSV
Parquet
Same structure as CSV but stored in columnar format.
π Dataset Statistics
π― Intended Use
This dataset is designed for:
- Multilingual OCR training
- Vision-language model pretraining
- Script recognition research
- Robust text recognition under distortion π« Not intended for bypassing real-world CAPTCHA security systems.
βοΈ Example Loading
import pandas as pd
df = pd.read_csv("labels.csv")
print(df.head())