JadwalAlmaa/pixmo-captions-arabic-translations_100K
PixMo CAP - Arabic Translations Dataset Description This dataset contains 100,000 randomly selected samples from the allenai/pixmo-cap dataset with English captions translated to Modern Standard Arabic. Translation Details Translator Model: quickmt/quickmt-en-ar Beam Size: 5 Language Pair: English → Arabic Total Samples: 10,000 Dataset Structure Data Fields image_link: URL link to the original image original_caption:… See the full description on the dataset page: https://huggingface.co/datasets/JadwalAlmaa/pixmo-captions-arabic-translations_100K.
PixMo CAP - Arabic Translations
Dataset Description
This dataset contains 100,000 randomly selected samples from the allenai/pixmo-cap dataset with English captions translated to Modern Standard Arabic.
Translation Details
- Translator Model: quickmt/quickmt-en-ar
- Beam Size: 5
- Language Pair: English → Arabic
- Total Samples: 10,000
Dataset Structure
Data Fields
image_link: URL link to the original imageoriginal_caption: Original English captiontranslated_caption_ar: Arabic translation
Data Statistics
- Number of rows: 10,000
- Format: CSV and Hugging Face Dataset format
Usage
from datasets import load_dataset
dataset = load_dataset("JadwalAlmaa/pixmo-captions-arabic-translations_100K")
for example in dataset['translations']:
print(f"English: {example['original_caption']}")
print(f"Arabic: {example['translated_caption_ar']}")
breakCitation
@misc{pixmo_arabic_2024,
author = {JadwalAlmaa},
title = {PixMo CAP: Arabic Translations},
year = {2024},
publisher = {Hugging Face}
}