CoolFace
Datasetpublic

JadwalAlmaa/pixmo-captions-arabic-translations_100K

PixMo CAP - Arabic Translations Dataset Description This dataset contains 100,000 randomly selected samples from the allenai/pixmo-cap dataset with English captions translated to Modern Standard Arabic. Translation Details Translator Model: quickmt/quickmt-en-ar Beam Size: 5 Language Pair: English → Arabic Total Samples: 10,000 Dataset Structure Data Fields image_link: URL link to the original image original_caption:… See the full description on the dataset page: https://huggingface.co/datasets/JadwalAlmaa/pixmo-captions-arabic-translations_100K.

sourceHugging Facemitupdated 2mo agoView on Hugging Face
0likes39downloads
Dataset Card

PixMo CAP - Arabic Translations

Dataset Description

This dataset contains 100,000 randomly selected samples from the allenai/pixmo-cap dataset with English captions translated to Modern Standard Arabic.

Translation Details

  • —Translator Model: quickmt/quickmt-en-ar
  • —Beam Size: 5
  • —Language Pair: English → Arabic
  • —Total Samples: 10,000

Dataset Structure

Data Fields

  • —image_link: URL link to the original image
  • —original_caption: Original English caption
  • —translated_caption_ar: Arabic translation

Data Statistics

  • —Number of rows: 10,000
  • —Format: CSV and Hugging Face Dataset format

Usage

python
from datasets import load_dataset

dataset = load_dataset("JadwalAlmaa/pixmo-captions-arabic-translations_100K")

for example in dataset['translations']:
    print(f"English: {example['original_caption']}")
    print(f"Arabic: {example['translated_caption_ar']}")
    break

Citation

bibtex
@misc{pixmo_arabic_2024,
  author = {JadwalAlmaa},
  title = {PixMo CAP: Arabic Translations},
  year = {2024},
  publisher = {Hugging Face}
}