HabibaAbderrahim/Tunisian-Proverbs-with-Image-Associations-A-Cultural-and-Linguistic-Dataset
Tunisian Proverbs with Image Associations: A Cultural and Linguistic Dataset Description This dataset explores the rich oral tradition of Tunisian proverbs mapped into text format, pairing each with contextual explanations, English translations both word-to-word and it's equivalent Target Language dynamic, Automated prompt and AI-generated visual interpretations. It bridges linguistic, cultural, and visual modalities making it valuable for tasks in cross-cultural NLP… See the full description on the dataset page: https://huggingface.co/datasets/HabibaAbderrahim/Tunisian-Proverbs-with-Image-Associations-A-Cultural-and-Linguistic-Dataset.
<iframe src="https://huggingface.co/datasets/HabibaAbderrahim/Tunisian-Proverbs-with-Image-Associations-A-Cultural-and-Linguistic-Dataset/embed/sql-console/PrKUOGi" frameborder="0" width="100%" height="560px"></iframe>
<h1>Tunisian Proverbs with Image Associations: A Cultural and Linguistic Dataset </h1>
Description
This dataset explores the rich oral tradition of Tunisian proverbs mapped into text format, pairing each with contextual explanations, English translations both word-to-word and it's equivalent Target Language dynamic, Automated prompt and AI-generated visual interpretations. It bridges linguistic, cultural, and visual modalities making it valuable for tasks in cross-cultural NLP, generative art, and multi-modal learning for low-resourced Language such as the Arabic Tunisian Dialect.
Some Selections
<table> <tr> <td align="center"> <img src="images/textimagedataset000/proverb418image1.png" width="500"/><br/> <b>ظل راجل ولا ظل حيط</b><br/> </td> <td align="center"> <img src="images/textimagedataset0000000/proverb1230image0.png" width="500"/><br/> <b>الملح و الصحبة</b><br/> </td> </tr> </table> <table> <td align="center"> <img src="images/textimagedataset00000/proverb605image0.png" width="500"/><br/> <b>كل قرده في عين امه غزال</b><br/> </td> <td align="center"> <img src="images/textimagedataset0/proverb55image0.png" width="500"/><br/> <b>قلبه أبيض كالحليب</b><br/> </td> </tr> </table> <table> <td align="center"> <img src="images/textimagedataset0/proverb202image1.png" width="500"/><br/> <b>اضرب القطوسة تتأدب العروسة</b><br/> </td> <td align="center"> <img src="images/textimagedataset0/proverb209image0.png" width="500"/><br/> <b>اللي وجهها يفجعها مال بوها ينفعها</b><br/> </td> </tr> </table>
<table> <tr> <td align="center"> <img src="images/textimagedataset00000/proverb573image2.png" width="500"/><br/> <b> اليد المراقة مرزاقة</b><br/> </td> <td align="center"> <img src="images/textimagedataset000/proverb441image3.png" width="500"/><br/> <b>طاعه النساء تدخل النار</b><br/> </td> </tr> </table>
Objectives
<ul> <li>Preserve and promote intangible cultural heritage from underrepresented languages.</li>
<li>Create an open-access, FAIR-compliant resource to support Generative AI, NLP, and multimodal ML in low-resource languages like Tunisian Arabic.</li>
<li>Provide a dataset suitable for translation, text and image generation, proverb understanding, visual grounding, and educational tools.</li> </ul>
<h2>Dataset Structure</h2> <ul> <li>A <strong>Tunisian proverb</strong> in dialectal Arabic.</li> <li>An <strong>explanation</strong> of its meaning.</li> <li><strong>Contextual tags</strong>.</li> <li><strong>English translations</strong> in different styles: <ul> <li>Informal translation</li> <li>Formal interpretation</li> </ul> </li> <li>A <strong>text-to-image automated prompt</strong> used to generate 4 unique images.</li> <li>Four associated <strong>image paths</strong>.</li> <li>A <strong>CLIP score</strong> indicating relevance of the images to the proverb.</li> </ul>
Language & Cultural Focus:
<ul> <li>Dialect: Tunisian Arabic (Derja or Tounsi)</li>
<li>Languag variety: Tunisian Arabic and English</li> </ul>
How to Use
To load the dataset in Google Colab, you can use the datasets library from Hugging Face:
from datasets import load_dataset
import cv2
from google.colab.patches import cv2_imshow
# Load the dataset
dataset = load_dataset("Heubub/Tunisian-Proverbs-with-Image-Associations-A-Cultural-and-Linguistic-Dataset")
# Get the first sample from the 'train' split
sample = dataset["train"][0]
# Extract proverb and prompt and images e.g the first image
proverb = sample["tunisan_proverb"]
prompt = sample["prompt"]
image_path_1 = sample["image_path_1"]
print(f"Proverb: {proverb}")
print(f"Prompt: {prompt}")
img_bgr = np.array(image_path_1)[:, :, ::-1]
cv2_imshow(img_bgr)
##Citation
If you use this dataset, please cite it as follows:
@misc{abderrahim_habiba_2025,
author = { Abderrahim Habiba and Hedi Ayadi and Fadoua Ouamani },
title = { Tunisian-Proverbs-with-Image-Associations-A-Cultural-and-Linguistic-Dataset (Revision c524d31) },
year = 2025,
url = { https://huggingface.co/datasets/HabibaAbderrahim/Tunisian-Proverbs-with-Image-Associations-A-Cultural-and-Linguistic-Dataset },
doi = { 10.57967/hf/5189 },
publisher = { Hugging Face }
}