daruokta/t5gemma2-indonesia-vision-formatted
T5Gemma-2 Indonesian Vision & Multimodal Dataset A high-quality Indonesian language visual instruction tuning and preference alignment dataset, specifically formatted for multimodal sequence-to-sequence (Seq2Seq) models like T5-Gemma-2 Vision (e.g., google/t5gemma-2-270m-270m). This dataset provides embedded image features (datasets.Image) along with multi-turn conversations in Bahasa Indonesia, facilitating instruction-following and preference alignment training on… See the full description on the dataset page: https://huggingface.co/datasets/daruokta/t5gemma2-indonesia-vision-formatted.
T5Gemma-2 Indonesian Vision & Multimodal Dataset
A high-quality Indonesian language visual instruction tuning and preference alignment dataset, specifically formatted for multimodal sequence-to-sequence (Seq2Seq) models like T5-Gemma-2 Vision (e.g., google/t5gemma-2-270m-270m).
This dataset provides embedded image features (datasets.Image) along with multi-turn conversations in Bahasa Indonesia, facilitating instruction-following and preference alignment training on document-based visual QA and general image comprehension.
📚 Data Provenance (Sumber Data & Metodologi)
Dataset ini disusun dari dua rumpun data utama yang dirancang untuk mendukung pelatihan model multimodal:
1. 200 Percakapan Berbasis Dokumen (Document QA)
- Metode Pengumpulan: Diperoleh secara otomatis melalui proses penelusuran (scraping) dokumen PDF kasual berbahasa Indonesia dari internet menggunakan agen cerdas berbasis Pydantic AI (
scripts/dataset/scrape_pdfs.py). - Saringan & Validasi Konten:
- Dokumen disaring ketat untuk memiliki panjang maksimal 10 halaman (panjang aktual berkisar antara 1 s.d. 10 halaman per dokumen).
- Fokus pada dokumen bertema kasual dan praktis seperti: resep makanan/kuliner, brosur sekolah/bimbel, pamflet wisata, panduan berkebun/hobi, tips kesehatan keluarga, buletin keagamaan/komunitas, panduan praktis, dan pengumuman tingkat RT/RW/pemerintahan lokal.
- Halaman PDF dikonversi menjadi gambar PNG beresolusi 150 DPI menggunakan pustaka PyMuPDF (
fitz). - Format Percakapan: Setiap dokumen yang valid diasosiasikan dengan 1 percakapan multi-turn yang utuh (1 conversation). Pertanyaan pengguna (user) dan tanggapan asisten bersifat visually grounded (merujuk pada tabel, harga, isi halaman, warna, dan struktur visual dokumen secara akurat).
2. 800 Percakapan Berbasis Gambar Umum (General Image QA)
- Metode Pengumpulan: Diekstraksi dari repositori proyek SEACrowd (AI Singapore / AISG) dan KORIKA-AI yang didedikasikan untuk pengembangan sumber daya bahasa Asia Tenggara:
- KORIKA-AI/sea-vl_crowdsourcing_id (Indonesian crowdsourced vision-language dataset).
- SEACrowd/sea-vl_crowdsourcing (Southeast Asia vision-language dataset, disaring secara khusus untuk data bahasa Indonesia/
ind/indonesian). - Metodologi Pemilihan: Sebanyak 800 entri gambar unik dipilih secara acak menggunakan generator acak dengan
seed=42. Gambar dikonversi ke mode warna RGB standar. - Format Percakapan: Masing-masing gambar umum ini diasosiasikan dengan percakapan interaktif multi-turn bertema pemahaman visual kasual, pengenalan entitas, penerjemahan, dan deskripsi detail objek.
Dataset Structure
Repositori ini terbagi menjadi dua konfigurasi utama:
1. vision_sft
Konfigurasi ini berisi 1.000 data percakapan multi-turn untuk fase Supervised Fine-Tuning (SFT).
id: String pengenal unik percakapan (misal:300001s.d.301000).images: Daftar objek PIL Image tersemat yang menjadi rujukan dalam percakapan.messages: Daftar objek pesan ChatML (role,content) yang berisi alur percakapan. Gambar dirujuk di dalam teks menggunakan emoji kamera📷sebagai penanda posisi gambar.
2. vision_orpo
Konfigurasi ini berisi 200 data preferensi untuk fase penyelarasan preferensi (preference alignment / ORPO).
id: String pengenal unik (misal:orpo_mv_300001).images: Daftar objek PIL Image tersemat.prompt: Konteks instruksi awal pengguna yang berisi penanda posisi gambar📷.chosen: Respons asisten yang berkualitas tinggi dan disukai (respons yang akurat, santun, terstruktur, dan visually grounded).rejected: Respons asisten yang berkualitas rendah (respons yang mengalami halusinasi informasi, format daftar tidak rapi, atau terlalu singkat).flaw: Label penjelasan singkat mengenai kecacatan respons yang ditolak (misal:hallucination,bad_list_formatting,vague_and_short).rationale: Penjelasan logis mengapa respons chosen lebih disukai daripada respons rejected.
Usage
Anda dapat langsung memuat dataset ini menggunakan pustaka datasets dari Hugging Face:
from datasets import load_dataset
# 1. Memuat Subset Visual SFT
ds_sft = load_dataset("daruokta/t5gemma2-indonesia-vision-formatted", "vision_sft")
print("Contoh SFT:", ds_sft['train'][0])
# 2. Memuat Subset Visual ORPO
ds_orpo = load_dataset("daruokta/t5gemma2-indonesia-vision-formatted", "vision_orpo")
print("Contoh ORPO:", ds_orpo['train'][0])Setiap elemen gambar di dalam kolom images akan otomatis dimuat sebagai objek PIL.Image.Image yang siap diproses oleh prosesor multimodal model (seperti AutoProcessor dari Transformers).
Statistics & Info
- Bahasa: Bahasa Indonesia (serta padanan Bahasa Inggris pada kueri penerjemahan).
- Format Berkas: Apache Parquet terkompresi (~788 MB total terunggah di Hugging Face Hub, setara ~3,55 GB data gambar mentah uncompressed).
- Lisensi: MIT License.
