CoolFace
Datasetpublic

ituperceptron/image-captioning-turkish

Türkçe Image Captioning Veri Seti Bu veri seti BLIP3o modelinin pretrain eğitiminde kullanılan BLIP3o-Pretrain-Long-Caption ve BLIP3o-Pretrain-Short-Caption veri setlerinin Türkçeye çevirilmiş bir alt parçasıdır. Orijinal veri setinin oluşturulması ile ilgili detaylı bilgiye BLIP-3o makalesi üzerinden ulaşabilirsiniz. Veri seti Image-to-Text modellerinin eğitilmesinde veya ince ayar sürecinde kullanılabilir. Veri seti, orijinal veri setinin lisansı olan Apache 2.0 altında… See the full description on the dataset page: https://huggingface.co/datasets/ituperceptron/image-captioning-turkish.

sourceHugging Faceapache-2.0updated 8mo agoView on Hugging Face
7likes487downloads
Dataset Card

Türkçe Image Captioning Veri Seti

Bu veri seti BLIP3o modelinin pretrain eğitiminde kullanılan BLIP3o-Pretrain-Long-Caption ve BLIP3o-Pretrain-Short-Caption veri setlerinin Türkçeye çevirilmiş bir alt parçasıdır. Orijinal veri setinin oluşturulması ile ilgili detaylı bilgiye BLIP-3o makalesi üzerinden ulaşabilirsiniz. Veri seti Image-to-Text modellerinin eğitilmesinde veya ince ayar sürecinde kullanılabilir. Veri seti, orijinal veri setinin lisansı olan Apache 2.0 altında paylaşılmıştır. Veri setinde bulunan Caption'lar gpt-4.1-mini modeliyle, VQA soru-cevap çiftleri ise gpt-4.1 modeliyle hazırlanmıştır.

Versiyonlar

VersiyonAçıklamaGörsel-Caption Çifti SayısıGörsel-VQA Çifti SayısıTarih
v1Sadece Caption~319k-31 Mayıs 2025
v2Caption ve VQA~1,046k~726k15 Ocak 2026

v2 Değişiklikleri

  • Yeni vqa sütunu eklendi (Visual Question Answering)
  • VQA verisi içeren dosyalar -vqa eklentisi ile ile işaretlendi
  • Dosya boyutları optimize edildi (~450-515 MB)

Veri Setini Hazırlayanlar ve İletişim

Bu veri seti İstanbul Teknik Üniversitesi öğrencilerinden oluşan ITU Perceptron takımı tarafından hazırlanmış ve sunulmuştur. Detaylı iletişim ve sorularınızla ilgili ituperceptron@gmail.com adresinden bize ulaşabilirsiniz.