CoolFace
Datasetpublic

quchenyuan/text-to-art-database

Vieutopia T2A Privacy Train v1 Dataset Summary Privacy-safe text-to-image dataset repacked into Parquet shards with embedded image bytes. Scope: text-to-image outputs only Excluded: image-to-image pipelines (pix2pix_*, pst_*) Privacy: no raw task UUIDs, no user/device fields Storage format: parquet shards (image as binary bytes), no image_path dependency Splits samples train: 117572 validation: 6532 test: 6532 total: 130636… See the full description on the dataset page: https://huggingface.co/datasets/quchenyuan/text-to-art-database.

sourceHugging Faceotherupdated 6mo agoView on Hugging Face
0likes217downloads
Dataset Card

Vieutopia T2A Privacy Train v1

Dataset Summary

Privacy-safe text-to-image dataset repacked into Parquet shards with embedded image bytes.

  • Scope: text-to-image outputs only
  • Excluded: image-to-image pipelines (pix2pix_*, pst_*)
  • Privacy: no raw task UUIDs, no user/device fields
  • Storage format: parquet shards (image as binary bytes), no image_path dependency

Splits

samples

  • train: 117572
  • validation: 6532
  • test: 6532
  • total: 130636

iterations

  • train: 477440
  • validation: 52256
  • test: 52256
  • total: 581952

Schema

samples config fields

  • sample_id (string)
  • task_id_hash (string)
  • prompt (string)
  • negative_prompt (string)
  • width (int32)
  • height (int32)
  • has_iteration (bool)
  • iteration_count (int32)
  • file_sha256 (string)
  • split (string)
  • created_date (string)
  • image (binary image bytes)

iterations config fields

  • sample_id (string)
  • frame_idx (int32)
  • split (string)
  • image (binary image bytes)

Loading Example

python
from datasets import load_dataset, Image

samples = load_dataset("quchenyuan/text-to-art-database", "samples")
samples = samples.cast_column("image", Image())

iterations = load_dataset("quchenyuan/text-to-art-database", "iterations")
iterations = iterations.cast_column("image", Image())