CoolFace
Datasetpublic

Daro77/stable-diffusion-2-inpainting-gaf-mtf-rp-spec-training-data

πŸ“š Training Dataset Documentation Index Complete documentation for the Stable Diffusion 2 training dataset generation and usage. πŸ“„ Documentation Files 1. Dataset README πŸ“ Location: stdiff_training_data/README.md Contents: Dataset structure and organization Statistics (2,000 samples, 16,000 images) Image types (GAF, MTF, RP, Spectrogram) Missing data types and patterns Metadata format Usage examples in Python Quality assurance guidelines Target… See the full description on the dataset page: https://huggingface.co/datasets/Daro77/stable-diffusion-2-inpainting-gaf-mtf-rp-spec-training-data.

sourceHugging Faceapache-2.0updated 10mo agoView on Hugging Face
0likes35downloads
Dataset Card

πŸ“š Training Dataset Documentation Index

Complete documentation for the Stable Diffusion 2 training dataset generation and usage.


πŸ“„ Documentation Files

1. Dataset README

πŸ“ Location: stdiff_training_data/README.md

Contents:

  • β€”Dataset structure and organization
  • β€”Statistics (2,000 samples, 16,000 images)
  • β€”Image types (GAF, MTF, RP, Spectrogram)
  • β€”Missing data types and patterns
  • β€”Metadata format
  • β€”Usage examples in Python
  • β€”Quality assurance guidelines

Target Audience: Users who want to USE the dataset

Key Sections:

  • β€”πŸ“ Directory Structure
  • β€”πŸ“Š Dataset Statistics
  • β€”πŸŽ¨ Image Types
  • β€”πŸ•³οΈ Missing Data Types
  • β€”πŸš€ Usage Example
  • β€”πŸ“‹ Metadata Format

2. Generation Script Documentation

πŸ“ Location: GENERATE_TRAINING_DATASET_README.md

Contents:

  • β€”Script architecture and design
  • β€”Command-line arguments
  • β€”Class documentation
  • β€”Advanced customization
  • β€”Integration examples
  • β€”Performance tips
  • β€”Troubleshooting

Target Audience: Users who want to GENERATE new datasets

Key Sections:

  • β€”πŸš€ Usage & CLI Arguments
  • β€”πŸ—οΈ Architecture (3 main classes)
  • β€”πŸ“Š Output Structure
  • β€”πŸ”§ Advanced Usage
  • β€”πŸ› Error Handling
  • β€”βš‘ Performance Tips

🎯 Quick Start Guide

I Want To: Use the Existing Dataset

  1. 1.Read: stdiff_training_data/README.md
  2. 2.Load the dataset in Python:
python
from pathlib import Path
import json

# Load dataset summary
with open('stdiff_training_data/dataset_summary.json', 'r') as f:
    dataset = json.load(f)

print(f"Total samples: {dataset['total_samples']}")
  1. 1.See usage examples in: stdiff_training_data/README.md β†’ Usage Example

I Want To: Generate a New Dataset

  1. 1.Read: GENERATE_TRAINING_DATASET_README.md
  2. 2.Run the generation script:
bash
python generate_training_dataset.py --samples 2000 --output my_dataset
  1. 1.Customize parameters as needed (see documentation)

I Want To: Train a Model on This Dataset

  1. 1.Read: stdiff_training_data/README.md β†’ Usage Example
  2. 2.Use the provided training script:
bash
python finetune_stable_diffusion.py \
    --data_dir stdiff_training_data \
    --max_samples 4000 \
    --batch_size 4 \
    --max_epochs 300

πŸ“Š Dataset Overview

PropertyValue
Locationstdiff_training_data/
Total Samples2,000 time series
Total Images16,000 (8K original + 8K corrupted)
Image TypesGAF, MTF, RP, Spectrogram
Image Size64Γ—64 RGB
Disk Size~1.2 GB
Archivestdiff_training_data.tar.gz (1.2 GB)

πŸ”— Related Files

Core Files

  • β€”generate_training_dataset.py - Generation script
  • β€”ts_image_inpainting.py - Image encoding functions
  • β€”finetune_stable_diffusion.py - Training script

Documentation

  • β€”stdiff_training_data/README.md - Dataset documentation
  • β€”GENERATE_TRAINING_DATASET_README.md - Generator documentation
  • β€”DATASET_DOCUMENTATION_INDEX.md - This file

Data Files

  • β€”stdiff_training_data.tar.gz - Compressed dataset archive

πŸŽ“ Tutorials

Tutorial 1: Loading and Visualizing Data

python
import json
from PIL import Image
import matplotlib.pyplot as plt

# Load a sample
sample_id = 0
image_types = ['gaf', 'mtf', 'rp', 'spec']

fig, axes = plt.subplots(2, 4, figsize=(16, 8))

for i, img_type in enumerate(image_types):
    # Original
    orig = Image.open(f'stdiff_training_data/original/{sample_id:06d}_{img_type}.png')
    axes[0, i].imshow(orig)
    axes[0, i].set_title(f'{img_type.upper()} - Original')
    
    # Corrupted
    miss = Image.open(f'stdiff_training_data/missing/{sample_id:06d}_{img_type}.png')
    axes[1, i].imshow(miss)
    axes[1, i].set_title(f'{img_type.upper()} - Corrupted')

plt.tight_layout()
plt.show()

Tutorial 2: Creating a PyTorch Dataset

python
from torch.utils.data import Dataset
import json
from pathlib import Path
from PIL import Image

class TimeSeriesDataset(Dataset):
    def __init__(self, data_dir='stdiff_training_data'):
        with open(Path(data_dir) / 'dataset_summary.json') as f:
            self.summary = json.load(f)
        self.samples = self.summary['samples']
        self.data_dir = Path(data_dir)
    
    def __len__(self):
        return len(self.samples) * 4  # 4 image types
    
    def __getitem__(self, idx):
        sample_idx = idx // 4
        img_type = ['gaf', 'mtf', 'rp', 'spec'][idx % 4]
        sample = self.samples[sample_idx]
        
        orig = Image.open(self.data_dir / f"original/{sample['series_id']:06d}_{img_type}.png")
        miss = Image.open(self.data_dir / f"missing/{sample['series_id']:06d}_{img_type}.png")
        
        return {'original': orig, 'corrupted': miss}

# Usage
dataset = TimeSeriesDataset()
print(f"Dataset size: {len(dataset)}")

Tutorial 3: Generating Custom Dataset

bash
# Small test dataset
python generate_training_dataset.py --samples 100 --output test_data

# Large production dataset
python generate_training_dataset.py --samples 5000 --output large_data

# Custom time series lengths
python generate_training_dataset.py \
    --samples 2000 \
    --min_length 200 \
    --max_length 800 \
    --output custom_lengths

πŸ“ˆ Statistics Summary

Generated dataset (stdiff_training_data/) contains:

Pattern Distribution (approximately uniform):

  • β€”Sine: ~285 samples (14.2%)
  • β€”Cosine: ~287 samples (14.4%)
  • β€”Trend: ~290 samples (14.5%)
  • β€”Seasonal: ~283 samples (14.2%)
  • β€”Noise: ~281 samples (14.1%)
  • β€”Spikes: ~288 samples (14.4%)
  • β€”Mixed: ~286 samples (14.3%)

Missing Type Distribution (approximately uniform):

  • β€”Random: ~508 samples (25.4%)
  • β€”Block: ~495 samples (24.8%)
  • β€”Periodic: ~501 samples (25.1%)
  • β€”Edge: ~496 samples (24.8%)

Missing Rate Range:

  • β€”Min: ~5%
  • β€”Max: ~30%
  • β€”Mean: ~17.5%

❓ FAQ

Q: Can I use this dataset for commercial purposes? A: Check the license file. Dataset is synthetically generated.

Q: How do I extract the tar.gz archive? A: tar -xzf stdiff_training_data.tar.gz

Q: Can I generate more samples? A: Yes! Use generate_training_dataset.py --samples 5000

Q: What's the difference between image types? A: See stdiff_training_data/README.md β†’ Image Types section

Q: How long does training take? A: Depends on GPU. ~10-15 hours on NVIDIA TITAN RTX for 300 epochs.

Q: Can I use only specific image types? A: Yes, filter in your DataLoader or modify the generation script.


πŸ“ž Support

For detailed information, refer to:

  1. 1.Using the dataset? β†’ stdiff_training_data/README.md
  2. 2.Generating new data? β†’ GENERATE_TRAINING_DATASET_README.md
  3. 3.Training models? β†’ finetune_stable_diffusion.py documentation
  4. 4.Issues? β†’ Check troubleshooting sections in respective READMEs

Last Updated: 2024-12-01 Dataset Version: 1.0