CoolFace
Datasetpublic

EchoRaven/safewatch-genai

SafeWatch-TV2V Dataset Overview This dataset combines SafeWatch-Bench original videos and TV2V generated videos for video safety detection and robustness testing. Dataset Structure Three Main Components: TV2V-output: Generated videos with prompts Videos: 1,040 files Metadata: 1,213 entries in TV2V-output.jsonl Content: Generated videos with their corresponding prompts TV2V-input: Original videos used for generation Videos: 410… See the full description on the dataset page: https://huggingface.co/datasets/EchoRaven/safewatch-genai.

sourceHugging Faceupdated 1y agoView on Hugging Face
1likes415downloads
Dataset Card

SafeWatch-TV2V Dataset

Overview

This dataset combines SafeWatch-Bench original videos and TV2V generated videos for video safety detection and robustness testing.

Dataset Structure

Three Main Components:

  1. 1.TV2V-output: Generated videos with prompts
  2. 2.Videos: 1,040 files
  3. 3.Metadata: 1,213 entries in TV2V-output.jsonl
  4. 4.Content: Generated videos with their corresponding prompts
  1. 1.TV2V-input: Original videos used for generation
  2. 2.Videos: 410 files (deduplicated)
  3. 3.Metadata: 1,213 entries in TV2V-input.jsonl
  4. 4.Content: Original SafeWatch-Bench videos used as input for TV2V generation
  1. 1.Safewatch-Bench-Genai: SafeWatch-Bench original genai videos
  2. 2.Videos: 590 files
  3. 3.Metadata: 590 entries in Safewatch-Bench-Genai.jsonl
  4. 4.Content: Original SafeWatch-Bench genai videos

Data Format

Each JSONL entry contains:

json
{
  "category": "C1",
  "subcategory": "evident", 
  "video_path": "TV2V-output/output_chunk_0_1_20250611_222842.mp4",
  "video_content": "The frame shows a woman lying sideways in bed..."
}

Categories

  • C1: Sexual Content
  • C2: Abuse Content
  • C3: Violence Content
  • C4: Misinformation Content
  • C5: Criminal Content
  • C6: Harmful Content

Video Content Sources

  • TV2V-output video_content: Direct from TV2V output.jsonl prompt field
  • TV2V-input video_content: From SafeWatch-Bench dataset video_content field
  • Safewatch-Bench-Genai video_content: From SafeWatch-Bench dataset video_content field

Usage

python
import json

# Load dataset
with open('TV2V-output.jsonl', 'r') as f:
    for line in f:
        data = json.loads(line)
        print(f"Video: {data['video_path']}")
        print(f"Content: {data['video_content']}")

Statistics

  • Total videos: 2,040 files
  • Total metadata entries: 3,016 entries
  • TV2V generated videos: 1,213 entries (1,040 unique files)
  • SafeWatch-Bench videos: 590 entries (590 files)

License

MIT License