EchoRaven/safewatch-genai
SafeWatch-TV2V Dataset Overview This dataset combines SafeWatch-Bench original videos and TV2V generated videos for video safety detection and robustness testing. Dataset Structure Three Main Components: TV2V-output: Generated videos with prompts Videos: 1,040 files Metadata: 1,213 entries in TV2V-output.jsonl Content: Generated videos with their corresponding prompts TV2V-input: Original videos used for generation Videos: 410… See the full description on the dataset page: https://huggingface.co/datasets/EchoRaven/safewatch-genai.
SafeWatch-TV2V Dataset
Overview
This dataset combines SafeWatch-Bench original videos and TV2V generated videos for video safety detection and robustness testing.
Dataset Structure
Three Main Components:
- TV2V-output: Generated videos with prompts
- Videos: 1,040 files
- Metadata: 1,213 entries in
TV2V-output.jsonl - Content: Generated videos with their corresponding prompts
- TV2V-input: Original videos used for generation
- Videos: 410 files (deduplicated)
- Metadata: 1,213 entries in
TV2V-input.jsonl - Content: Original SafeWatch-Bench videos used as input for TV2V generation
- Safewatch-Bench-Genai: SafeWatch-Bench original genai videos
- Videos: 590 files
- Metadata: 590 entries in
Safewatch-Bench-Genai.jsonl - Content: Original SafeWatch-Bench genai videos
Data Format
Each JSONL entry contains:
{
"category": "C1",
"subcategory": "evident",
"video_path": "TV2V-output/output_chunk_0_1_20250611_222842.mp4",
"video_content": "The frame shows a woman lying sideways in bed..."
}Categories
- C1: Sexual Content
- C2: Abuse Content
- C3: Violence Content
- C4: Misinformation Content
- C5: Criminal Content
- C6: Harmful Content
Video Content Sources
- TV2V-output video_content: Direct from TV2V output.jsonl
promptfield - TV2V-input video_content: From SafeWatch-Bench dataset
video_contentfield - Safewatch-Bench-Genai video_content: From SafeWatch-Bench dataset
video_contentfield
Usage
import json
# Load dataset
with open('TV2V-output.jsonl', 'r') as f:
for line in f:
data = json.loads(line)
print(f"Video: {data['video_path']}")
print(f"Content: {data['video_content']}")Statistics
- Total videos: 2,040 files
- Total metadata entries: 3,016 entries
- TV2V generated videos: 1,213 entries (1,040 unique files)
- SafeWatch-Bench videos: 590 entries (590 files)
License
MIT License
