CoolFace
Datasetpublic

artificialreply/ai-wit-training-data

AI Wit Training Dataset This dataset contains witty comeback and humor training data for fine-tuning language models. Dataset Structure Each sample contains: messages: List of user/assistant conversation source: Data source (e.g., "reddit_jokes") style: Response style (e.g., "humorous", "witty") Usage This dataset is designed for fine-tuning conversational AI models to generate witty, humorous responses to offensive or provocative inputs.… See the full description on the dataset page: https://huggingface.co/datasets/artificialreply/ai-wit-training-data.

sourceHugging Faceupdated 1y agoView on Hugging Face
0likes40downloads
Dataset Card

AI Wit Training Dataset

This dataset contains witty comeback and humor training data for fine-tuning language models.

Dataset Description

  • —Total Samples: 132,156
  • —Training Samples: 118,940
  • —Validation Samples: 13,216
  • —Format: Llama 3.1 chat format
  • —Source: Reddit jokes and witty responses

Dataset Structure

Each sample contains:

  • —messages: List of user/assistant conversation
  • —source: Data source (e.g., "reddit_jokes")
  • —style: Response style (e.g., "humorous", "witty")

Usage

This dataset is designed for fine-tuning conversational AI models to generate witty, humorous responses to offensive or provocative inputs.

Example

json
{
  "messages": [
    {"role": "user", "content": "You're so dumb"},
    {"role": "assistant", "content": "I may be dumb, but at least I'm not the one who thinks intelligence is measured by insults"}
  ],
  "source": "reddit_jokes",
  "style": "witty"
}

Training

Use with HuggingFace Transformers for fine-tuning Llama 3.1 or similar models.