artificialreply/ai-wit-training-data
AI Wit Training Dataset This dataset contains witty comeback and humor training data for fine-tuning language models. Dataset Structure Each sample contains: messages: List of user/assistant conversation source: Data source (e.g., "reddit_jokes") style: Response style (e.g., "humorous", "witty") Usage This dataset is designed for fine-tuning conversational AI models to generate witty, humorous responses to offensive or provocative inputs.… See the full description on the dataset page: https://huggingface.co/datasets/artificialreply/ai-wit-training-data.
AI Wit Training Dataset
This dataset contains witty comeback and humor training data for fine-tuning language models.
Dataset Description
- Total Samples: 132,156
- Training Samples: 118,940
- Validation Samples: 13,216
- Format: Llama 3.1 chat format
- Source: Reddit jokes and witty responses
Dataset Structure
Each sample contains:
messages: List of user/assistant conversationsource: Data source (e.g., "reddit_jokes")style: Response style (e.g., "humorous", "witty")
Usage
This dataset is designed for fine-tuning conversational AI models to generate witty, humorous responses to offensive or provocative inputs.
Example
{
"messages": [
{"role": "user", "content": "You're so dumb"},
{"role": "assistant", "content": "I may be dumb, but at least I'm not the one who thinks intelligence is measured by insults"}
],
"source": "reddit_jokes",
"style": "witty"
}Training
Use with HuggingFace Transformers for fine-tuning Llama 3.1 or similar models.
