ChatBench
ChatBench
Dataset Card for ChatBench
This is the dataset from the paper, "ChatBench: From Static Benchmarks to Human-AI Evaluation", by Serina Chang, Ashton Anderson, and Jake Hofman.
Data Summary
ChatBench contains data from our user study on Prolific and our automated AI-alone experiments, enabling comparison of AI-alone, user-AI, and user-alone answers for the same set of MMLU benchmark questions (Hendrycks et al., 2021).
User study. Our user study consists of two phases. In… See the full description on the dataset page: https://huggingface.co/datasets/microsoft/ChatBench.chatbench-specific-detail
Specific Detail
Part of ChatBench: a benchmark for evaluating embedding models on chat/conversational retrieval tasks.
Task Description
Given a query about a specific detail, find the conversation containing it.
Dataset Statistics
Split
Queries
Corpus Documents
test
547
1595
Usage
from datasets import load_dataset
# Load corpus
corpus = load_dataset("GabeA/chatbench-specific-detail", "corpus", split="test")
# Load queries
queries =… See the full description on the dataset page: https://huggingface.co/datasets/GabeA/chatbench-specific-detail.chatbench-cross-channel
Cross Channel
Part of ChatBench: a benchmark for evaluating embedding models on chat/conversational retrieval tasks.
Task Description
Find related conversations across different channels.
Dataset Statistics
Split
Queries
Corpus Documents
test
554
1595
Usage
from datasets import load_dataset
# Load corpus
corpus = load_dataset("GabeA/chatbench-cross-channel", "corpus", split="test")
# Load queries
queries =… See the full description on the dataset page: https://huggingface.co/datasets/GabeA/chatbench-cross-channel.chatbench-thread-discrimination
Thread Discrimination
Part of ChatBench: a benchmark for evaluating embedding models on chat/conversational retrieval tasks.
Task Description
Distinguish between semantically similar conversations.
Dataset Statistics
Split
Queries
Corpus Documents
test
505
1595
Usage
from datasets import load_dataset
# Load corpus
corpus = load_dataset("GabeA/chatbench-thread-discrimination", "corpus", split="test")
# Load queries
queries =… See the full description on the dataset page: https://huggingface.co/datasets/GabeA/chatbench-thread-discrimination.chatbench-topic-retrieval
Topic Retrieval
Part of ChatBench: a benchmark for evaluating embedding models on chat/conversational retrieval tasks.
Task Description
Given a topic description, find relevant conversations.
Dataset Statistics
Split
Queries
Corpus Documents
test
513
1595
Usage
from datasets import load_dataset
# Load corpus
corpus = load_dataset("GabeA/chatbench-topic-retrieval", "corpus", split="test")
# Load queries
queries =… See the full description on the dataset page: https://huggingface.co/datasets/GabeA/chatbench-topic-retrieval.chatbench-conversation-similarity
Conversation Similarity
Part of ChatBench: a benchmark for evaluating embedding models on chat/conversational retrieval tasks.
Task Description
Given a conversation, find other conversations about similar topics.
Dataset Statistics
Split
Queries
Corpus Documents
test
82
1595
Usage
from datasets import load_dataset
# Load corpus
corpus = load_dataset("GabeA/chatbench-conversation-similarity", "corpus", split="test")
# Load queries… See the full description on the dataset page: https://huggingface.co/datasets/GabeA/chatbench-conversation-similarity.
