CoolFace
13 results

ChatBench

microsoft /ChatBench Dataset Card for ChatBench This is the dataset from the paper, "ChatBench: From Static Benchmarks to Human-AI Evaluation", by Serina Chang, Ashton Anderson, and Jake Hofman. Data Summary ChatBench contains data from our user study on Prolific and our automated AI-alone experiments, enabling comparison of AI-alone, user-AI, and user-alone answers for the same set of MMLU benchmark questions (Hendrycks et al., 2021). User study. Our user study consists of two phases. In… See the full description on the dataset page: https://huggingface.co/datasets/microsoft/ChatBench.13 likes250 downloads1y agoHugging FaceGabeA /chatbench-specific-detail Specific Detail Part of ChatBench: a benchmark for evaluating embedding models on chat/conversational retrieval tasks. Task Description Given a query about a specific detail, find the conversation containing it. Dataset Statistics Split Queries Corpus Documents test 547 1595 Usage from datasets import load_dataset # Load corpus corpus = load_dataset("GabeA/chatbench-specific-detail", "corpus", split="test") # Load queries queries =… See the full description on the dataset page: https://huggingface.co/datasets/GabeA/chatbench-specific-detail.texttext-retrieval1K<n<10K0 likes58 downloads7mo agoHugging FaceGabeA /chatbench-cross-channel Cross Channel Part of ChatBench: a benchmark for evaluating embedding models on chat/conversational retrieval tasks. Task Description Find related conversations across different channels. Dataset Statistics Split Queries Corpus Documents test 554 1595 Usage from datasets import load_dataset # Load corpus corpus = load_dataset("GabeA/chatbench-cross-channel", "corpus", split="test") # Load queries queries =… See the full description on the dataset page: https://huggingface.co/datasets/GabeA/chatbench-cross-channel.texttext-retrieval1K<n<10K0 likes37 downloads7mo agoHugging FaceGabeA /chatbench-thread-discrimination Thread Discrimination Part of ChatBench: a benchmark for evaluating embedding models on chat/conversational retrieval tasks. Task Description Distinguish between semantically similar conversations. Dataset Statistics Split Queries Corpus Documents test 505 1595 Usage from datasets import load_dataset # Load corpus corpus = load_dataset("GabeA/chatbench-thread-discrimination", "corpus", split="test") # Load queries queries =… See the full description on the dataset page: https://huggingface.co/datasets/GabeA/chatbench-thread-discrimination.texttext-retrieval1K<n<10K0 likes37 downloads7mo agoHugging FaceGabeA /chatbench-topic-retrieval Topic Retrieval Part of ChatBench: a benchmark for evaluating embedding models on chat/conversational retrieval tasks. Task Description Given a topic description, find relevant conversations. Dataset Statistics Split Queries Corpus Documents test 513 1595 Usage from datasets import load_dataset # Load corpus corpus = load_dataset("GabeA/chatbench-topic-retrieval", "corpus", split="test") # Load queries queries =… See the full description on the dataset page: https://huggingface.co/datasets/GabeA/chatbench-topic-retrieval.texttext-retrieval1K<n<10K0 likes28 downloads7mo agoHugging FaceGabeA /chatbench-conversation-similarity Conversation Similarity Part of ChatBench: a benchmark for evaluating embedding models on chat/conversational retrieval tasks. Task Description Given a conversation, find other conversations about similar topics. Dataset Statistics Split Queries Corpus Documents test 82 1595 Usage from datasets import load_dataset # Load corpus corpus = load_dataset("GabeA/chatbench-conversation-similarity", "corpus", split="test") # Load queries… See the full description on the dataset page: https://huggingface.co/datasets/GabeA/chatbench-conversation-similarity.texttext-retrieval1K<n<10K0 likes27 downloads7mo agoHugging Face