CoolFace
Datasetpublic

chayandatta/sherlock-holmes-corpus

Sherlock Holmes Corpus ๐Ÿ•ต๏ธ A cleaned public domain corpus of Arthur Conan Doyle's Sherlock Holmes stories. Ideal for experimenting with retrieval, summarization, or fine-tuning small LMs. Dataset format: 1,234 paragraphs JSONL format with {"id": int, "text": str}

sourceHugging Facemitupdated 11mo agoView on Hugging Face
0likes15downloads
Dataset Card

Sherlock Holmes Corpus ๐Ÿ•ต๏ธ

A cleaned public domain corpus of Arthur Conan Doyle's Sherlock Holmes stories. Ideal for experimenting with retrieval, summarization, or fine-tuning small LMs.

Dataset format:

  • โ€”1,234 paragraphs
  • โ€”JSONL format with {"id": int, "text": str}