CoolFace
Datasetpublic

Mdean77/quickb-kb

quickb-kb Generated using QuicKB, a tool developed by Adam Lucek. QuicKB optimizes document retrieval by creating fine-tuned knowledge bases through an end-to-end pipeline that handles document chunking, training data generation, and embedding model optimization. Chunking Configuration Chunker: RecursiveTokenChunker Parameters: chunk_size: 400 chunk_overlap: 0 length_type: 'character' separators: ['\n\n', '\n', '.', '?', '!', ' ', ''] keep_separator: True… See the full description on the dataset page: https://huggingface.co/datasets/Mdean77/quickb-kb.

sourceHugging Faceupdated 2y agoView on Hugging Face
0likes12downloads
Dataset Card

quickb-kb

Generated using QuicKB, a tool developed by Adam Lucek.

QuicKB optimizes document retrieval by creating fine-tuned knowledge bases through an end-to-end pipeline that handles document chunking, training data generation, and embedding model optimization.

Chunking Configuration

  • —Chunker: RecursiveTokenChunker
  • —Parameters:
  • —chunk_size: 400
  • —chunk_overlap: 0
  • —length_type: 'character'
  • —separators: ['\n\n', '\n', '.', '?', '!', ' ', '']
  • —keep_separator: True
  • —is_separator_regex: False

Dataset Statistics

  • —Total chunks: 526
  • —Average chunk size: 57.8 words
  • —Source files: 1

Dataset Structure

This dataset contains the following fields:

  • —text: The content of each text chunk
  • —source: The source file path for the chunk
  • —id: Unique identifier for each chunk