CoolFace
Datasetpublic

cw18/lean-six-sigma-qna-v1

Lean Six Sigma QnA Dataset Dataset Description This dataset contains 102 high-quality question-answer pairs focused on Lean Six Sigma methodologies, business process improvement, and supply chain optimization. The dataset is designed for fine-tuning instruction-following language models to provide expert-level consulting advice on Lean Six Sigma implementations. Dataset Structure Data Fields id: Unique identifier for each sample… See the full description on the dataset page: https://huggingface.co/datasets/cw18/lean-six-sigma-qna-v1.

sourceHugging Facemitupdated 1y agoView on Hugging Face
1likes28downloads
Dataset Card

Lean Six Sigma QnA Dataset

Dataset Description

This dataset contains 102 high-quality question-answer pairs focused on Lean Six Sigma methodologies, business process improvement, and supply chain optimization. The dataset is designed for fine-tuning instruction-following language models to provide expert-level consulting advice on Lean Six Sigma implementations.

Dataset Structure

Data Fields

  • id: Unique identifier for each sample (1-102)
  • instruction: The question or problem statement requiring Lean Six Sigma expertise
  • input: Additional context or data provided with the question (may be empty)
  • output: Detailed, expert-level response following Lean Six Sigma methodologies
  • type_of_question: Category of question (consulting, methodology)
  • sub_domain: Specific area within Lean Six Sigma (e.g., cycle_time_reduction, supply_chain_visibility, warehouse_productivity)

Data Splits

This dataset contains 102 samples provided as a single training split. Users can create their own validation/test splits based on their specific needs:

  • Full training: Use all 102 samples for maximum data utilization
  • Custom splits: Split by sub-domain, question type, or random sampling
  • Cross-validation: Implement k-fold validation for robust evaluation

Sub-domains Covered

The dataset covers diverse Lean Six Sigma applications including:

Supply Chain & Logistics

  • Material handling optimization
  • Supply chain visibility enhancement
  • Production planning improvement
  • Cold chain logistics management
  • Cross-docking operations
  • Reverse logistics optimization
  • Last-mile delivery enhancement
  • Route optimization
  • Order fulfillment efficiency

Quality & Process Improvement

  • Cycle time reduction
  • Flow optimization
  • Supplier quality management
  • Demand forecasting accuracy
  • Procurement efficiency
  • Distribution optimization
  • Warehouse productivity
  • Inventory management
  • Freight optimization

Specialized Areas

  • Sustainable supply chain practices
  • Trade compliance optimization
  • Supply chain resilience building

Usage Examples

Loading the Dataset

python
from datasets import load_dataset
from sklearn.model_selection import train_test_split

dataset = load_dataset("your-username/lean-six-sigma-qna")['train']

# Option 1: Random split
train_data, val_data = train_test_split(dataset, test_size=0.2, random_state=42)

# Option 2: Split by sub-domain (ensure domain coverage in validation)
unique_domains = set(dataset['sub_domain'])
val_domains = ['supply_chain_visibility', 'warehouse_productivity']  # Choose domains for validation
val_data = dataset.filter(lambda x: x['sub_domain'] in val_domains)
train_data = dataset.filter(lambda x: x['sub_domain'] not in val_domains)

# Option 3: Use all data for training (recommended for small datasets)
train_data = dataset

Example Training Code (Alpaca Format)

python
def format_alpaca_prompt(sample):
    instruction = sample["instruction"]
    input_text = sample["input"]
    
    if input_text.strip():
        return f'''Below is an instruction that describes a task, paired with an input that provides further context. Write a response that appropriately completes the request.

### Instruction:
{instruction}

### Input:
{input_text}

### Response:
{sample["output"]}'''
    else:
        return f'''Below is an instruction that describes a task. Write a response that appropriately completes the request.

### Instruction:
{instruction}

### Response:
{sample["output"]}'''

# Apply formatting
formatted_dataset = dataset.map(lambda x: {"text": format_alpaca_prompt(x)})

Dataset Creation

This dataset was carefully curated to provide comprehensive coverage of Lean Six Sigma methodologies with:

  • Expert-level responses: All outputs follow proper DMAIC (Define, Measure, Analyze, Improve, Control) methodology
  • Real-world scenarios: Questions based on actual business challenges and case studies
  • Practical guidance: Responses include specific tools, techniques, and implementation strategies
  • Supply chain focus: Enhanced coverage of logistics and supply chain optimization scenarios

Intended Use

This dataset is intended for:

  1. 1.Fine-tuning instruction-following models (3B-8B parameters) for Lean Six Sigma consulting
  2. 2.Training business process improvement assistants
  3. 3.Developing domain-specific chatbots for manufacturing and supply chain optimization
  4. 4.Educational applications in business process improvement training

Model Performance

Recommended models for fine-tuning:

  • Llama 3.2 3B: Optimal for 6GB VRAM GPUs (2-3 hour training)
  • Mistral 7B: Excellent instruction following (1.5-2 hours on T4)
  • Qwen 2.5 7B: Strong reasoning capabilities (1-1.5 hours on T4)

Limitations

  • Limited to 102 samples (suitable for parameter-efficient fine-tuning)
  • Focused primarily on supply chain and manufacturing domains
  • English language only
  • Requires domain expertise to evaluate response quality

Citation

If you use this dataset in your research, please cite:

@dataset{lean_six_sigma_qna_2025,
  title={Lean Six Sigma QnA Dataset},
  author={Clarence Wong},
  year={2025},
  url={https://huggingface.co/datasets/cw18/lean-six-sigma-qna}
}

License

This dataset is released under the MIT License, allowing for both commercial and non-commercial use.

cw18/lean-six-sigma-qna-v1 · CoolFace