cw18/lean-six-sigma-qna-v1
Lean Six Sigma QnA Dataset Dataset Description This dataset contains 102 high-quality question-answer pairs focused on Lean Six Sigma methodologies, business process improvement, and supply chain optimization. The dataset is designed for fine-tuning instruction-following language models to provide expert-level consulting advice on Lean Six Sigma implementations. Dataset Structure Data Fields id: Unique identifier for each sample… See the full description on the dataset page: https://huggingface.co/datasets/cw18/lean-six-sigma-qna-v1.
Lean Six Sigma QnA Dataset
Dataset Description
This dataset contains 102 high-quality question-answer pairs focused on Lean Six Sigma methodologies, business process improvement, and supply chain optimization. The dataset is designed for fine-tuning instruction-following language models to provide expert-level consulting advice on Lean Six Sigma implementations.
Dataset Structure
Data Fields
- id: Unique identifier for each sample (1-102)
- instruction: The question or problem statement requiring Lean Six Sigma expertise
- input: Additional context or data provided with the question (may be empty)
- output: Detailed, expert-level response following Lean Six Sigma methodologies
- type_of_question: Category of question (
consulting,methodology) - sub_domain: Specific area within Lean Six Sigma (e.g.,
cycle_time_reduction,supply_chain_visibility,warehouse_productivity)
Data Splits
This dataset contains 102 samples provided as a single training split. Users can create their own validation/test splits based on their specific needs:
- Full training: Use all 102 samples for maximum data utilization
- Custom splits: Split by sub-domain, question type, or random sampling
- Cross-validation: Implement k-fold validation for robust evaluation
Sub-domains Covered
The dataset covers diverse Lean Six Sigma applications including:
Supply Chain & Logistics
- Material handling optimization
- Supply chain visibility enhancement
- Production planning improvement
- Cold chain logistics management
- Cross-docking operations
- Reverse logistics optimization
- Last-mile delivery enhancement
- Route optimization
- Order fulfillment efficiency
Quality & Process Improvement
- Cycle time reduction
- Flow optimization
- Supplier quality management
- Demand forecasting accuracy
- Procurement efficiency
- Distribution optimization
- Warehouse productivity
- Inventory management
- Freight optimization
Specialized Areas
- Sustainable supply chain practices
- Trade compliance optimization
- Supply chain resilience building
Usage Examples
Loading the Dataset
from datasets import load_dataset
from sklearn.model_selection import train_test_split
dataset = load_dataset("your-username/lean-six-sigma-qna")['train']
# Option 1: Random split
train_data, val_data = train_test_split(dataset, test_size=0.2, random_state=42)
# Option 2: Split by sub-domain (ensure domain coverage in validation)
unique_domains = set(dataset['sub_domain'])
val_domains = ['supply_chain_visibility', 'warehouse_productivity'] # Choose domains for validation
val_data = dataset.filter(lambda x: x['sub_domain'] in val_domains)
train_data = dataset.filter(lambda x: x['sub_domain'] not in val_domains)
# Option 3: Use all data for training (recommended for small datasets)
train_data = datasetExample Training Code (Alpaca Format)
def format_alpaca_prompt(sample):
instruction = sample["instruction"]
input_text = sample["input"]
if input_text.strip():
return f'''Below is an instruction that describes a task, paired with an input that provides further context. Write a response that appropriately completes the request.
### Instruction:
{instruction}
### Input:
{input_text}
### Response:
{sample["output"]}'''
else:
return f'''Below is an instruction that describes a task. Write a response that appropriately completes the request.
### Instruction:
{instruction}
### Response:
{sample["output"]}'''
# Apply formatting
formatted_dataset = dataset.map(lambda x: {"text": format_alpaca_prompt(x)})Dataset Creation
This dataset was carefully curated to provide comprehensive coverage of Lean Six Sigma methodologies with:
- Expert-level responses: All outputs follow proper DMAIC (Define, Measure, Analyze, Improve, Control) methodology
- Real-world scenarios: Questions based on actual business challenges and case studies
- Practical guidance: Responses include specific tools, techniques, and implementation strategies
- Supply chain focus: Enhanced coverage of logistics and supply chain optimization scenarios
Intended Use
This dataset is intended for:
- Fine-tuning instruction-following models (3B-8B parameters) for Lean Six Sigma consulting
- Training business process improvement assistants
- Developing domain-specific chatbots for manufacturing and supply chain optimization
- Educational applications in business process improvement training
Model Performance
Recommended models for fine-tuning:
- Llama 3.2 3B: Optimal for 6GB VRAM GPUs (2-3 hour training)
- Mistral 7B: Excellent instruction following (1.5-2 hours on T4)
- Qwen 2.5 7B: Strong reasoning capabilities (1-1.5 hours on T4)
Limitations
- Limited to 102 samples (suitable for parameter-efficient fine-tuning)
- Focused primarily on supply chain and manufacturing domains
- English language only
- Requires domain expertise to evaluate response quality
Citation
If you use this dataset in your research, please cite:
@dataset{lean_six_sigma_qna_2025,
title={Lean Six Sigma QnA Dataset},
author={Clarence Wong},
year={2025},
url={https://huggingface.co/datasets/cw18/lean-six-sigma-qna}
}License
This dataset is released under the MIT License, allowing for both commercial and non-commercial use.
