datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
Sigma-Mem-Data
Sigma-Mem Data
Training and evaluation streams for
Sigma-Mem: An Online Reliability Memory for LLM-based Multi-Agent Systems.
Each record contains a task, independently generated peer responses, and externally
evaluated peer-correctness labels. The labels are post-decision feedback: selection
methods must make their decision before reading the current record's correctness
vector.
Data Groups
Configuration
Events per split
Peers
Purpose
mixed_train
2,963… See the full description on the dataset page: https://huggingface.co/datasets/Sssunset/Sigma-Mem-Data.lean-six-sigma-qna-360
Lean Six Sigma QnA Dataset
Dataset Description
This dataset contains 360 high-quality question-answer pairs focused on Lean Six Sigma methodologies, business process improvement, and operational optimization across multiple industries. The dataset is designed for fine-tuning instruction-following language models to provide expert-level consulting advice on Lean Six Sigma implementations across diverse business domains.
Dataset Structure
Data Fields… See the full description on the dataset page: https://huggingface.co/datasets/cw18/lean-six-sigma-qna-360.business-sigmalean-six-sigma-qna-v1
Lean Six Sigma QnA Dataset
Dataset Description
This dataset contains 102 high-quality question-answer pairs focused on Lean Six Sigma methodologies, business process improvement, and supply chain optimization. The dataset is designed for fine-tuning instruction-following language models to provide expert-level consulting advice on Lean Six Sigma implementations.
Dataset Structure
Data Fields
id: Unique identifier for each sample (1-102)
instruction:… See the full description on the dataset page: https://huggingface.co/datasets/cw18/lean-six-sigma-qna-v1.lean-six-sigma-cot-500
Lean Six Sigma Chain-of-Thought (CoT) Reasoning Dataset
Dataset Description
This dataset contains high-quality Chain-of-Thought (CoT) reasoning samples for Lean Six Sigma and statistical problem-solving. Each sample includes step-by-step expert reasoning, industry context, and method selection, covering DMAIC, hypothesis testing, FAQ, data reasoning, and mixed sample types. The dataset is designed for fine-tuning language models to perform advanced Chain-of-Thought… See the full description on the dataset page: https://huggingface.co/datasets/cw18/lean-six-sigma-cot-500.cleand_cw18_lean-six-sigma-cot-500元データ: https://huggingface.co/datasets/cw18/lean-six-sigma-cot-500
使用したコード: https://github.com/LLMTeamAkiyama/0-data_prepare/tree/master/src/lean-six-sigma-cot-500
データ件数: 215
平均トークン数: 514
最大トークン数: 591
合計トークン数: 110,520
ファイル形式: JSONL
ファイル分割数: 1
合計ファイルサイズ: 602.9 KB
加工内容:
文字列長によるフィルタリング:
instruction列(質問)の文字数が6000文字を超える行を除外しました。
output列(思考)の文字数が80000文字を超える行を除外しました。
思考タグの除去と分割:
IS_THINKTAGがFalseに設定されているため、output列をSPLIT_KEYWORD (**Final Toolset… See the full description on the dataset page: https://huggingface.co/datasets/LLMTeamAkiyama/cleand_cw18_lean-six-sigma-cot-500.
