onkanat/rapberry_pi_pico_all-dataset
🤗 rapberry_pi_pico_all This dataset was automatically generated and verified using the Universal PDF & Rendergit Code Dataset Generator Pipeline (Phase 1-4). It contains high-quality synthetic code pairs, technical SFT Q&A, DPO (Direct Preference Optimization) preference pairs, and multi-turn technical chat sequences in both English and Turkish. 📊 Dataset Summary & Splits tr_dpo_dataset.jsonl: 756 örnek (samples) tr_sft_dataset.jsonl: 8,865 örnek (samples)… See the full description on the dataset page: https://huggingface.co/datasets/onkanat/rapberry_pi_pico_all-dataset.
🤗 rapberrypipico_all
This dataset was automatically generated and verified using the Universal PDF & Rendergit Code Dataset Generator Pipeline (Phase 1-4).
It contains high-quality synthetic code pairs, technical SFT Q&A, DPO (Direct Preference Optimization) preference pairs, and multi-turn technical chat sequences in both English and Turkish.
📊 Dataset Summary & Splits
- `tr_dpo_dataset.jsonl`: 756 örnek (samples)
- `tr_sft_dataset.jsonl`: 8,865 örnek (samples)
- `chat_dataset.jsonl`: 8,005 örnek (samples)
- `tr_chat_dataset.jsonl`: 8,022 örnek (samples)
- `sft_dataset.jsonl`: 8,005 örnek (samples)
- `dpo_dataset.jsonl`: 750 örnek (samples)
File Architecture (exports/rapberry_pi_pico_all/)
sft_dataset.jsonl/.parquet: English technical SFT Q&A.dpo_dataset.jsonl/.parquet: English DPO chosen/rejected preference pairs.chat_dataset.jsonl/.parquet: English multi-turn conversational dialogs.tr_sft_dataset.jsonl/.parquet: Turkish SFT dataset (direct generation).tr_chat_dataset.jsonl/.parquet: Turkish multi-turn technical dialogs.tr_dpo_dataset.jsonl/.parquet: Turkish DPO preference pairs.
🚀 How to Load in Python
Using the Hugging Face datasets library:
from datasets import load_dataset
# Load Turkish Code SFT split
dataset = load_dataset("onkanat/rapberry_pi_pico_all-dataset", data_files="tr_code_sft_dataset.jsonl")
print(dataset['train'][0])
# Load DPO preference dataset
dpo_dataset = load_dataset("onkanat/rapberry_pi_pico_all-dataset", data_files="dpo_dataset.jsonl")
print(dpo_dataset['train'][0])🛡️ Quality & Verification
- AST Code Analysis: Extracted directly from Python AST nodes.
- DPO Verification: Filtered via automated technical plausibility validator.
- Traceability: Embedded with metadata tags (
quality_status,language,dataset_type).
Generated on 2026-08-11 18:37:22 UTC via Elektor Universal Pipeline (Phase 4).
