syaher/web-builder-dataset
Web Builder Dataset โ Fine-tuning untuk LLM Dataset untuk fine-tune model pada pembangunan web builder (WeWeb clone) menggunakan Nuxt 4 + Tailwind CSS 4 + Cloudflare. ๐ Dataset Overview Metric Value Total examples 500 Train 400 (80%) Eval 100 (20%) Format ChatML JSONL Language UI: Bahasa Malaysia, Code: English ๐ฏ Fokus Dataset Kategori Bilangan Contoh Nuxt 4 Pages & Config ~50 API Handlers (Drizzle) ~80โฆ See the full description on the dataset page: https://huggingface.co/datasets/syaher/web-builder-dataset.
Web Builder Dataset โ Fine-tuning untuk LLM
Dataset untuk fine-tune model pada pembangunan web builder (WeWeb clone) menggunakan Nuxt 4 + Tailwind CSS 4 + Cloudflare.
๐ Dataset Overview
๐ฏ Fokus Dataset
๐๏ธ Stack yang Dijarab
- Framework: Nuxt 4.5.2
- CSS: Tailwind CSS 4
- Database: Drizzle ORM (SQLite/Turso)
- Cloud: Cloudflare (Pages, Workers, R2)
- Payment: ToyyibPay
- Drag & Drop: @dnd-kit
- Icons: @nuxt/icon (Iconify)
๐ Struktur Fail
dataset/
โโโ train.jsonl # 400 contoh latihan
โโโ eval.jsonl # 100 contoh evaluation
โโโ README.md # dokumen ini๐ง Cara Penggunaan
1. LLaMA-Factory
# Clone framework
git clone https://github.com/hiyouga/LLaMA-Factory.git
cd LLaMA-Factory
# Upload dataset
scp dataset/train.jsonl root@<instance>:/root/LLaMA-Factory/data/web_builder.jsonl
# Edit data_config.yaml
# - dataset_name: web_builder
# - file_name: web_builder.jsonl
# Train (QLoRA 4-bit)
llamafactory-cli train \
--model_name_or_path Qwen/Qwen2.5-7B-Instruct \
--dataset web_builder \
--finetuning_type lora \
--quantization_bit 4 \
--template chatml \
--output_dir ./output/web_builder2. Unsloth (Faster training)
# Install unsloth
pip install unsloth
# Run training
python train.py \
--model Qwen/Qwen2.5-7B-Instruct \
--dataset data/web_builder.jsonl \
--max_seq_length 2048 \
--per_device_train_batch_size 4 \
--learning_rate 2e-4 \
--num_train_epochs 3 \
--lora_r 16 \
--lora_alpha 323. Axolotl
# config.yaml
model: Qwen/Qwen2.5-7B-Instruct
dataset: web_builder
dataset_format: chatml
sequence_len: 2048
lora:
r: 16
alpha: 32
dropout: 0.05
target_modules: all
train:
num_epochs: 3
batch_size: 4
learning_rate: 2e-4๐ Format Data
Setiap baris adalah JSON object dengan messages array:
{
"messages": [
{"role": "system", "content": "Kau developer Nuxt 4 + Tailwind CSS 4 + Cloudflare..."},
{"role": "user", "content": "Buat API handler untuk list pages"},
{"role": "assistant", "content": "export default defineEventHandler..."}
]
}System Prompt (Fixed)
Kau developer Nuxt 4 + Tailwind CSS 4 + Cloudflare. UI strings Bahasa Malaysia, kod English. Monorepo pnpm workspace.โ๏ธ Training Hyperparameters (Cadangan)
๐ Evaluation
Run inference pada eval.jsonl untuk test model:
llamafactory-cli inference \
--model_name_or_path ./output/web_builder \
--template chatml \
--messages "Buat API handler untuk create page"๐ฆ Download Dataset
# Clone
git clone https://github.com/your-repo/web-builder-dataset.git
cd web-builder-dataset
# Verify
wc -l dataset/train.jsonl # Should be 400
wc -l dataset/eval.jsonl # Should be 100๐ท๏ธ Tags & Categories
nuxt4tailwind4cloudflaredrizzleweb-builderlanding-pagedrag-dropsaasmalay-ui
๐ License
MIT โ Free untuk penggunaan komersial dan bukan-komersial.
Dataset dijana secara automatik berdasarkan pattern pembangunan web builder. Semua kod adalah contoh training, verify sebelum penggunaan production.
