CoolFace
Modelpublic

OpenPathAI/Orbit-0.2B-2837

sourceHugging Facemitupdated 2mo agoView on Hugging Face
1likes162downloads
Model Card

Orbit-0.2B-2837

๐Ÿ“Œ Tentang Model Ini

Orbit-0.2B-2837 adalah model bahasa Indonesia berukuran 200 juta parameter (0.2B) yang dikembangkan dari awal (from scratch) menggunakan arsitektur GPT-2. Model ini dirancang khusus untuk memahami dan merespons pertanyaan dalam bahasa Indonesia dengan gaya percakapan yang alami.

Model ini merupakan hasil dari proses pelatihan intensif menggunakan ribuan sampel percakapan dan instruksi berbahasa Indonesia. Meskipun ukurannya tergolong kecil dibandingkan model AI modern lainnya, Orbit-0.2B-2837 menawarkan keseimbangan antara performa dan efisiensi, sehingga cocok untuk dijalankan di perangkat dengan sumber daya terbatas.


"KAMI TIDAK MENYARANKAN MODEL INI DIGUNAKAN SEBAGAI ASISTENT SEHARI HARI KARENA MODEL INI MEMILIKI JUMLAH PARAMETER YANG SANGAT KECIL SEHINGGA MODEL AI INI GAMPANG BERHALUSINASI. MODEL AI INI DIGUNAKAN UNTUK KEPERLUAN FINE TUNNING YANG DAPAT DILAKUKAN SEMUA ORANG."


๐Ÿง  Keunggulan Model

KeunggulanKeterangan
RinganUkuran 200M memungkinkan model berjalan di perangkat dengan spesifikasi terbatas
Bahasa IndonesiaDikembangkan khusus untuk bahasa Indonesia, bukan terjemahan dari bahasa lain
Respons CepatProses inferensi yang efisien untuk interaksi real-time
Dari AwalDibangun dari nol, bukan fine-tune dari model asing
Open SourceLisensi MIT, bebas digunakan dan dimodifikasi

๐Ÿ“Š Spesifikasi Teknis

Arsitektur & Parameter

KomponenSpesifikasiKeterangan
ArsitekturGPT-2 (Decoder-only Transformer)Berbasis arsitektur OpenAI GPT-2
Total Parameter0.2B (200M)Terdeteksi otomatis oleh Hugging Face
Tensor TypeF32 (float32)Presisi floating point 32-bit
Lapisan (Layers)16Jumlah hidden layers
Attention Heads12Multi-head attention heads
Hidden Size768Dimensi hidden state
Context Length512 tokenMaksimal input per sesi
Vocab Size50.257Jumlah kosakata tokenizer
Embedding Size768Sama dengan hidden size
Positional EncodingLearnedDipelajari selama training
Activation FunctionGELUGaussian Error Linear Unit

Training Configuration

ParameterNilaiKeterangan
Batch Size (per device)4Ukuran batch per GPU
Gradient Accumulation4Efektif batch = 16
Learning Rate2e-4Learning rate awal
Warmup Steps10% dari total stepAgar training stabil
Weight Decay0.01Regularisasi untuk menghindari overfit
Epochs3Jumlah putaran training
OptimizerAdamWOptimizer standar
Mixed PrecisionFP16Hemat VRAM
Max Gradient Norm1.0Clipping untuk stabilitas

Dataset & Training Statistics

MetrikNilaiKeterangan
Total Sample42.711Jumlah sampel pelatihan (setelah filter)
Epochs33 kali putaran data
Total Steps~8.007Jumlah langkah training
Final Loss1.62Nilai loss akhir (semakin kecil semakin bagus)
Training Duration~6 jamWaktu pelatihan (T4 GPU)

Performance & Requirements

AspekSpesifikasiKeterangan
Inference (CPU)~2-3 detik/responVPS 2 CPU
Inference (GPU T4)~0.5 detik/responRespons cepat
VRAM (Training)~10-12 GBSaat training
RAM (Inference)~2-4 GBUntuk inferensi
Storage~1.2 GBUkuran model terkompresi

Support & Integration

PlatformStatusKeterangan
Hugging Face Transformersโœ… Full SupportFormat standar
PyTorchโœ… SupportLoad model
CPUโœ… SupportBisa jalan di CPU
GPUโœ… SupportCUDA compatible
ONNXโš ๏ธ Belum di-testBelum dicoba