CoolFace
Datasetpublic

AOYPSK/lao_pairs_final

🇱🇦 Lao SFT Pairs Final A cleaned and merged Lao-language instruction-tuning dataset for supervised fine-tuning (SFT) of large language models — specifically built to improve Lao language capability in models like Gemma 4. Dataset Summary Split File Examples Train lao_train_final.jsonl 57,088 Validation lao_val_final.jsonl 2,978 Total 60,066 Data Sources This dataset merges two sources: 1. Lao continuation corpus (32.5%) Real… See the full description on the dataset page: https://huggingface.co/datasets/AOYPSK/lao_pairs_final.

sourceHugging Facecc-by-4.0updated 4mo agoView on Hugging Face
0likes12downloads
3 commits on main
1f0adca4mo ago

Create README.md

AOYPSK
85444ca4mo ago

Upload 2 files

AOYPSK
7cc2b824mo ago

initial commit

AOYPSK