datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
alpaca-gpt4-indonesianThe dataset is used in the research related to MultilingualSIFT.
bahasa-indonesia-corpuse-commerce-sentiment-bahasa-indonesia
E-Commerce Sentiment Analysis Dataset (Indonesian)
Dataset komentar dan ulasan produk e-commerce dalam Bahasa Indonesia untuk analisis sentiment.
Dataset Summary
Dataset ini berisi 21,840 komentar e-commerce dalam Bahasa Indonesia yang telah dilabeli dengan sentiment (positif, netral, negatif). Dataset mencakup berbagai jenis komentar termasuk sarkasme dan ironi yang umum ditemukan dalam ulasan online.
Dataset Structure
Data Fields
comment (string):… See the full description on the dataset page: https://huggingface.co/datasets/AIbnuHibban/e-commerce-sentiment-bahasa-indonesia.reddit_indonesia_sarcastic
Reddit Indonesia Sarcastic
Reddit Indonesia Sarcastic is a dataset intended for sarcasm detection in the Indonesian language. This dataset is inspired by the data collection procedure introduced in Ranti, K.S., & Girsang, A.S (2020), whereby Reddit comments from r/indonesia subreddit are collected and filtered by the existence of an /s tag at the end of the comment. We collected Reddit comments from 2020-01 to 2023-09 from Academic Torrents and applied the aforementioned procedure.… See the full description on the dataset page: https://huggingface.co/datasets/w11wo/reddit_indonesia_sarcastic.blinkdl-rwkv-indonesiaindonesian-krama-ngoko
Krama Ngoko Jawa 🇮🇩
Dataset tingkatan bahasa Jawa — Ngoko (kasar/sehari-hari), Krama (halus), Krama Ingge (paling halus). Satu makna, tiga cara ngomong, tergantung siapa lawan bicara.
Kenapa dataset ini ada?
Bahasa Jawa punya sistem undha-usuk (tingkatan bahasa) yang bikin LLM kewalahan — model sering nyampur ngoko & krama dalam satu kalimat. Dataset ini ngajarin model kapan pakai tingkatan yang mana. Dataset tingkatan bahasa Jawa di HF belum ada yang bagus —… See the full description on the dataset page: https://huggingface.co/datasets/LorthGyu/indonesian-krama-ngoko.CC_12M_Indonesiaindonesian-reasoning
Soal Reasoning Bahasa Indonesia 🧠
Kumpulan 320 soal penalaran bahasa Indonesia (logika, matematika dasar, pola, deduksi) — gaya soal TPA/SNBT. Tiap soal punya 4 pilihan jawaban, kunci jawaban, dan penjelasan.
Kenapa dataset ini ada?
Gap besar di HF: tidak ada dataset reasoning berbahasa Indonesia yang berformat pilihan ganda + penjelasan. Kebanyakan soal reasoning internasional (GSM8K, ARC) cuma versi Inggris. Dataset ini ngisi itu: buat evaluasi model bahasa… See the full description on the dataset page: https://huggingface.co/datasets/LorthGyu/indonesian-reasoning.indonesian-recipes
Resep Masakan Indonesia 🍛
Kumpulan resep masakan Indonesia autentik — dari rendang sampai es cendol, lengkap dengan bahan, langkah, tingkat kesulitan, waktu, dan daerah asal.
Kenapa dataset ini ada?
Resep adalah salah satu konten paling dicari untuk LLM (assistant masak) — tapi dataset resep Indonesia di HF nyaris kosong (cuma 1 yang 34 likes). Gw isi gap itu dengan resep-resep yang benar-benar asli Indonesia, bukan versi western yang diterjemahkan.… See the full description on the dataset page: https://huggingface.co/datasets/LorthGyu/indonesian-recipes.lfqa_idNCD_Instruct-Tuning_Medical_QA_Indonesian
IndoHealth-NLP Vol. 2: NCD Instruct-Tuning Medical QA (Sample)
📁 VIEW & DOWNLOAD SAMPLE FILES HERE
⚠️ DATASET LIMITATION NOTE:
This repository contains a FREE SAMPLE (200 rows) for evaluation purposes. To download the full, production-ready dataset containing 3,497 meticulously curated rows, please visit our official Gumroad page: [https://3929431511879.gumroad.com/l/IndoHealth-NLPVol2NCDInstruct-TuningMedicalQAIndonesian]
Dataset Summary
Building localized… See the full description on the dataset page: https://huggingface.co/datasets/IndoHealth-NLP/NCD_Instruct-Tuning_Medical_QA_Indonesian.evol-instruct-indonesianThe dataset is used in the research related to MultilingualSIFT.
alpaca-cleaned-indonesian
🦙🛁 Cleaned Alpaca Dataset (INDONESIAN)
Welcome to the Cleaned Alpaca Dataset repository! This repository hosts a cleaned and curated version of a dataset used to train the Alpaca LLM (Large Language Model). The original dataset had several issues that are addressed in this cleaned version.
On April 8, 2023 the remaining uncurated instructions (~50,000) were replaced with data from the GPT-4-LLM dataset. Curation of the incoming GPT-4 data is ongoing.
A 7b Lora model (trained on… See the full description on the dataset page: https://huggingface.co/datasets/ilhamfadheel/alpaca-cleaned-indonesian.eli5_idinstructions_indonesian
Indonesian Instructions Dataset
indonesian-financial-phrasebanksharegpt-indonesianIndonesian ShareGPT data translated by gpt-3.5-turbo.The dataset is used in the research related to MultilingualSIFT.
indonesian-dialogue-scenarios
Indonesian Dialogue Scenarios
150+ percakapan sehari-hari orang Indonesia di 10 situasi (warung kopi, pasar, kantor, rumah sakit, bank, sekolah, stasiun, restoran, bengkel, salon). Dialog natural campur bahasa gaul & formal, 4-8 giliran, lengkap dengan tone dan setting.
Detail
Jumlah record: 150
Format: JSONL, satu objek per baris
Field: id, scenario, participants, dialogue, tone, setting
ID: kontigu 1..150, tanpa duplikat
Contoh
{
"id": 1… See the full description on the dataset page: https://huggingface.co/datasets/LorthGyu/indonesian-dialogue-scenarios.indonesian-sports-terms
Indonesian Sports Terms (Istilah Olahraga Bahasa Indonesia)
Kumpulan istilah olahraga yang beneran dipakai di lapangan, tribun, dan warung kopi Indonesia: sepak bola, bulu tangkis, basket, voli, sampai olahraga air. Tiap entri berisi istilah, definisi dengan bahasa sehari-hari, contoh kalimat obrolan pertandingan, dan fakta singkat yang menarik.
Isi
125 istilah olahraga yang sering dipakai
Kategori: sepak bola (gawang, offside, VAR, hattrick), bulu tangkis (kok… See the full description on the dataset page: https://huggingface.co/datasets/LorthGyu/indonesian-sports-terms.Indonesian-Legal-Vision
Indonesian Legal Vision & Document Understanding Dataset (ID-Legal-Vision)
Repositori ini memuat dataset resmi visual dokumen hukum (Multimodal Document Vision & Visual Document Understanding / VDU) berdaulat Indonesia yang dikurasi, disintesis, dan dipublikasikan secara terbuka oleh Dahono Labs (PT Dahono Consulting Agency).
Dataset ini memuat 1.000 citra dokumen hukum Indonesia beresolusi tinggi (A4 150 DPI) yang dipasangkan dengan anotasi penalaran bertahap (Chain-of-Thought… See the full description on the dataset page: https://huggingface.co/datasets/DahonoLabs/Indonesian-Legal-Vision.indonesian-qa
Indonesian Q&A Dataset
735 pertanyaan-jawaban pengetahuan umum dalam bahasa Indonesia. Topiknya nyebar: geografi, sejarah, sains, budaya, teknologi, olahraga, makanan, sampai ekonomi.
Kenapa dibuat
Model open-source bagus banget buat bahasa Inggris, tapi sering kagok kalau ditanya hal-hal seputar Indonesia. Dataset ini coba isi celah itu dengan QA yang faktual dan jawaban yang agak panjang (2-4 kalimat), bukan cuma satu baris doang.
Struktur data… See the full description on the dataset page: https://huggingface.co/datasets/LorthGyu/indonesian-qa.indonesian-slang-lexicon
Kamus Bahasa Gaul Indonesia 🇮🇩
Kumpulan 520 istilah bahasa gaul Indonesia yang dipakai anak muda sehari-hari — lengkap dengan arti, contoh kalimat, dan tingkat formalitas.
Kenapa dataset ini ada?
Model bahasa Indonesia biasanya cuma diajarin bahasa baku. Padahal orang Indonesia ngobrol pakai bahasa gaul: "bre", "gabut", "baper", "mager", "wkwk". Kalau model ga paham istilah ini, percakapannya kedengeran kaku — kayak teks terjemahan.
Dataset ini ngisi gap itu:… See the full description on the dataset page: https://huggingface.co/datasets/LorthGyu/indonesian-slang-lexicon.indonesian-emotion
Emosi Bahasa Indonesia 💢
Dataset klasifikasi emosi berbahasa Indonesia — 267 teks natural dengan label 7 emosi + intensitas + konteks.
Kenapa dataset ini ada?
Sentiment analysis Bahasa Indonesia ada, tapi emotion classification (7 emosi) belum ada di HF. Sentiment cuma bilang positif/negatif/netral — emosi lebih dalam: marah vs jijik vs takut itu beda, dan buat chatbot/analisis medsos, label emosi jauh lebih berguna.
Isi
Field
Tipe
Contoh… See the full description on the dataset page: https://huggingface.co/datasets/LorthGyu/indonesian-emotion.indonesian-chat
Indonesian Chat Conversations Dataset
476 percakapan multi-turn bahasa Indonesia yang natural. Gaya bahasanya campur: casual (pake slang "bre", "gw", "lu", "wkwk"), formal, dan campuran.
Kenapa dibuat
Masalah umum model bahasa Indonesia: keliatan banget kalau itu hasil translate. Ngomongnya kaku, ga pake bahasa sehari-hari. Dataset ini fokus ke percakapan yang kedengeran kayak orang Indonesia beneran ngobrol — termasuk yang pake bahasa gaul.
Struktur… See the full description on the dataset page: https://huggingface.co/datasets/LorthGyu/indonesian-chat.indonesian-formalization
Formalisasi Bahasa Indonesia 🇮🇩
Kumpulan 99 pasangan kalimat informal → formal bahasa Indonesia. Buat model yang bisa ngalihin gaya bahasa: dari ngobrol santai ("gw lagi gabut nih") ke bahasa formal ("saya sedang tidak ada kegiatan").
Kenapa dataset ini ada?
Satu model yang bisa dua gaya itu penting buat banyak use-case: customer service, dokumen resmi, email kerja. Model yang cuma diajarin bahasa santai bakal kaku pas disuruh bikin surat resmi — dan sebaliknya.… See the full description on the dataset page: https://huggingface.co/datasets/LorthGyu/indonesian-formalization.indonesian-idioms
Idiom & Ungkapan Bahasa Indonesia 🗯️
Kumpulan 172 idiom/ungkapan khas Indonesia — dari "banting setir" sampai "gulung tikar", lengkap dengan makna harfiah (kocak), makna kiasan, dan contoh pemakaian.
Kenapa dataset ini ada?
LLM sering gagal paham bahasa kiasan — "cuci tangan" bukan soal mencuci. Dataset idiom Indonesia di HF belum ada (cuma Korea/Norwegia/China). Ini yang pertama: 172 ungkapan yang beneran dipakai orang Indonesia sehari-hari.
Isi… See the full description on the dataset page: https://huggingface.co/datasets/LorthGyu/indonesian-idioms.indonesian_news_datasets
Indonesian News Datasets
This dataset is a modification from dataset repo iqballx/indonesian_news_datasets. Column label is added with these categories:
POLITIK_PEMERINTAHAN
EKONOMI_BISNIS
HUKUM_KRIMINAL
OLAHRAGA
TEKNOLOGI_DIGITAL
BENCANA_LINGKUNGAN
The label is created using prompt to LLM Qwen/Qwen3-30B-A3B-Instruct-2507-FP8.
Disclaimer: The resulted label has not been currated and just received as is from LLM.
The dataset compiles information from seven prominent… See the full description on the dataset page: https://huggingface.co/datasets/fahadh4ilyas/indonesian_news_datasets.indonesian-numbers-expressions
Ungkapan Angka Indonesia 🔢
Angka ga cuma buat hitung — di bahasa Indonesia, angka jadi bagian idiom. Setengah hati, dua muka, seribu satu alasan. Dataset ini ngumpulin ungkapan-ungkapan angka yang dipakai orang Indonesia sehari-hari.
Kenapa dataset ini ada?
LLM sering salah artiin ungkapan angka secara literal — dua muka bukan dua wajah, setengah hati bukan separuh jantung. Dataset ini bantu model paham makna kiasan. Belum ada dataset ungkapan angka bahasa… See the full description on the dataset page: https://huggingface.co/datasets/LorthGyu/indonesian-numbers-expressions.indonesian-jokes
Tebak-Tebakan & Jokes Indonesia 😂
Kumpulan 246 tebak-tebakan & jokes Indonesia — dari klasik sampai bapak-bapak jokes, pantun lucu, dark jokes ringan.
Kenapa dataset ini ada?
Humor adalah ujian tertinggi natural language — LLM yang bisa bikin orang Indonesia ketawa berarti paham konteks budaya. Dataset humor Indonesia di HF belum ada; ini yang pertama.
Isi
Field
Tipe
Contoh
setup
string
"Kenapa ayam kalau berkokok matanya merem?"… See the full description on the dataset page: https://huggingface.co/datasets/LorthGyu/indonesian-jokes.Arxiv_ph_indonesia
