CoolFace
Datasetpublic

shouwiku/detectai-indonesian

DETECTAI: Indonesian Academic Text Dataset Dataset ini disusun dan dikurasi secara khusus untuk mendukung penelitian skripsi program studi Sistem Informasi Universitas Bandar Lampung tahun 2026 dengan judul: "Sistem Deteksi Teks Generatif AI Menggunakan Metode Hybrid TF-IDF Dan Stylometry Berbasis Logistic Regression" Deskripsi Dataset Dataset ini dirancang secara seimbang (balanced dataset) untuk melatih model klasifikasi biner guna membedakan antara dokumen… See the full description on the dataset page: https://huggingface.co/datasets/shouwiku/detectai-indonesian.

sourceHugging Facemitupdated 3mo agoView on Hugging Face
0likes16downloads
Dataset Card

DETECTAI: Indonesian Academic Text Dataset

Dataset ini disusun dan dikurasi secara khusus untuk mendukung penelitian skripsi program studi Sistem Informasi Universitas Bandar Lampung tahun 2026 dengan judul: "Sistem Deteksi Teks Generatif AI Menggunakan Metode Hybrid TF-IDF Dan Stylometry Berbasis Logistic Regression"

Deskripsi Dataset

Dataset ini dirancang secara seimbang (balanced dataset) untuk melatih model klasifikasi biner guna membedakan antara dokumen akademik asli buatan manusia dan teks hasil sintesis kecerdasan buatan (Large Language Models) dalam bahasa Indonesia.

  • —Total Baris Data: 2.240 baris data seimbang
  • —Rasio Kelas: 1 banding 1 (1.120 rekor kelas manusia dan 1.120 rekor kelas AI)
  • —Format Berkas: CSV (Comma-Separated Values)

Sumber Data (Data Sourcing)

  1. 1.Kelas Manusia (Label 0): Diekstraksi dari bagian ringkasan dokumen ilmiah pada ensiklopedia terbuka Wikipedia Bahasa Indonesia yang merepresentasikan penulisan formal, objektif, dan memiliki standar editorial tinggi.
  1. 1.Kelas AI (Label 1): Disintesis menggunakan model bahasa besar Google Gemma 4 melalui pemanggilan API asinkron dengan konfigurasi temperatur 0,8 untuk variasi gaya kepenulisan.

Struktur Data

Berkas dataset utama (dataset.csv) memiliki kolom-kolom sebagai berikut:

  • —text: Naskah dokumen akademik berbahasa Indonesia (panjang berkisar antara 25 hingga 225 kata).
  • —label: Label biner penanda keaslian dokumen:
  • —Nilai 0: Human Written (Wikipedia)
  • —Nilai 1: AI Generated (Gemma 4)

Informasi Kontak dan Sitasi

Jika Anda menggunakan dataset ini dalam penelitian akademis, harap mencantumkan sitasi sebagai berikut:

Kusuma, M. J. (2026). Sistem Deteksi Teks Generatif AI Menggunakan Metode Hybrid TF-IDF Dan Stylometry Berbasis Logistic Regression (Skripsi, Universitas Bandar Lampung). Repositori Dataset DETECTAI Hugging Face.