fabhiansan/XSUM-Indonesia-AMR-NLI
XSUM-Indonesia-AMR-NLI Deskripsi Dataset ini berisi kumpulan data dalam bahasa Indonesia yang dirancang untuk tugas Natural Language Inference (NLI). Setiap instans data terdiri dari teks sumber (source_text) yang ada pada dataset XSum teks yang dihasilkan (generated_indonesian yang berfungsi sebagai hipotesis dibuat dari AMR Perturbasi) skor (score) yang menunjukkan hubungan antara keduanya (0 untuk non-entailment, 1 untuk entailment). ringkasan asli… See the full description on the dataset page: https://huggingface.co/datasets/fabhiansan/XSUM-Indonesia-AMR-NLI.
XSUM-Indonesia-AMR-NLI
Deskripsi
Dataset ini berisi kumpulan data dalam bahasa Indonesia yang dirancang untuk tugas Natural Language Inference (NLI).
Setiap instans data terdiri dari
- teks sumber (
source_text) yang ada pada dataset XSum - teks yang dihasilkan (
generated_indonesianyang berfungsi sebagai hipotesis dibuat dari AMR Perturbasi) - skor (
score) yang menunjukkan hubungan antara keduanya (0 untuk non-entailment, 1 untuk entailment). - ringkasan asli (
target_summary) ringkasan asli yang ada pada dataset XSum
Bahasa: Indonesia (id)
Tugas: Natural Language Inference (NLI) Biner - 1 ringkasan faktual, dan 0 ringkasan memiliki halusinasi
Contoh Data
{
"id": "item_2546_perturbed_10",
"amr": "(z0 \\/ maaf-01\\n :ARG1 (z1 \\/ perusahaan\\n :wiki \\"TripAdvisor\\"\\n :name (z2 \\/ nama\\n :op1 \\"TripAdvisor\\")\\n :mod (z3 \\/ Situs))\\n :ARG2 (z4 \\/ keluar-01\\n :ARG0 (z5 \\/ dia)\\n :ARG1 (z6 \\/ sesuatu\\n :topic (z8 \\/ kosan-01\\n :ARG1-of (z9 \\/ alam-01\\n :ARG0 z5\\n :setelah (z10 \\/ liburan)))\\n :ARG1-of (z7 \\/ laporan-01)\\n :ARG1-of (z11 \\/ tulis-01\\n :ARG2 (z12 \\/ laman\\n :poss z5)))))",
"score": 0,
"perturbation_type": "discourse",
"source_text": "Situs wisata TripAdvisor meminta maaf karena menghapus beberapa kesaksian sejumlah perempuan yang diperkosa selama liburan.\\n\\nBerbagai laporan menyebut akun para perempuan yang melaporkan beragam serangan seksual di situs tersebut diduga telah dihapus.\\n\\n...",
"title": "Hapus kesaksian korban perkosaan selama liburan, situs wisata TripAdvisor minta maaf",
"target_summary": "Situs wisata TripAdvisor meminta maaf karena menghapus laporan perkosan yang dialami saat liburan yang ditulis di lamannya.",
"summary_amr": "# ::id 6\\n# ::snt Situs wisata TripAdvisor meminta maaf karena menghapus laporan perkosan yang dialami saat liburan yang ditulis di lamannya.\\n(z0 \\/ maaf-01\\n :ARG1 (z1 \\/ perusahaan\\n :wiki \\"TripAdvisor\\"\\n :name (z2 \\/ nama\\n :op1 \\"TripAdvisor\\")\\n :mod (z3 \\/ Situs))\\n :ARG2 (z4 \\/ keluar-01\\n :ARG0 (z5 \\/ dia)\\n :ARG1 (z6 \\/ sesuatu\\n :ARG1-of (z7 \\/ laporan-01)\\n :topic (z8 \\/ kosan-01\\n :ARG1-of (z9 \\/ alam-01\\n :ARG0 z5\\n :time (z10 \\/ liburan)))\\n :ARG1-of (z11 \\/ tulis-01\\n :ARG2 (z12 \\/ laman\\n :poss z5)))))",
"generated_indonesian": "Situs resmi TripAdvisor meminta maaf karena mengeluarkan laporan tentang kosan yang ia alami setelah liburan, seperti tertulis di laman situsnya.",
"changelog": "['{\'type\': \'discourse_error\', \'subtype\': \'swap_temporal\', \'old_relation\': \':time\', \'new_relation\': \':setelah\', \'nodes\': [\'z9\', \'z10\'], \'perturber\': \'discourse\'}']"
}
Kelas pada dataset ini tidak berimbang, gunakan pembobotan atau duplikasi untuk memastikan model tidak malas
Positif (1) : 9561 data
Negatif (0) : 24028 data