CoolFace
Datasetpublic

fabhiansan/XSUM-Indonesia-AMR-NLI

XSUM-Indonesia-AMR-NLI Deskripsi Dataset ini berisi kumpulan data dalam bahasa Indonesia yang dirancang untuk tugas Natural Language Inference (NLI). Setiap instans data terdiri dari teks sumber (source_text) yang ada pada dataset XSum teks yang dihasilkan (generated_indonesian yang berfungsi sebagai hipotesis dibuat dari AMR Perturbasi) skor (score) yang menunjukkan hubungan antara keduanya (0 untuk non-entailment, 1 untuk entailment). ringkasan asli… See the full description on the dataset page: https://huggingface.co/datasets/fabhiansan/XSUM-Indonesia-AMR-NLI.

sourceHugging Faceupdated 1y agoView on Hugging Face
0likes26downloads
Dataset Card

XSUM-Indonesia-AMR-NLI

Deskripsi

Dataset ini berisi kumpulan data dalam bahasa Indonesia yang dirancang untuk tugas Natural Language Inference (NLI).

Setiap instans data terdiri dari

  • —teks sumber (source_text) yang ada pada dataset XSum
  • —teks yang dihasilkan (generated_indonesian yang berfungsi sebagai hipotesis dibuat dari AMR Perturbasi)
  • —skor (score) yang menunjukkan hubungan antara keduanya (0 untuk non-entailment, 1 untuk entailment).
  • —ringkasan asli (target_summary) ringkasan asli yang ada pada dataset XSum

Bahasa: Indonesia (id)

Tugas: Natural Language Inference (NLI) Biner - 1 ringkasan faktual, dan 0 ringkasan memiliki halusinasi

Contoh Data

json
{
  "id": "item_2546_perturbed_10",
  "amr": "(z0 \\/ maaf-01\\n    :ARG1 (z1 \\/ perusahaan\\n              :wiki \\"TripAdvisor\\"\\n              :name (z2 \\/ nama\\n                        :op1 \\"TripAdvisor\\")\\n              :mod (z3 \\/ Situs))\\n    :ARG2 (z4 \\/ keluar-01\\n              :ARG0 (z5 \\/ dia)\\n              :ARG1 (z6 \\/ sesuatu\\n                        :topic (z8 \\/ kosan-01\\n                                   :ARG1-of (z9 \\/ alam-01\\n                                                :ARG0 z5\\n                                                :setelah (z10 \\/ liburan)))\\n                        :ARG1-of (z7 \\/ laporan-01)\\n                        :ARG1-of (z11 \\/ tulis-01\\n                                      :ARG2 (z12 \\/ laman\\n                                                 :poss z5)))))",
  "score": 0,
  "perturbation_type": "discourse",
  "source_text": "Situs wisata TripAdvisor meminta maaf karena menghapus beberapa kesaksian sejumlah perempuan yang diperkosa selama liburan.\\n\\nBerbagai laporan menyebut akun para perempuan yang melaporkan beragam serangan seksual di situs tersebut diduga telah dihapus.\\n\\n...",
  "title": "Hapus kesaksian korban perkosaan selama liburan, situs wisata TripAdvisor minta maaf",
  "target_summary": "Situs wisata TripAdvisor meminta maaf  karena menghapus laporan perkosan yang dialami saat liburan yang ditulis di lamannya.",
  "summary_amr": "# ::id 6\\n# ::snt Situs wisata TripAdvisor meminta maaf  karena menghapus laporan perkosan yang dialami saat liburan yang ditulis di lamannya.\\n(z0 \\/ maaf-01\\n    :ARG1 (z1 \\/ perusahaan\\n              :wiki \\"TripAdvisor\\"\\n              :name (z2 \\/ nama\\n                        :op1 \\"TripAdvisor\\")\\n              :mod (z3 \\/ Situs))\\n    :ARG2 (z4 \\/ keluar-01\\n              :ARG0 (z5 \\/ dia)\\n              :ARG1 (z6 \\/ sesuatu\\n                        :ARG1-of (z7 \\/ laporan-01)\\n                        :topic (z8 \\/ kosan-01\\n                                   :ARG1-of (z9 \\/ alam-01\\n                                                :ARG0 z5\\n                                                :time (z10 \\/ liburan)))\\n                        :ARG1-of (z11 \\/ tulis-01\\n                                      :ARG2 (z12 \\/ laman\\n                                                 :poss z5)))))",
  "generated_indonesian": "Situs resmi TripAdvisor meminta maaf karena mengeluarkan laporan tentang kosan yang ia alami setelah liburan, seperti tertulis di laman situsnya.",
  "changelog": "['{\'type\': \'discourse_error\', \'subtype\': \'swap_temporal\', \'old_relation\': \':time\', \'new_relation\': \':setelah\', \'nodes\': [\'z9\', \'z10\'], \'perturber\': \'discourse\'}']"
}

Kelas pada dataset ini tidak berimbang, gunakan pembobotan atau duplikasi untuk memastikan model tidak malas

Positif (1) : 9561 data
Negatif (0) : 24028 data