CoolFace
Datasetpublic

thangvip/combined-vietnamese-legal-text

thangvip/combined-vietnamese-legal-text Dataset Description This is a combined Vietnamese legal dataset with question-answer pairs formatted in a single text column. It combines two datasets: thangvip/vietnamese-legal-qa (9,715 examples) thangvip/law-reading-comprehension-qa-filtered (205,369 examples) Dataset Structure Data Fields text: Combined text containing legal content followed by question-answer pairs in XML-like format… See the full description on the dataset page: https://huggingface.co/datasets/thangvip/combined-vietnamese-legal-text.

sourceHugging Faceupdated 1y agoView on Hugging Face
1likes49downloads
Dataset Card

thangvip/combined-vietnamese-legal-text

Dataset Description

This is a combined Vietnamese legal dataset with question-answer pairs formatted in a single text column. It combines two datasets:

  1. 1.thangvip/vietnamese-legal-qa (9,715 examples)
  2. 2.thangvip/law-reading-comprehension-qa-filtered (205,369 examples)

Dataset Structure

Data Fields

  • —text: Combined text containing legal content followed by question-answer pairs in XML-like format

Format Examples

From vietnamese-legal-qa:

{doc_name}

{article_content}

<question>{question_text}</question>
<answer>{answer_text}</answer>

<question>{next_question}</question>
<answer>{next_answer}</answer>

From law-reading-comprehension-qa-filtered:

{citation}
{content}

<question>{question_text}</question>
<answer>{answer_text}</answer>

Data Statistics

  • —Total examples: 215,084
  • —Language: Vietnamese
  • —Domain: Legal documents
  • —Format: Single text column with embedded Q&A

Usage

python
from datasets import load_dataset

# Load the dataset
dataset = load_dataset("thangvip/combined-vietnamese-legal-text")

# Access a sample
sample = dataset['train'][0]
print(sample['text'])

Original Sources

License

This dataset combines content from the original datasets. Please refer to the original dataset licenses.