thangvip/combined-vietnamese-legal-text
thangvip/combined-vietnamese-legal-text Dataset Description This is a combined Vietnamese legal dataset with question-answer pairs formatted in a single text column. It combines two datasets: thangvip/vietnamese-legal-qa (9,715 examples) thangvip/law-reading-comprehension-qa-filtered (205,369 examples) Dataset Structure Data Fields text: Combined text containing legal content followed by question-answer pairs in XML-like format… See the full description on the dataset page: https://huggingface.co/datasets/thangvip/combined-vietnamese-legal-text.
thangvip/combined-vietnamese-legal-text
Dataset Description
This is a combined Vietnamese legal dataset with question-answer pairs formatted in a single text column. It combines two datasets:
- thangvip/vietnamese-legal-qa (9,715 examples)
- thangvip/law-reading-comprehension-qa-filtered (205,369 examples)
Dataset Structure
Data Fields
text: Combined text containing legal content followed by question-answer pairs in XML-like format
Format Examples
From vietnamese-legal-qa:
{doc_name}
{article_content}
<question>{question_text}</question>
<answer>{answer_text}</answer>
<question>{next_question}</question>
<answer>{next_answer}</answer>From law-reading-comprehension-qa-filtered:
{citation}
{content}
<question>{question_text}</question>
<answer>{answer_text}</answer>Data Statistics
- Total examples: 215,084
- Language: Vietnamese
- Domain: Legal documents
- Format: Single text column with embedded Q&A
Usage
from datasets import load_dataset
# Load the dataset
dataset = load_dataset("thangvip/combined-vietnamese-legal-text")
# Access a sample
sample = dataset['train'][0]
print(sample['text'])Original Sources
License
This dataset combines content from the original datasets. Please refer to the original dataset licenses.
