hungminhss/tdtu-student-regulations-qa
TDTU Vietnamese University Regulations QA Dataset Dataset Description Tập dữ liệu hỏi-đáp tiếng Việt về quy chế, quy định sinh viên của Trường Đại học Tôn Đức Thắng (TDTU), được xây dựng cho bài toán Retrieval-Augmented Generation (RAG) và fine-tuning LLM tư vấn sinh viên. Ngôn ngữ: Tiếng Việt Domain: Quy chế đại học, chính sách sinh viên Mục đích: Huấn luyện chatbot tư vấn sinh viên TDTU Dataset Details Dataset Sources… See the full description on the dataset page: https://huggingface.co/datasets/hungminhss/tdtu-student-regulations-qa.
TDTU Vietnamese University Regulations QA Dataset
<span align="left"> <img src="https://img.shields.io/badge/Language-Vietnamese-blue" /> <img src="https://img.shields.io/badge/Domain-University%20Regulations-orange" /> <img src="https://img.shields.io/badge/Task-Open%20Domain%20QA-green" /> <img src="https://img.shields.io/badge/License-CC%20BY--NC%204.0-lightgrey" /> </span>
Dataset Description
Tập dữ liệu hỏi-đáp tiếng Việt về quy chế, quy định sinh viên của Trường Đại học Tôn Đức Thắng (TDTU), được xây dựng cho bài toán Retrieval-Augmented Generation (RAG) và fine-tuning LLM tư vấn sinh viên.
- Ngôn ngữ: Tiếng Việt
- Domain: Quy chế đại học, chính sách sinh viên
- Mục đích: Huấn luyện chatbot tư vấn sinh viên TDTU
Dataset Details
Dataset Sources
Uses
Direct Use
from datasets import load_dataset
ds = load_dataset("hungminhss/tdtu-student-regulations-qa")
# Xem mẫu
print(ds["train"][0])
# {
# "question": "Sinh viên cần đáp ứng những điều kiện gì để được xét học bổng khuyến khích học tập?",
# "answer": "Theo quy định của TDTU, sinh viên cần đáp ứng đồng thời các điều kiện: ...",
# "source_file": "Hướng dẫn học bổng, khen thưởng...",
# ...
# }Out-of-Scope Use
- Không dùng cho mục đích thương mại
- Câu trả lời chỉ phản ánh quy định tại thời điểm thu thập (2024–2026); cần cập nhật theo quy định mới nhất của TDTU
Dataset Structure
Data Fields
Data Splits
Dataset Creation
Curation Rationale
Dataset được xây dựng phục vụ đề tài cuối kỳ môn Nhập môn Xử lý Ngôn ngữ Tự nhiên (504045) — Topic 1: Hệ thống hỏi-đáp tiếng Việt sử dụng RAG + LLM Fine-tuning.
Source Data
Thu thập: 20 văn bản quy chế TDTU (định dạng .txt), tổng ~419 KB.
Chunking pipeline:
\n\nparagraph split → parent chunks (nguyên vẹn ngữ nghĩa)- Mechanical split (bảng, bullet, sentence) → child chunks (80–800 ký tự, phù hợp embedding)
- LLM metadata labeling (title + summary) dùng DeepSeek-V3
QA generation:
- Model:
deepseek-chat(DeepSeek-V3) - Sinh từ parent chunks (không từ child chunks) → câu trả lời đầy đủ, không bị cắt xén
- Đa dạng kiểu câu hỏi: [Điều kiện], [Thủ tục], [Thời hạn], [Hậu quả], [Tình huống], [Xác nhận], [So sánh]
- Temperature: 0.85 để tăng tính đa dạng
Filtering:
- Loại cặp có câu hỏi < 10 ký tự hoặc câu trả lời < 20 ký tự
- Loại cặp có trigram overlap < 2 giữa câu trả lời và văn bản gốc
- Dedup bằng cosine similarity (threshold 0.92) dùng
bkai-foundation-models/vietnamese-bi-encoder
Annotations
Test set (≥50 cặp) được kiểm tra thủ công theo 5 tiêu chí:
- Accuracy (1–5): Câu trả lời đúng với quy định
- Completeness (1–5): Đầy đủ thông tin cần thiết
- Fluency (1–5): Ngôn ngữ tự nhiên, dễ hiểu
- Conciseness (1–5): Không dài dòng, đúng trọng tâm
- No-Hallucination (1–5): Không bịa đặt thông tin
Bias, Risks, and Limitations
- Chỉ bao gồm quy chế TDTU — không áp dụng cho các trường khác
- Câu trả lời do LLM sinh có thể có lỗi nhỏ; khuyến nghị dùng RAG để retrieve văn bản gốc khi deploy
- Quy định có thể thay đổi theo năm học; cần cập nhật định kỳ
Citation
@misc{tdtu-qa-dataset-2025,
title = {TDTU Vietnamese University Regulations QA Dataset},
author = {Hoàng Sinh Hùng},
year = {2026},
note = {Dùng cho mục đích nghiên cứu và học thuật}
}