CoolFace
Datasetpublic

hungminhss/tdtu-student-regulations-qa

TDTU Vietnamese University Regulations QA Dataset Dataset Description Tập dữ liệu hỏi-đáp tiếng Việt về quy chế, quy định sinh viên của Trường Đại học Tôn Đức Thắng (TDTU), được xây dựng cho bài toán Retrieval-Augmented Generation (RAG) và fine-tuning LLM tư vấn sinh viên. Ngôn ngữ: Tiếng Việt Domain: Quy chế đại học, chính sách sinh viên Mục đích: Huấn luyện chatbot tư vấn sinh viên TDTU Dataset Details Dataset Sources… See the full description on the dataset page: https://huggingface.co/datasets/hungminhss/tdtu-student-regulations-qa.

sourceHugging Facecc-by-nc-4.0updated 5mo agoView on Hugging Face
1likes86downloads
Dataset Card

TDTU Vietnamese University Regulations QA Dataset

<span align="left"> <img src="https://img.shields.io/badge/Language-Vietnamese-blue" /> <img src="https://img.shields.io/badge/Domain-University%20Regulations-orange" /> <img src="https://img.shields.io/badge/Task-Open%20Domain%20QA-green" /> <img src="https://img.shields.io/badge/License-CC%20BY--NC%204.0-lightgrey" /> </span>

Dataset Description

Tập dữ liệu hỏi-đáp tiếng Việt về quy chế, quy định sinh viên của Trường Đại học Tôn Đức Thắng (TDTU), được xây dựng cho bài toán Retrieval-Augmented Generation (RAG)fine-tuning LLM tư vấn sinh viên.

  • Ngôn ngữ: Tiếng Việt
  • Domain: Quy chế đại học, chính sách sinh viên
  • Mục đích: Huấn luyện chatbot tư vấn sinh viên TDTU

Dataset Details

Dataset Sources

File nguồnNội dung
Quy chế Công tác sinh viênKỷ luật, quyền lợi, nghĩa vụ sinh viên
Hướng dẫn học bổngĐiều kiện, mức xét cấp học bổng các loại
Quy chế tổ chức và quản lý đào tạoTín chỉ, đăng ký môn, xét tốt nghiệp
Quy chế đánh giá kết quả rèn luyệnThang điểm rèn luyện, phân loại
PHỤ LỤC vi phạmHành vi vi phạm và hình thức xử lý
QĐ số 22 đạo vănQuy định kiểm soát và xử lý đạo văn
Bộ Quy tắc ứng xửQuy tắc giao tiếp, ứng xử người học
... (20 văn bản tổng cộng)...

Uses

Direct Use

python
from datasets import load_dataset

ds = load_dataset("hungminhss/tdtu-student-regulations-qa")

# Xem mẫu
print(ds["train"][0])
# {
#   "question": "Sinh viên cần đáp ứng những điều kiện gì để được xét học bổng khuyến khích học tập?",
#   "answer": "Theo quy định của TDTU, sinh viên cần đáp ứng đồng thời các điều kiện: ...",
#   "source_file": "Hướng dẫn học bổng, khen thưởng...",
#   ...
# }

Out-of-Scope Use

  • Không dùng cho mục đích thương mại
  • Câu trả lời chỉ phản ánh quy định tại thời điểm thu thập (2024–2026); cần cập nhật theo quy định mới nhất của TDTU

Dataset Structure

Data Fields

FieldTypeMô tả
idstringID duy nhất của cặp QA (vd: qa_0001, qa_test_0001)
questionstringCâu hỏi tiếng Việt, đa dạng kiểu (điều kiện, thủ tục, hậu quả...)
answerstringCâu trả lời đầy đủ, chính xác theo văn bản quy chế
source_filestringTên file văn bản gốc
chunk_idstringID của child chunk dùng để retrieval
parent_chunk_idstringID của parent chunk (đơn vị ngữ nghĩa trọn vẹn)
splitstringtrain hoặc test
human_verifiedbooltrue nếu đã được kiểm tra thủ công

Data Splits

SplitSố cặpGhi chú
train117480% stratified theo source file
test28420% stratified; kiểm tra thủ công

Dataset Creation

Curation Rationale

Dataset được xây dựng phục vụ đề tài cuối kỳ môn Nhập môn Xử lý Ngôn ngữ Tự nhiên (504045) — Topic 1: Hệ thống hỏi-đáp tiếng Việt sử dụng RAG + LLM Fine-tuning.

Source Data

Thu thập: 20 văn bản quy chế TDTU (định dạng .txt), tổng ~419 KB.

Chunking pipeline:

  1. 1.\n\n paragraph split → parent chunks (nguyên vẹn ngữ nghĩa)
  2. 2.Mechanical split (bảng, bullet, sentence) → child chunks (80–800 ký tự, phù hợp embedding)
  3. 3.LLM metadata labeling (title + summary) dùng DeepSeek-V3

QA generation:

  • Model: deepseek-chat (DeepSeek-V3)
  • Sinh từ parent chunks (không từ child chunks) → câu trả lời đầy đủ, không bị cắt xén
  • Đa dạng kiểu câu hỏi: [Điều kiện], [Thủ tục], [Thời hạn], [Hậu quả], [Tình huống], [Xác nhận], [So sánh]
  • Temperature: 0.85 để tăng tính đa dạng

Filtering:

  • Loại cặp có câu hỏi < 10 ký tự hoặc câu trả lời < 20 ký tự
  • Loại cặp có trigram overlap < 2 giữa câu trả lời và văn bản gốc
  • Dedup bằng cosine similarity (threshold 0.92) dùng bkai-foundation-models/vietnamese-bi-encoder

Annotations

Test set (≥50 cặp) được kiểm tra thủ công theo 5 tiêu chí:

  • Accuracy (1–5): Câu trả lời đúng với quy định
  • Completeness (1–5): Đầy đủ thông tin cần thiết
  • Fluency (1–5): Ngôn ngữ tự nhiên, dễ hiểu
  • Conciseness (1–5): Không dài dòng, đúng trọng tâm
  • No-Hallucination (1–5): Không bịa đặt thông tin

Bias, Risks, and Limitations

  • Chỉ bao gồm quy chế TDTU — không áp dụng cho các trường khác
  • Câu trả lời do LLM sinh có thể có lỗi nhỏ; khuyến nghị dùng RAG để retrieve văn bản gốc khi deploy
  • Quy định có thể thay đổi theo năm học; cần cập nhật định kỳ

Citation

bibtex
@misc{tdtu-qa-dataset-2025,
  title  = {TDTU Vietnamese University Regulations QA Dataset},
  author = {Hoàng Sinh Hùng},
  year   = {2026},
  note   = {Dùng cho mục đích nghiên cứu và học thuật}
}