decoyy/tdtu-student-qa
TDTU Student Assistant QA Dataset Bộ dữ liệu hỏi đáp (1.500 cặp câu hỏi - câu trả lời) về Quy chế Đào tạo và Công tác Sinh viên Trường Đại học Tôn Đức Thắng (TDTU). Bộ dữ liệu được xây dựng để phục vụ huấn luyện (Supervised Fine-Tuning) và đánh giá đối sánh hệ sinh thái RAG (Retrieval-Augmented Generation). GitHub Repository: DongKhoiDev/tdtu-student-assistant Tác giả: Trần Nhựt Đông Khởi (DongKhoiDev) 📊 Cấu trúc tập dữ liệu (Dataset Structure) Tập… See the full description on the dataset page: https://huggingface.co/datasets/decoyy/tdtu-student-qa.
TDTU Student Assistant QA Dataset
Bộ dữ liệu hỏi đáp (1.500 cặp câu hỏi - câu trả lời) về Quy chế Đào tạo và Công tác Sinh viên Trường Đại học Tôn Đức Thắng (TDTU). Bộ dữ liệu được xây dựng để phục vụ huấn luyện (Supervised Fine-Tuning) và đánh giá đối sánh hệ sinh thái RAG (Retrieval-Augmented Generation).
- GitHub Repository: DongKhoiDev/tdtu-student-assistant
- Tác giả: Trần Nhựt Đông Khởi (DongKhoiDev)
📊 Cấu trúc tập dữ liệu (Dataset Structure)
Các trường dữ liệu (Fields):
id: Mã định danh duy nhất của câu hỏi.category: Nhóm quy chế (học bổng, học vụ, rèn luyện, chuẩn đầu ra...).question: Câu hỏi thực tế của sinh viên.answer: Câu trả lời chuẩn xác dựa trên văn bản quy chế.source: Tên tài liệu/văn bản quy chế gốc (VD: Hướng dẫn học bổng, khen thưởng...).article: Điều khoản liên quan trong văn bản.gold_chunk_ids: Danh sách ID các đoạn văn bản (chunks) chứa thông tin đối chiếu chuẩn (Ground Truth).
💻 Cách tải và sử dụng (Usage)
Sử dụng thư viện datasets của Hugging Face:
from datasets import load_dataset
# Tải toàn bộ dataset (train, validation, test)
dataset = load_dataset("decoyy/tdtu-student-qa")
print(dataset["train"][0])