vnhkhwa/vmad_v1.0
🩺 VMAD-300K: Verified Medical AI Dataset (Song ngữ Việt - Anh) VMAD-300K là bộ dữ liệu y khoa song ngữ (Tiếng Việt - Tiếng Anh) chất lượng cao gồm 324,042 cặp câu hỏi - đáp, tóm tắt lâm sàng và hướng dẫn sử dụng thuốc được kiểm duyệt tự động 2 lớp (2-Layer Verification System). Bộ dữ liệu được thiết kế đặc biệt để Supervised Fine-Tuning (SFT) các dòng mô hình ngôn ngữ lớn (LLM) trong lĩnh vực Y tế như Qwen 2.5 (0.5B - 14B), LLaMA 3.1, Gemma 2, Mistral. 📊 Thống kê… See the full description on the dataset page: https://huggingface.co/datasets/vnhkhwa/vmad_v1.0.
093
