CoolFace
Datasetpublic

vnhkhwa/vmad_v1.0

🩺 VMAD-300K: Verified Medical AI Dataset (Song ngữ Việt - Anh) VMAD-300K là bộ dữ liệu y khoa song ngữ (Tiếng Việt - Tiếng Anh) chất lượng cao gồm 324,042 cặp câu hỏi - đáp, tóm tắt lâm sàng và hướng dẫn sử dụng thuốc được kiểm duyệt tự động 2 lớp (2-Layer Verification System). Bộ dữ liệu được thiết kế đặc biệt để Supervised Fine-Tuning (SFT) các dòng mô hình ngôn ngữ lớn (LLM) trong lĩnh vực Y tế như Qwen 2.5 (0.5B - 14B), LLaMA 3.1, Gemma 2, Mistral. 📊 Thống kê… See the full description on the dataset page: https://huggingface.co/datasets/vnhkhwa/vmad_v1.0.

sourceHugging Facemitupdated 2mo agoView on Hugging Face
0likes96downloads
Dataset Card

🩺 VMAD-300K: Verified Medical AI Dataset (Song ngữ Việt - Anh)

VMAD-300K là bộ dữ liệu y khoa song ngữ (Tiếng Việt - Tiếng Anh) chất lượng cao gồm 324,042 cặp câu hỏi - đáp, tóm tắt lâm sàng và hướng dẫn sử dụng thuốc được kiểm duyệt tự động 2 lớp (2-Layer Verification System).

Bộ dữ liệu được thiết kế đặc biệt để Supervised Fine-Tuning (SFT) các dòng mô hình ngôn ngữ lớn (LLM) trong lĩnh vực Y tế như Qwen 2.5 (0.5B - 14B), LLaMA 3.1, Gemma 2, Mistral.


📊 Thống kê Bộ Dữ Liệu (Dataset Overview)

  • —Tổng số mẫu (Total Pairs): 324,042
  • —Dung lượng (Disk Size): 1.69 GB (JSONL)
  • —Điểm chất lượng trung bình (Avg Quality Score): 9.84 / 10.0
  • —Tỷ lệ đạt chuẩn (Pass Rate): 100.0%
  • —Tỷ lệ Tiếng Việt (Vietnamese Prompt Ratio): 100.0%

Phân bổ loại dữ liệu (Data Type Distribution)

  • —Clinical Summarization (Tóm tắt lâm sàng & Nghiên cứu): 40.0% (129,516 mẫu)
  • —Medical QA (Hỏi đáp y khoa chuyên sâu): 40.0% (129,674 mẫu)
  • —Drug Instruction (Hướng dẫn dùng thuốc): 19.9% (64,432 mẫu)

🚀 Hướng Dẫn Sử Dụng (Quick Start)

1. Load bằng thư viện datasets của HuggingFace

python
from datasets import load_dataset

# Load tập Train
dataset = load_dataset("your-username/vmad-medical-300k", split="train")
print(dataset[0])

# Cấu trúc 1 mẫu (Alpaca Format):
# {
#   "instruction": "Hãy tóm tắt báo cáo ca bệnh/nghiên cứu y khoa sau đây...",
#   "input": "Tiêu đề: ...\nNội dung: ...",
#   "output": "Tóm tắt nghiên cứu..."
# }

2. Fine-Tune với Unsloth / LLaMA-Factory / Transformers

Bộ dữ liệu có sẵn trong 2 định dạng chuẩn:

  • —Alpaca Format (instruction, input, output)
  • —ShareGPT Format (conversations: [{"from": "human", ...}, {"from": "gpt", ...}])

⚠️ Disclaimer (Miễn trừ trách nhiệm)

Bộ dữ liệu VMAD-300K được tổng hợp và xử lý tự động phục vụ mục đích Nghiên cứu khoa học và Huấn luyện AI. Thông tin trong bộ dữ liệu không thay thế cho lời khuyên, chẩn đoán hoặc điều trị y tế chuyên nghiệp từ bác sĩ chuyên khoa.