CoolFace
Datasetpublic

NoirHuy/chatdoctor-healthcaremagic-112k-vi

🩺 ChatDoctor HealthCareMagic 112k (Vietnamese Translated) Tập dữ liệu hỏi đáp y khoa ChatDoctor HealthCareMagic 112k được dịch sang tiếng Việt chất lượng cao, phục vụ fine-tune các mô hình ngôn ngữ lớn (LLM) trong lĩnh vực y tế, chăm sóc sức khỏe và tư vấn y khoa tổng quát. 📌 Tổng quan dữ liệu Quy mô: 112,165 cặp hỏi - đáp y tế thực tế giữa bệnh nhân và bác sĩ. Phân chia: train: 106,556 mẫu (95%) validation: 5,609 mẫu (5%) Định dạng: Chuẩn Alpaca /… See the full description on the dataset page: https://huggingface.co/datasets/NoirHuy/chatdoctor-healthcaremagic-112k-vi.

sourceHugging Facecc-by-nc-4.0updated 9d agoView on Hugging Face
1likes116downloads
Dataset Card

🩺 ChatDoctor HealthCareMagic 112k (Vietnamese Translated)

Tập dữ liệu hỏi đáp y khoa ChatDoctor HealthCareMagic 112k được dịch sang tiếng Việt chất lượng cao, phục vụ fine-tune các mô hình ngôn ngữ lớn (LLM) trong lĩnh vực y tế, chăm sóc sức khỏe và tư vấn y khoa tổng quát.


📌 Tổng quan dữ liệu

  • —Quy mô: 112,165 cặp hỏi - đáp y tế thực tế giữa bệnh nhân và bác sĩ.
  • —Phân chia:
  • —train: 106,556 mẫu (95%)
  • —validation: 5,609 mẫu (5%)
  • —Định dạng: Chuẩn Alpaca / Instruction Tuning (instruction, input, output).
  • —Ngôn ngữ: Song ngữ — trường chính là tiếng Việt (vi), đồng thời lưu kèm nguyên gốc tiếng Anh (*_en) để tiện đối chiếu và benchmark.

📊 Cấu trúc trường dữ liệu (Schema)

Tên trườngKiểuMô tả
idint64Định danh dòng (0 - 112,164)
instructionstringChỉ dẫn nhiệm vụ bằng tiếng Việt (mặc định: "Dịch/Trả lời câu hỏi y tế sau...")
inputstringCâu hỏi / mô tả bệnh sử của bệnh nhân (Tiếng Việt)
outputstringLời khuyên, chẩn đoán sơ bộ và hướng dẫn từ bác sĩ (Tiếng Việt)
instruction_enstringChỉ dẫn gốc tiếng Anh
input_enstringCâu hỏi gốc tiếng Anh
output_enstringCâu trả lời gốc tiếng Anh
languagestringvi
taskstringopen_qa
sourcestringchatdoctor_healthcaremagic

🛠️ Quy trình xử lý & Kiểm soát chất lượng (QC)

Bộ dữ liệu được dịch thông qua mô hình ngôn ngữ lớn và trải qua quy trình hậu kiểm nghiêm ngặt:

  1. 1.Lọc chuỗi suy luận (CoT): Loại bỏ hoàn toàn các thẻ <think>, các tiền tố phân tích dịch thuật ("My Translation Process...", "Dưới đây là bản dịch...").
  2. 2.Kiểm tra dấu & Mã hóa: 100% các dòng đều được đối soát tự động, đảm bảo không có lỗi font (mojibake \ufffd), không bị lỗi mạng trả về tiếng Anh gốc, và đầy đủ dấu tiếng Việt tự nhiên.
  3. 3.Ngữ cảnh y khoa: Tối ưu hóa các thuật ngữ chuyên môn y khoa thông dụng theo ngữ cảnh lâm sàng Việt Nam.

🚀 Hướng dẫn nạp dữ liệu

Bằng thư viện datasets (Python):

python
from datasets import load_dataset

# Nạp toàn bộ tập dữ liệu
dataset = load_dataset("NoirHuy/chatdoctor-healthcaremagic-112k-vi")

# Xem mẫu dữ liệu đầu tiên của tập train
print(dataset["train"][0])

Sử dụng với Chat Template (Fine-tuning):

python
def format_prompts(example):
    return {
        "text": f"<|im_start|>user\n{example['input']}<|im_end|>\n<|im_start|>assistant\n{example['output']}<|im_end|>"
    }

formatted_ds = dataset.map(format_prompts)

📄 Nguồn gốc & Trích dẫn (Citation)

Tập dữ liệu gốc tiếng Anh thuộc dự án ChatDoctor:

bibtex
@article{li2023chatdoctor,
  title={ChatDoctor: A Medical Chat Model Fine-Tuned on a Large Language Model Meta-AI (LLaMA) Using Medical Domain Knowledge},
  author={Li, Yunxiang and Li, Zihan and Zhang, Kai and Dan, Ruilong and Jiang, Steve and You, Chenglin},
  journal={Cureus},
  volume={15},
  number={6},
  year={2023},
  publisher={Cureus}
}

⚠️ Tuyên bố miễn trừ trách nhiệm (Disclaimer)

Tập dữ liệu này chỉ được sử dụng cho mục đích nghiên cứu, học tập và phát triển mô hình AI. Các thông tin y tế không được dùng để thay thế chẩn đoán, điều trị hoặc hướng dẫn từ các bác sĩ và cơ sở y tế chuyên môn.