NoirHuy/chatdoctor-healthcaremagic-112k-vi
🩺 ChatDoctor HealthCareMagic 112k (Vietnamese Translated) Tập dữ liệu hỏi đáp y khoa ChatDoctor HealthCareMagic 112k được dịch sang tiếng Việt chất lượng cao, phục vụ fine-tune các mô hình ngôn ngữ lớn (LLM) trong lĩnh vực y tế, chăm sóc sức khỏe và tư vấn y khoa tổng quát. 📌 Tổng quan dữ liệu Quy mô: 112,165 cặp hỏi - đáp y tế thực tế giữa bệnh nhân và bác sĩ. Phân chia: train: 106,556 mẫu (95%) validation: 5,609 mẫu (5%) Định dạng: Chuẩn Alpaca /… See the full description on the dataset page: https://huggingface.co/datasets/NoirHuy/chatdoctor-healthcaremagic-112k-vi.
🩺 ChatDoctor HealthCareMagic 112k (Vietnamese Translated)
Tập dữ liệu hỏi đáp y khoa ChatDoctor HealthCareMagic 112k được dịch sang tiếng Việt chất lượng cao, phục vụ fine-tune các mô hình ngôn ngữ lớn (LLM) trong lĩnh vực y tế, chăm sóc sức khỏe và tư vấn y khoa tổng quát.
📌 Tổng quan dữ liệu
- Quy mô: 112,165 cặp hỏi - đáp y tế thực tế giữa bệnh nhân và bác sĩ.
- Phân chia:
train: 106,556 mẫu (95%)validation: 5,609 mẫu (5%)- Định dạng: Chuẩn Alpaca / Instruction Tuning (
instruction,input,output). - Ngôn ngữ: Song ngữ — trường chính là tiếng Việt (
vi), đồng thời lưu kèm nguyên gốc tiếng Anh (*_en) để tiện đối chiếu và benchmark.
📊 Cấu trúc trường dữ liệu (Schema)
🛠️ Quy trình xử lý & Kiểm soát chất lượng (QC)
Bộ dữ liệu được dịch thông qua mô hình ngôn ngữ lớn và trải qua quy trình hậu kiểm nghiêm ngặt:
- Lọc chuỗi suy luận (CoT): Loại bỏ hoàn toàn các thẻ
<think>, các tiền tố phân tích dịch thuật ("My Translation Process...","Dưới đây là bản dịch..."). - Kiểm tra dấu & Mã hóa: 100% các dòng đều được đối soát tự động, đảm bảo không có lỗi font (mojibake
\ufffd), không bị lỗi mạng trả về tiếng Anh gốc, và đầy đủ dấu tiếng Việt tự nhiên. - Ngữ cảnh y khoa: Tối ưu hóa các thuật ngữ chuyên môn y khoa thông dụng theo ngữ cảnh lâm sàng Việt Nam.
🚀 Hướng dẫn nạp dữ liệu
Bằng thư viện datasets (Python):
from datasets import load_dataset
# Nạp toàn bộ tập dữ liệu
dataset = load_dataset("NoirHuy/chatdoctor-healthcaremagic-112k-vi")
# Xem mẫu dữ liệu đầu tiên của tập train
print(dataset["train"][0])Sử dụng với Chat Template (Fine-tuning):
def format_prompts(example):
return {
"text": f"<|im_start|>user\n{example['input']}<|im_end|>\n<|im_start|>assistant\n{example['output']}<|im_end|>"
}
formatted_ds = dataset.map(format_prompts)📄 Nguồn gốc & Trích dẫn (Citation)
Tập dữ liệu gốc tiếng Anh thuộc dự án ChatDoctor:
@article{li2023chatdoctor,
title={ChatDoctor: A Medical Chat Model Fine-Tuned on a Large Language Model Meta-AI (LLaMA) Using Medical Domain Knowledge},
author={Li, Yunxiang and Li, Zihan and Zhang, Kai and Dan, Ruilong and Jiang, Steve and You, Chenglin},
journal={Cureus},
volume={15},
number={6},
year={2023},
publisher={Cureus}
}- Dataset gốc: Lavita/ChatDoctor-HealthCareMagic-100k
- Bản dịch tiếng Việt bởi: NoirHuy
⚠️ Tuyên bố miễn trừ trách nhiệm (Disclaimer)
Tập dữ liệu này chỉ được sử dụng cho mục đích nghiên cứu, học tập và phát triển mô hình AI. Các thông tin y tế không được dùng để thay thế chẩn đoán, điều trị hoặc hướng dẫn từ các bác sĩ và cơ sở y tế chuyên môn.
