CoolFace
Datasetpublic

Phuc-HugigFace/Vietnamese-SFT-Corpus-V2

🇻🇳 Vietnamese SFT Corpus V2.1 (Balanced Safety & Anti-Over-Refusal) Vietnamese SFT Corpus V2.1 là tập dữ liệu Tinh chỉnh có Giám sát (Supervised Fine-Tuning - SFT) chuẩn công nghiệp dành cho mô hình ngôn ngữ lớn (LLM) tiếng Việt. Tập dữ liệu được thiết kế nhằm phục vụ huấn luyện trợ lý ảo thông minh, hội thoại tự nhiên, suy luận logic, đồng thời đặc trị triệt để hiện tượng "từ chối lười biếng / từ chối nhầm" (Lazy Refusal / Over-Refusal) vốn xuất hiện phổ biến ở các mô… See the full description on the dataset page: https://huggingface.co/datasets/Phuc-HugigFace/Vietnamese-SFT-Corpus-V2.

sourceHugging Faceapache-2.0updated 20h agoView on Hugging Face
0likes79downloads
Dataset Card

🇻🇳 Vietnamese SFT Corpus V2.1 (Balanced Safety & Anti-Over-Refusal)

![Dataset on HF](https://huggingface.co/datasets/Phuc-HugigFace/Vietnamese-SFT-Corpus-V2) ![License: Apache 2.0](https://opensource.org/licenses/Apache-2.0) ![Total Samples](#2-cấu-trúc--tỷ-lệ-phân-bổ) ![Safety Ratio](#4-chi-tiết-mục-4-tập-an-toàn-cân-bằng-balanced-safety--anti-over-refusal) ![Contamination](#5-quy-trình-kiểm-định-chất-lượng--chống-rò-rỉ-đề-thi-de-contamination)

Vietnamese SFT Corpus V2.1 là tập dữ liệu Tinh chỉnh có Giám sát (Supervised Fine-Tuning - SFT) chuẩn công nghiệp dành cho mô hình ngôn ngữ lớn (LLM) tiếng Việt. Tập dữ liệu được thiết kế nhằm phục vụ huấn luyện trợ lý ảo thông minh, hội thoại tự nhiên, suy luận logic, đồng thời đặc trị triệt để hiện tượng "từ chối lười biếng / từ chối nhầm" (Lazy Refusal / Over-Refusal) vốn xuất hiện phổ biến ở các mô hình căn chỉnh an toàn cực đoan.


1. Bối cảnh & Động lực Phát triển

Trong quá trình huấn luyện và đánh giá các phiên bản SFT trước đây, chúng tôi đã đúc rút được 2 bài học thực nghiệm then chốt:

  1. 1.Vấn đề dữ liệu dịch máy thô (Bài học từ V1): Việc phụ thuộc vào các tập Alpaca dịch máy tiếng Anh sang tiếng Việt dẫn đến câu cú ngô nghê, mất ngữ cảnh văn hóa bản ngữ và thường xuyên bị lỗi nuốt dòng thụt đầu dòng (indentation) hoặc hỏng cú pháp code block.
  2. 2.Khủng hoảng thiên lệch an toàn 54:1 (Bài học từ V2 cũ): Khi nạp 7,000 mẫu an toàn cũ, có tới 6,609 mẫu từ chối nhưng chỉ có 124 mẫu trả lời an toàn, kết hợp cùng khoảng 10 câu mẫu từ chối (canned templates) lặp đi lặp lại hàng trăm lần. Hệ quả là mô hình 2B/3B bị "phản xạ có điều kiện", hễ thấy từ khóa nhạy cảm là tự động từ chối thẳng thừng, kéo tỷ lệ từ chối trên đề thi IFEval lên tới 49.4% (từ chối cả các câu hỏi hoàn toàn lành tính).
  3. 3.Giải pháp đột phá ở V2.1: Tái cân bằng phân vùng An toàn về đúng tỷ lệ vàng 1:1 (1,257 Từ chối chuẩn mực : 1,257 Trả lời an toàn/giáo dục), xóa bỏ hoàn toàn canned template, loại bỏ rò rỉ đề thi benchmark (zero-contamination).

2. Cấu Trúc & Tỷ Lệ Phân Bổ

Tập dữ liệu bao gồm 38,229 mẫu hội thoại chất lượng cao, được chia theo tỷ lệ chuẩn 97% Train (37,083 mẫu) và 3% Validation (1,146 mẫu):

STTTrụ Cột Dữ LiệuNguồn Dữ Liệu Gốc & Liên Kết HFSố MẫuTỷ LệVai Trò Kỹ Thuật
1Hội thoại thuần Việtbkai-foundation-models/vi-self-chat-sharegpt-format29,71577.7%Xương sống đàm thoại đa lượt tự nhiên (sâu tới 28 turns).
2Suy luận logic (CoT)VILM/OpenOrca-Viet3,5009.2%Chuỗi suy nghĩ từng bước, bảo toàn tri thức học thuật (VMLU).
3Toán học từng bướchllj/vi_gsm8k2,5006.5%Rèn luyện năng lực số học, suy luận logic toán học có lời giải.
4An toàn cân bằngXem chi tiết 4 tập thành phần tại Mục 4 bên dưới2,5146.6%Cân bằng 50:50, triệt tiêu hiện tượng từ chối oan (Over-Refusal).
🎯TỔNG CỘNGVietnamese-SFT-Corpus-V238,229100%Toàn diện cả Chat, Logic, Toán & An toàn thông minh.

3. Chi Tiết Các Bộ Dữ Liệu Thành Phần (Mục 1 – 3)

3.1. Nền tảng Hội thoại Bản ngữ: BKAI vi-self-chat

  • —Tác giả: BKAI Foundation Models (Trung tâm Nghiên cứu Quốc tế về Định vị và Ứng dụng Không gian - ĐH Bách Khoa Hà Nội).
  • —Quy mô nạp: 29,715 mẫu hội thoại.
  • —Đặc điểm: Hội thoại ShareGPT tự nhiên 100% bằng tiếng Việt, phản ánh chân thực văn phong giao tiếp, xưng hô lịch thiệp và phong phú về đời sống, văn hóa, ẩm thực, lịch sử Việt Nam. Độ sâu hội thoại từ 2 đến 28 lượt hỏi-đáp.

3.2. Suy luận Chuỗi Tư duy (Reasoning CoT): VILM OpenOrca-Viet

  • —Tác giả: VILM (Vietnamese Open-source Large Language Models community).
  • —Quy mô nạp: 3,500 mẫu suy luận chọn lọc kỹ lưỡng.
  • —Đặc điểm: Tái tạo chuỗi tư duy chi tiết (Chain-of-Thought), hướng dẫn mô hình cách giải thích nguyên nhân, phân tích logic đa bước và tổng kết vấn đề một cách có cơ sở, giúp mô hình duy trì năng lực giải bài tập mà không bị suy giảm trí tuệ (tránh Alignment Tax).

3.3. Giải Toán Đố Từng Bước: hllj vi_gsm8k

  • —Tác giả: hllj (Hugging Face community).
  • —Quy mô nạp: 2,500 bài toán số học cấp độ trường học.
  • —Đặc điểm: Bài toán đố số học tiếng Việt đi kèm các bước lập luận đại số, tính toán số học cụ thể và kết luận rõ ràng với format Đáp số: ....

4. CHI TIẾT MỤC 4: TẬP AN TOÀN CÂN BẰNG (Balanced Safety & Anti-Over-Refusal)

[!IMPORTANT] Điểm cải tiến mang tính bước ngoặt của V2.1: Toàn bộ phân vùng an toàn gồm 2,514 mẫu được chia CHÍNH XÁC theo tỷ lệ 1:1 giữa 1,257 mẫu Từ chối chuẩn mực (Refusal) và 1,257 mẫu Trả lời an toàn / Giáo dục phòng vệ (Safe Compliance). Phân vùng này chiếm 6.57% tổng dữ liệu — nằm đúng trong biên độ vàng 3%–7% chuẩn quốc tế.

Phân vùng này được cấu thành từ 4 bộ dữ liệu an toàn uy tín sau đây:

4.1. nvidia/Nemotron-Content-VISafe-v1 (NVIDIA Corporation)

  • —Liên kết: https://huggingface.co/datasets/nvidia/Nemotron-Content-VISafe-v1
  • —Vai trò kỹ thuật: Bộ tiêu chuẩn an toàn nội dung tiếng Việt do NVIDIA phát triển cho dòng mô hình Nemotron.
  • —Cách trích xuất & xử lý:
  • —Phần Từ chối (Refusal - 550 mẫu): Chọn lọc các hành vi nguy hại cấp tính như: tấn công an ninh mạng, mã độc, tạo email/SMS giả mạo ngân hàng đánh cắp thông tin (phishing), lừa đảo tài chính và các hành vi vi phạm pháp luật hình sự.
  • —Khử lặp tiền tố (Prefix Deduplication): Thuật toán tự động giới hạn tối đa $\le 15$ mẫu cho mỗi cụm tiền tố mở đầu (ví dụ: "viết một bài...", "tạo dàn ý..."), triệt tiêu hoàn toàn hiện tượng học vẹt template.
  • —Phần Trả lời Hỗ trợ (Safe Compliance - 121 mẫu): Khai thác toàn bộ 121 prompt thuộc nhãn allow của NVIDIA (ví dụ: các yêu cầu mang tính giáo dục, an toàn thông tin phòng thủ, lịch sử hình thành chữ Quốc ngữ...). Mô hình được dạy trả lời chi tiết, khách quan thay vì e sợ né tránh.

4.2. zhiyuan-ning/linguasafe (Nghiên cứu ACL 2024 / arXiv:2508.12733)

  • —Liên kết: https://huggingface.co/datasets/zhiyuan-ning/linguasafe
  • —Vai trò kỹ thuật: Bộ tiêu chuẩn đánh giá an toàn đa ngôn ngữ LinguaSafe (chứa 3,884 mẫu tiếng Việt).
  • —Cách trích xuất & xử lý:
  • —Level 3 (Hard Refusal - 550 mẫu): Trích xuất các trường hợp độc hại nghiêm trọng ở mức cao nhất thuộc 5 nhóm rủi ro (Nội dung khiêu dâm/bạo lực, Tội phạm & Hành vi trái pháp luật, Gây hại tính mạng, Phá hoại tài sản, Vũ khí và Đặt bẫy săn trộm động vật hoang dã trái phép).
  • —Level 0 (Benign) & Level 1 (Borderline) (450 mẫu Safe Compliance): VŨ KHÍ TRỊ BỆNH OVER-REFUSAL. Trích xuất các câu hỏi tưởng chừng nguy hiểm nhưng thực chất là tìm hiểu khoa học hoặc đời sống (ví dụ: cách cứu chim hoang dã bị thương, tác động của diệt côn trùng trong nông nghiệp, quy định bảo vệ rừng...). Mô hình được huấn luyện để nhận thức rằng đây là câu hỏi vô hại và cần trả lời khoa học, hữu ích.

4.3. melanieyes/adaption-vi-medical-safety-jailbreak

  • —Liên kết: https://huggingface.co/datasets/melanieyes/adaption-vi-medical-safety-jailbreak
  • —Vai trò kỹ thuật: Dữ liệu an toàn y tế và dược học lâm sàng tuân thủ khuyến cáo của Tổ chức Y tế Thế giới (WHO).
  • —Cách trích xuất & xử lý:
  • —Bộ dữ liệu có sẵn cặp hoàn thiện chuyên gia (enhanced_completion) với lập luận phân tích nguy cơ rõ ràng.
  • —Nhóm Từ chối (Refusal): Trích xuất từ các nhãn nghiêm ngặt BLOCK, REQUIRE_HUMAN_CONFIRMATION, URGENT_ESCALATION (chống kê đơn vượt thẩm quyền, cảnh báo tương tác thuốc tử vong, chống giả mạo hồ sơ bệnh nhân).
  • —Nhóm Hỗ trợ an toàn (Compliance): Trích xuất từ các nhãn ALLOW, ALLOW_WITH_WARNING (hướng dẫn tư vấn điều trị an toàn, khuyến nghị dinh dưỡng và kiểm tra đơn thuốc an toàn).

4.4. quannguyen204/vietnamese-safety-classification-dataset

  • —Liên kết: https://huggingface.co/datasets/quannguyen204/vietnamese-safety-classification-dataset
  • —Vai trò kỹ thuật: Dữ liệu phân loại an toàn tiếng Việt bản ngữ.
  • —Cách trích xuất & xử lý:
  • —Safe Compliance Label 2 (400 mẫu): Chọn lọc các chủ đề ranh giới đời sống thường gây bối rối cho AI (tranh luận bản quyền nội dung trên mạng xã hội, pháp lý về tự do ngôn luận, hỗ trợ tâm lý sau mất mát người thân).
  • —Mô hình được huấn luyện đưa ra câu trả lời thấu cảm, đa chiều, giàu tính xây dựng và chuẩn mực đạo đức thay vì từ chối máy móc.

Bảng Tổng Hợp Phân Bổ Chi Tiết Phân Vùng An Toàn (Mục 4)

Bộ Dữ Liệu NguồnLiên Kết Hugging FaceMẫu Refusal (Từ chối)Mẫu Compliance (Hỗ trợ)Tổng MẫuMục Tiêu Huấn Luyện
NVIDIA VISafe v1nvidia/Nemotron-Content-VISafe-v1550121671Chống lừa đảo mạng + Giáo dục an toàn phòng vệ
LinguaSafe (ACL)zhiyuan-ning/linguasafe5504501,000Chặn tội phạm nghiêm trọng + Trị over-refusal câu hỏi ranh giới
Vi-Medical (WHO)melanieyes/adaption-vi-medical-safety-jailbreak157286443An toàn dược lâm sàng, cấp cứu và bảo vệ bệnh nhân
QuanNguyen Safetyquannguyen204/vietnamese-safety-classification0400400Giải đáp văn minh các chủ đề pháp lý & ranh giới đời sống
TỔNG CỘNGCân bằng 1:1 chuẩn xác1,257 (50.0%)1,257 (50.0%)2,514Triệt tiêu Lazy Refusal, bảo đảm Helpful & Harmless

5. Quy Trình Kiểm Định Chất Lượng & Chống Rò Rỉ Đề Thi (De-contamination)

Toàn bộ tập dữ liệu đã vượt qua 100% các bài kiểm thử nghiêm ngặt tại pipeline thẩm định tự động data_pipeline/main.py:

┌────────────────────────────────────────────────────────────────────────┐
│               INDUSTRIAL DATA PIPELINE AUDIT REPORT                    │
├────────────────────────────────┬───────────────────────────┬───────────┤
│ Hạng mục kiểm tra              │ Tiêu chuẩn thẩm định      │ Kết quả   │
├────────────────────────────────┼───────────────────────────┼───────────┤
│ 1. Rò rỉ đề thi Benchmark     │ 13-gram Inverted Index    │ 0 MẪU (✓) │
│    (SeaBench, CatQA, DoNotAns, │ Đối chiếu toàn bộ tập test│           │
│     IFEval, MT-Bench, VMLU...) │ không trùng lặp câu hỏi   │           │
├────────────────────────────────┼───────────────────────────┼───────────┤
│ 2. Phát hiện Cụm Template lặp │ HDBSCAN + SBERT Embeddings│ 0 CỤM (✓) │
│    (Xóa bỏ 10 canned response) │ Ngưỡng silhouette > 0.65  │           │
├────────────────────────────────┼───────────────────────────┼───────────┤
│ 3. Cân bằng Tỷ lệ An toàn     │ Đo lường Refusal/Compl.   │ 1.00 : 1  │
│    (50% từ chối : 50% hỗ trợ)  │ Triệt tiêu Over-refusal   │ CHUẨN MỰC │
├────────────────────────────────┼───────────────────────────┼───────────┤
│ 4. Toàn vẹn Cú pháp Mã nguồn  │ Regex Code Masking        │ 0 LỖI (✓) │
│    (Không hỏng Markdown code)  │ Giữ nguyên dấu thụt lề    │           │
└────────────────────────────────┴───────────────────────────┴───────────┘

6. Cấu Trúc Dữ Liệu & Hướng Dẫn Sử Dụng

Định dạng mẫu (ShareGPT Format)

Mỗi mẫu trong tập dữ liệu tuân theo cấu trúc chuẩn:

json
{
  "conversations": [
    {
      "from": "user",
      "value": "Làm thế nào để bảo vệ thông tin cá nhân khi sử dụng mạng xã hội?"
    },
    {
      "from": "gpt",
      "value": "Dưới đây là các biện pháp quan trọng giúp bạn bảo vệ dữ liệu cá nhân an toàn trên không gian mạng:\n\n1. Thiết lập mật khẩu mạnh và bật xác thực 2 yếu tố (2FA)...\n2. Thận trọng với các đường link lạ..."
    }
  ],
  "source": "visafe_allow_defense"
}

Tải nhanh qua Python datasets

python
from datasets import load_dataset

# Tải tập dữ liệu huấn luyện chính thức
dataset = load_dataset("Phuc-HugigFace/Vietnamese-SFT-Corpus-V2")

print(f"Số mẫu Train: {len(dataset['train']):,}")
print(f"Số mẫu Validation: {len(dataset['validation']):,}")

# Xem mẫu đầu tiên
print(dataset['train'][0])

7. Cấu Hình Huấn Luyện Khuyến Nghị (SFT Recipe)

Tập dữ liệu này đã được kiểm chứng huấn luyện thành công mô hình `SFT-v2.1` trên nền Qwen/Qwen3.5-2B-Base với hiệu năng vượt trội:

  • —Framework: PyTorch + Unsloth / Hugging Face TRL SFTTrainer
  • —LoRA Hyperparameters: $r=32$, $\alpha=32$, $\text{dropout}=0$ (trên tất cả linear layers q, k, v, o, gate, up, down).
  • —Learning Rate: $1.5 \times 10^{-4}$ với Cosine Decay và 3% Warmup steps.
  • —Batch Size: Effective batch size = 64 (Batch 8 per device $\times$ Gradient Accumulation 8).
  • —Epochs: 2 epochs (~1,295 steps).
  • —Loss Masking: Response-only loss masking trên nhãn <|im_start|>assistant\n.

8. Bản Quyền & Giấy Phép (License & Citation)

Tập dữ liệu được phát hành theo giấy phép tự do [Apache 2.0](https://opensource.org/licenses/Apache-2.0). Người dùng được toàn quyền sử dụng cho mục đích nghiên cứu học thuật cũng như tích hợp vào các sản phẩm thương mại.

Xin vui lòng trích dẫn nếu tập dữ liệu này hữu ích cho công trình nghiên cứu của bạn:

bibtex
@dataset{vietnamese_sft_corpus_v2_1,
  author       = {Phuc Nguyen and Collaborators},
  title        = {Vietnamese SFT Corpus V2.1: Balanced Safety and Anti-Over-Refusal Instruction Dataset},
  year         = {2026},
  publisher    = {Hugging Face},
  howpublished = {\url{https://huggingface.co/datasets/Phuc-HugigFace/Vietnamese-SFT-Corpus-V2}}
}