hoanghai2110/vi-pretrain-clean
Vietnamese Pretraining Dataset Bộ dữ liệu tiếng Việt chất lượng cao để pretrain mô hình ngôn ngữ từ đầu (from scratch). Mục tiêu: "ít mà vàng" — ít dữ liệu nhưng cực sạch. Thống kê Chỉ số Giá trị Tổng docs 511,198 Raw text ~0.69 GB Ước tính tokens ~230M tokens Nguồn 4 nguồn Nguồn dữ liệu Nguồn Docs Loại nội dung Wikipedia VI 378,895 Bách khoa toàn thư OPUS OpenSubtitles 84,021 Hội thoại, phụ đề phim OPUS… See the full description on the dataset page: https://huggingface.co/datasets/hoanghai2110/vi-pretrain-clean.
Vietnamese Pretraining Dataset
Bộ dữ liệu tiếng Việt chất lượng cao để pretrain mô hình ngôn ngữ từ đầu (from scratch). Mục tiêu: "ít mà vàng" — ít dữ liệu nhưng cực sạch.
Thống kê
Nguồn dữ liệu
Bộ lọc chất lượng (8 tiêu chí)
- Tỉ lệ ký tự tiếng Việt ≥ 70% — loại văn bản không phải tiếng Việt
- Tối thiểu 3 câu — loại đoạn quá ngắn
- Độ dài ≥ 200 ký tự — loại stub
- Dedup MD5 — loại bản sao y hệt
- Phát hiện lặp lại — loại văn bản có n-gram lặp quá nhiều
- Xóa URL và thẻ HTML
- Blacklist từ khóa — loại spam, porn, quảng cáo
- Line diversity — loại block copy-paste một dòng
Định dạng
JSONL — mỗi dòng là một document:
{"text": "Hà Nội là thủ đô của Việt Nam...", "source": "wikipedia_vi", "id": "wiki_12345"}Cách dùng
import json
with open("vi_pretrain_part_01.jsonl") as f:
for line in f:
doc = json.loads(line)
print(doc["text"][:100])
breakDùng với 🤗 Datasets
from datasets import load_dataset
ds = load_dataset("hoanghai2110/vi-pretrain-clean", split="train")
print(ds[0])Mục đích
Được xây dựng để huấn luyện mô hình Mamba (SSM) tiếng Việt từ đầu với quy mô ~130M–1B tham số.
