CoolFace
Datasetpublic

hoanghai2110/vi-pretrain-clean

Vietnamese Pretraining Dataset Bộ dữ liệu tiếng Việt chất lượng cao để pretrain mô hình ngôn ngữ từ đầu (from scratch). Mục tiêu: "ít mà vàng" — ít dữ liệu nhưng cực sạch. Thống kê Chỉ số Giá trị Tổng docs 511,198 Raw text ~0.69 GB Ước tính tokens ~230M tokens Nguồn 4 nguồn Nguồn dữ liệu Nguồn Docs Loại nội dung Wikipedia VI 378,895 Bách khoa toàn thư OPUS OpenSubtitles 84,021 Hội thoại, phụ đề phim OPUS… See the full description on the dataset page: https://huggingface.co/datasets/hoanghai2110/vi-pretrain-clean.

sourceHugging Facecc0-1.0updated 6mo agoView on Hugging Face
0likes300downloads
Dataset Card

Vietnamese Pretraining Dataset

Bộ dữ liệu tiếng Việt chất lượng cao để pretrain mô hình ngôn ngữ từ đầu (from scratch). Mục tiêu: "ít mà vàng" — ít dữ liệu nhưng cực sạch.

Thống kê

Chỉ sốGiá trị
Tổng docs511,198
Raw text~0.69 GB
Ước tính tokens~230M tokens
Nguồn4 nguồn

Nguồn dữ liệu

NguồnDocsLoại nội dung
Wikipedia VI378,895Bách khoa toàn thư
OPUS OpenSubtitles84,021Hội thoại, phụ đề phim
OPUS CCAligned39,660Văn bản web song ngữ
OPUS WikiMatrix8,530Câu Wikipedia song ngữ
CC-100 VI92Web crawl

Bộ lọc chất lượng (8 tiêu chí)

  1. 1.Tỉ lệ ký tự tiếng Việt ≥ 70% — loại văn bản không phải tiếng Việt
  2. 2.Tối thiểu 3 câu — loại đoạn quá ngắn
  3. 3.Độ dài ≥ 200 ký tự — loại stub
  4. 4.Dedup MD5 — loại bản sao y hệt
  5. 5.Phát hiện lặp lại — loại văn bản có n-gram lặp quá nhiều
  6. 6.Xóa URL và thẻ HTML
  7. 7.Blacklist từ khóa — loại spam, porn, quảng cáo
  8. 8.Line diversity — loại block copy-paste một dòng

Định dạng

JSONL — mỗi dòng là một document:

json
{"text": "Hà Nội là thủ đô của Việt Nam...", "source": "wikipedia_vi", "id": "wiki_12345"}

Cách dùng

python
import json

with open("vi_pretrain_part_01.jsonl") as f:
    for line in f:
        doc = json.loads(line)
        print(doc["text"][:100])
        break

Dùng với 🤗 Datasets

python
from datasets import load_dataset

ds = load_dataset("hoanghai2110/vi-pretrain-clean", split="train")
print(ds[0])

Mục đích

Được xây dựng để huấn luyện mô hình Mamba (SSM) tiếng Việt từ đầu với quy mô ~130M–1B tham số.