wheevu/ct219-vietnamese-raw-400k
wheevu/ct219-vietnamese-raw-400k Bộ dữ liệu văn bản tiếng Việt thô đã tiền xử lý, dùng để huấn luyện next-token language model (CT219 - NLP final project). Nguồn dữ liệu Source dataset: VTSNLP/vietnamese_curated_dataset Source split: train Pinned source revision: b81fcce58945970117a1b56d50ec81be2628a5c3 Source licence: không công bố - repo này được tạo ở chế độ private vì lý do đó. Mục đích Huấn luyện next-token language model cho tiếng Việt.… See the full description on the dataset page: https://huggingface.co/datasets/wheevu/ct219-vietnamese-raw-400k.
wheevu/ct219-vietnamese-raw-400k
Bộ dữ liệu văn bản tiếng Việt thô đã tiền xử lý, dùng để huấn luyện next-token language model (CT219 - NLP final project).
Nguồn dữ liệu
- Source dataset: VTSNLP/vietnamese_curated_dataset
- Source split:
train - Pinned source revision:
b81fcce58945970117a1b56d50ec81be2628a5c3 - Source licence: không công bố - repo này được tạo ở chế độ private vì lý do đó.
Mục đích
Huấn luyện next-token language model cho tiếng Việt.
Cách chọn 400k văn bản
- Seed:
42 - Deterministic reservoir sampling trên toàn bộ stream nguồn (12,169,131 văn bản đã duyệt).
- Không chọn N văn bản đầu tiên; mẫu đồng đều trên phần đã quét.
Tiền xử lý và chuẩn hóa
- NFC Unicode, giữ nguyên dấu tiếng Việt, chữ hoa, số, dấu câu, cấu trúc đoạn.
- Kết thúc dòng về LF, khoảng trắng lặp gộp lại, tối đa một dòng trống liên tiếp.
- Không tokenization, không hạ chữ thường, không bỏ dấu.
Khử trùng lặp
- Trùng
idvà trùng văn bản chính xác sau chuẩn hóa (SHA-256) đều bị loại. - Backend: sqlite. Duplicate count: 661.
Chia tập
- Phương pháp: stable hash của
idvà seed. - train: 359,988 (90%), validation: 20,028 (5%), test: 19,984 (5%).
- Không có văn bản nào xuất hiện ở hai tập (đã kiểm chứng theo id và text_hash).
Schema
Các tệp parquet có cột: id, domain, text, text_hash, character_count.
Chính sách lọc chất lượng
- Loại bỏ (mặc định):
encoding_corruption(>= 3 ký tự U+FFFD),binary_or_invalid_content(Unicode bất thường >= 8 ký tự và >= 0.5%). - Chỉ audit (không loại):
foreign_script_dominant,concatenated_dump, tín hiệu tiếng Việt thấp, VNI patterns. Xemdata_contract.mdtrong repo mã nguồn. - Ngưỡng ngôn ngữ chưa được chốt bằng dữ liệu có nhãn; cần duyệt thủ công trước khi thay đổi.
Hạn chế đã biết
- Mẫu đại diện cho phần stream đã quét (12,169,131 văn bản), không đảm bảo đại diện toàn bộ bộ dữ liệu gốc.
- Có thể chứa văn bản không phải tiếng Việt (ước lượng < 1% qua audit) và boilerplate từ web.
- Licence nguồn không rõ: dữ liệu này chỉ dùng trong phạm vi đồ án học tập.
Tái lập
python -m src.data.preprocess --mode release-400k --dataset VTSNLP/vietnamese_curated_dataset --dataset-split train --dataset-revision b81fcce58945970117a1b56d50ec81be2628a5c3 --seed 42 --dedup-backend sqlite --output-dir data/releases/ct219-400k-v1Mã nguồn: https://github.com/wheevu/ct219-final-report (nhánh feat/400k-huggingface-release) Checksums và row counts: xem manifest.json và checksums.txt trong repo này. Release version: v1
