CoolFace
Datasetpublic

wheevu/ct219-vietnamese-raw-400k

wheevu/ct219-vietnamese-raw-400k Bộ dữ liệu văn bản tiếng Việt thô đã tiền xử lý, dùng để huấn luyện next-token language model (CT219 - NLP final project). Nguồn dữ liệu Source dataset: VTSNLP/vietnamese_curated_dataset Source split: train Pinned source revision: b81fcce58945970117a1b56d50ec81be2628a5c3 Source licence: không công bố - repo này được tạo ở chế độ private vì lý do đó. Mục đích Huấn luyện next-token language model cho tiếng Việt.… See the full description on the dataset page: https://huggingface.co/datasets/wheevu/ct219-vietnamese-raw-400k.

sourceHugging Faceunknownupdated 1mo agoView on Hugging Face
0likes9downloads
Dataset Card

wheevu/ct219-vietnamese-raw-400k

Bộ dữ liệu văn bản tiếng Việt thô đã tiền xử lý, dùng để huấn luyện next-token language model (CT219 - NLP final project).

Nguồn dữ liệu

  • Source dataset: VTSNLP/vietnamese_curated_dataset
  • Source split: train
  • Pinned source revision: b81fcce58945970117a1b56d50ec81be2628a5c3
  • Source licence: không công bố - repo này được tạo ở chế độ private vì lý do đó.

Mục đích

Huấn luyện next-token language model cho tiếng Việt.

Cách chọn 400k văn bản

  • Seed: 42
  • Deterministic reservoir sampling trên toàn bộ stream nguồn (12,169,131 văn bản đã duyệt).
  • Không chọn N văn bản đầu tiên; mẫu đồng đều trên phần đã quét.

Tiền xử lý và chuẩn hóa

  • NFC Unicode, giữ nguyên dấu tiếng Việt, chữ hoa, số, dấu câu, cấu trúc đoạn.
  • Kết thúc dòng về LF, khoảng trắng lặp gộp lại, tối đa một dòng trống liên tiếp.
  • Không tokenization, không hạ chữ thường, không bỏ dấu.

Khử trùng lặp

  • Trùng id và trùng văn bản chính xác sau chuẩn hóa (SHA-256) đều bị loại.
  • Backend: sqlite. Duplicate count: 661.

Chia tập

  • Phương pháp: stable hash của id và seed.
  • train: 359,988 (90%), validation: 20,028 (5%), test: 19,984 (5%).
  • Không có văn bản nào xuất hiện ở hai tập (đã kiểm chứng theo id và text_hash).

Schema

Các tệp parquet có cột: id, domain, text, text_hash, character_count.

Chính sách lọc chất lượng

  • Loại bỏ (mặc định): encoding_corruption (>= 3 ký tự U+FFFD), binary_or_invalid_content (Unicode bất thường >= 8 ký tự và >= 0.5%).
  • Chỉ audit (không loại): foreign_script_dominant, concatenated_dump, tín hiệu tiếng Việt thấp, VNI patterns. Xem data_contract.md trong repo mã nguồn.
  • Ngưỡng ngôn ngữ chưa được chốt bằng dữ liệu có nhãn; cần duyệt thủ công trước khi thay đổi.

Hạn chế đã biết

  • Mẫu đại diện cho phần stream đã quét (12,169,131 văn bản), không đảm bảo đại diện toàn bộ bộ dữ liệu gốc.
  • Có thể chứa văn bản không phải tiếng Việt (ước lượng < 1% qua audit) và boilerplate từ web.
  • Licence nguồn không rõ: dữ liệu này chỉ dùng trong phạm vi đồ án học tập.

Tái lập

bash
python -m src.data.preprocess --mode release-400k   --dataset VTSNLP/vietnamese_curated_dataset --dataset-split train   --dataset-revision b81fcce58945970117a1b56d50ec81be2628a5c3 --seed 42   --dedup-backend sqlite --output-dir data/releases/ct219-400k-v1

Mã nguồn: https://github.com/wheevu/ct219-final-report (nhánh feat/400k-huggingface-release) Checksums và row counts: xem manifest.jsonchecksums.txt trong repo này. Release version: v1