wheevu/ct219-vietnamese-raw-400k
wheevu/ct219-vietnamese-raw-400k Bộ dữ liệu văn bản tiếng Việt thô đã tiền xử lý, dùng để huấn luyện next-token language model (CT219 - NLP final project). Nguồn dữ liệu Source dataset: VTSNLP/vietnamese_curated_dataset Source split: train Pinned source revision: b81fcce58945970117a1b56d50ec81be2628a5c3 Source licence: không công bố - repo này được tạo ở chế độ private vì lý do đó. Mục đích Huấn luyện next-token language model cho tiếng Việt.… See the full description on the dataset page: https://huggingface.co/datasets/wheevu/ct219-vietnamese-raw-400k.
011
