CoolFace
Datasetpublic

bombman/thwiki-2026-super-clean-4k

🇹🇭 Thai Wikipedia Super-Clean (2026 Edition) Dataset ชุดนี้สกัดจาก Wikipedia ภาษาไทย (Dump 2026) โดยเน้นความสะอาดระดับ "Pro-Clean" เพื่อใช้สำหรับ Distillation และ Fine-tuning LLM โดยเฉพาะ Key Features High Information Density: คัดเฉพาะบทความที่มีเนื้อหายาวเกิน 1,000 ตัวอักษร และมีสัดส่วนภาษาไทย > 50% Pro-Cleaned: ลบชื่อไฟล์ภาพ (.jpg, .png), ขยะสัญลักษณ์ Wiki (==, '''), และวงเล็บเปล่าออกทั้งหมด Entity Preserved: เก็บเครื่องหมายคำพูด " "… See the full description on the dataset page: https://huggingface.co/datasets/bombman/thwiki-2026-super-clean-4k.

sourceHugging Faceapache-2.0updated 5mo agoView on Hugging Face
0likes25downloads
Dataset Card

🇹🇭 Thai Wikipedia Super-Clean (2026 Edition)

Dataset ชุดนี้สกัดจาก Wikipedia ภาษาไทย (Dump 2026) โดยเน้นความสะอาดระดับ "Pro-Clean" เพื่อใช้สำหรับ Distillation และ Fine-tuning LLM โดยเฉพาะ

Key Features

  • —High Information Density: คัดเฉพาะบทความที่มีเนื้อหายาวเกิน 1,000 ตัวอักษร และมีสัดส่วนภาษาไทย > 50%
  • —Pro-Cleaned: ลบชื่อไฟล์ภาพ (.jpg, .png), ขยะสัญลักษณ์ Wiki (==, '''), และวงเล็บเปล่าออกทั้งหมด
  • —Entity Preserved: เก็บเครื่องหมายคำพูด " " เพื่อคงขอบเขตของชื่อเฉพาะและสถานที่ไว้
  • —Randomized: สุ่มหยิบข้อมูลจากทั้งไฟล์เพื่อให้ได้ความหลากหลายของเนื้อหา