Phettae/thai-multitask-starter
Thai Multitask 9.6K ชุดข้อมูลตั้งต้นสำหรับ instruction tuning ภาษาไทย ครอบคลุมงานสนทนา ถาม–ตอบ สรุป แปล จำแนกข้อความ ตรวจแก้ภาษา คณิตศาสตร์ และ structured output ข้อมูลทุกแถวสร้างขึ้นใหม่ด้วยกฎแบบ deterministic ไม่มีการคัดลอกจากเว็บไซต์หรือ ข้อมูลส่วนบุคคลจริง เหมาะสำหรับทดลอง supervised fine-tuning และทดสอบ pipeline แต่ควรเพิ่มข้อมูลที่มนุษย์ตรวจทานและข้อมูลภาษาธรรมชาติก่อนใช้กับระบบจริง จำนวนข้อมูลทั้งหมด 9,599 ตัวอย่าง: train 8,639, validation 480 และ test 480… See the full description on the dataset page: https://huggingface.co/datasets/Phettae/thai-multitask-starter.
Thai Multitask 9.6K
ชุดข้อมูลตั้งต้นสำหรับ instruction tuning ภาษาไทย ครอบคลุมงานสนทนา ถาม–ตอบ สรุป แปล จำแนกข้อความ ตรวจแก้ภาษา คณิตศาสตร์ และ structured output
ข้อมูลทุกแถวสร้างขึ้นใหม่ด้วยกฎแบบ deterministic ไม่มีการคัดลอกจากเว็บไซต์หรือ ข้อมูลส่วนบุคคลจริง เหมาะสำหรับทดลอง supervised fine-tuning และทดสอบ pipeline แต่ควรเพิ่มข้อมูลที่มนุษย์ตรวจทานและข้อมูลภาษาธรรมชาติก่อนใช้กับระบบจริง
จำนวนข้อมูลทั้งหมด 9,599 ตัวอย่าง: train 8,639, validation 480 และ test 480
Schema
id: รหัสไม่ซ้ำtask: ประเภทงานmessages: รายการroleและcontentsource: ที่มาlicense: สัญญาอนุญาตquality_score: คะแนน 0–1
Usage
from datasets import load_dataset
dataset = load_dataset("YOUR_USERNAME/thai-multitask-starter")Limitations
ข้อมูลเป็น synthetic แบบใช้แม่แบบ จึงมีความหลากหลายทางภาษาน้อยกว่าข้อมูลจริง ยังไม่ครอบคลุมภาษาถิ่น ความรู้เฉพาะทาง หรือบทสนทนาหลายรอบ และไม่ควรใช้เป็น benchmark อ้างอิงสมรรถนะ
License
Apache-2.0
