CoolFace
Datasetpublic

Phettae/thai-multitask-starter

Thai Multitask 9.6K ชุดข้อมูลตั้งต้นสำหรับ instruction tuning ภาษาไทย ครอบคลุมงานสนทนา ถาม–ตอบ สรุป แปล จำแนกข้อความ ตรวจแก้ภาษา คณิตศาสตร์ และ structured output ข้อมูลทุกแถวสร้างขึ้นใหม่ด้วยกฎแบบ deterministic ไม่มีการคัดลอกจากเว็บไซต์หรือ ข้อมูลส่วนบุคคลจริง เหมาะสำหรับทดลอง supervised fine-tuning และทดสอบ pipeline แต่ควรเพิ่มข้อมูลที่มนุษย์ตรวจทานและข้อมูลภาษาธรรมชาติก่อนใช้กับระบบจริง จำนวนข้อมูลทั้งหมด 9,599 ตัวอย่าง: train 8,639, validation 480 และ test 480… See the full description on the dataset page: https://huggingface.co/datasets/Phettae/thai-multitask-starter.

sourceHugging Faceapache-2.0updated 1mo agoView on Hugging Face
0likes33downloads
Dataset Card

Thai Multitask 9.6K

ชุดข้อมูลตั้งต้นสำหรับ instruction tuning ภาษาไทย ครอบคลุมงานสนทนา ถาม–ตอบ สรุป แปล จำแนกข้อความ ตรวจแก้ภาษา คณิตศาสตร์ และ structured output

ข้อมูลทุกแถวสร้างขึ้นใหม่ด้วยกฎแบบ deterministic ไม่มีการคัดลอกจากเว็บไซต์หรือ ข้อมูลส่วนบุคคลจริง เหมาะสำหรับทดลอง supervised fine-tuning และทดสอบ pipeline แต่ควรเพิ่มข้อมูลที่มนุษย์ตรวจทานและข้อมูลภาษาธรรมชาติก่อนใช้กับระบบจริง

จำนวนข้อมูลทั้งหมด 9,599 ตัวอย่าง: train 8,639, validation 480 และ test 480

Schema

  • id: รหัสไม่ซ้ำ
  • task: ประเภทงาน
  • messages: รายการ role และ content
  • source: ที่มา
  • license: สัญญาอนุญาต
  • quality_score: คะแนน 0–1

Usage

python
from datasets import load_dataset
dataset = load_dataset("YOUR_USERNAME/thai-multitask-starter")

Limitations

ข้อมูลเป็น synthetic แบบใช้แม่แบบ จึงมีความหลากหลายทางภาษาน้อยกว่าข้อมูลจริง ยังไม่ครอบคลุมภาษาถิ่น ความรู้เฉพาะทาง หรือบทสนทนาหลายรอบ และไม่ควรใช้เป็น benchmark อ้างอิงสมรรถนะ

License

Apache-2.0