CoolFace
Datasetpublic

Phonsiri/legal-chat-sft-dataset

Thai Legal Chat SFT Dataset (CoT & Hybrid RAG) ชุดข้อมูลสำหรับการทำ Instruction Fine-Tuning (SFT) เพื่อสร้าง AI ผู้ช่วยนักกฎหมายไทยที่มีความสามารถในการคิดวิเคราะห์แบบเป็นขั้นตอน (Chain-of-Thought) และมีความรู้กฎหมายที่ทันสมัยจากการใช้ Hybrid RAG (Retrieval-Augmented Generation) Dataset Summary ชุดข้อมูลนี้ถูกสร้างขึ้นแบบสังเคราะห์ (Synthetic Data) โดยใช้โมเดลภาษาขนาดใหญ่ (LLM) ตระกูล Qwen (27B+) บนขุมพลัง AMD MI300X ผ่านระบบ vLLM Monster Engine… See the full description on the dataset page: https://huggingface.co/datasets/Phonsiri/legal-chat-sft-dataset.

sourceHugging Facecc-by-sa-4.0updated 5mo agoView on Hugging Face
1likes41downloads
Dataset Card

Thai Legal Chat SFT Dataset (CoT & Hybrid RAG)

ชุดข้อมูลสำหรับการทำ Instruction Fine-Tuning (SFT) เพื่อสร้าง AI ผู้ช่วยนักกฎหมายไทยที่มีความสามารถในการคิดวิเคราะห์แบบเป็นขั้นตอน (Chain-of-Thought) และมีความรู้กฎหมายที่ทันสมัยจากการใช้ Hybrid RAG (Retrieval-Augmented Generation)

Dataset Summary

ชุดข้อมูลนี้ถูกสร้างขึ้นแบบสังเคราะห์ (Synthetic Data) โดยใช้โมเดลภาษาขนาดใหญ่ (LLM) ตระกูล Qwen (27B+) บนขุมพลัง AMD MI300X ผ่านระบบ vLLM Monster Engine เพื่อรีดประสิทธิภาพสูงสุดในการผลิตข้อมูลคุณภาพสูงปริมาณมาก

Key Features

  • —Native Thinking (CoT): คำตอบของ AI ถูกออกแบบให้มีส่วน <think>...</think> เพื่อจำลองกระบวนการวิเคราะห์ตัวบทกฎหมายก่อนจะสรุปคำตอบ
  • —Hybrid Knowledge Base: ข้อมูลพื้นฐานที่ใช้ในการสร้างบทสนทนามาจาก 2 แหล่งหลัก:
  • —Cleaned Laws: ข้อมูลกฎหมายที่สะอาดจาก pythainlp/thailaw-v1.0
  • —Modern Gazette: ประกาศราชกิจจานุเบกษาล่าสุดปี 2021-2025 จากโครงการ open-law-data-thailand/soc-ratchakitcha (iApp OCR)
  • —Two-Step Generation: กระบวนการสร้าง 2 ขั้นตอน (สร้างคำถามผู้เดือดร้อน -> วิเคราะห์มาตรากฎหมาย -> ตอบคำถามแบบมืออาชีพ)

Data Structure

ชุดข้อมูลอยู่ในรูปแบบ JSONL (JSON Lines) โดยแต่ละรายการประกอบด้วยบทสนทนาในรูปแบบ messages ที่รองรับการเทรนแบบ Chat Template ทั่วไป:

json
{
  "messages": [
    {"role": "system", "content": "คุณคือ AI ผู้ช่วยนักกฎหมายไทยที่เก่งที่สุด"},
    {"role": "user", "content": "สอบถามเรื่องการกู้ยืมเงินเกิน 2,000 บาท ต้องทำสัญญาอย่างไร?"},
    {"role": "assistant", "content": "<think>\nวิเคราะห์ประมวลกฎหมายแพ่งและพาณิชย์ มาตรา 653...\n</think>\nการกู้ยืมเงินเกินกว่า 2,000 บาทขึ้นไปนั้น..."}
  ]
}

Data Fields

  • —messages: รายการบทสนทนา ประกอบด้วยบทบาท system, user และ assistant
  • —user: คำถามกฎหมายจากมุมมองชาวบ้านหรือผู้ใช้งานทั่วไป
  • —assistant: คำตอบจาก AI ทนายความที่มีส่วนวิเคราะห์ (Thinking) และส่วนสรุปเนื้อหา

Generation Methodology

ชุดข้อมูลนี้ถูกสร้างด้วยกระบวนการทางวิศวกรรมที่เน้นความเร็วและความถูกต้อง:

  1. 1.RAG Retrieval: สุ่มดึงข้อความกฎหมายจากฐานข้อมูล Hybrid (PyThaiNLP + Ratchakitcha)
  2. 2.Context Enrichment: นำชื่อเรื่องและเนื้อหากฎหมายมาประกอบเป็นบริบทให้ LLM
  3. 3.High-Throughput Inference: ใช้ vLLM บน AMD MI300X ประมวลผลแบบ Batch (512 sequences) เพื่อความสม่ำเสมอของสไตล์ภาษา

Intended Use

  • —Fine-Tuning: เหมาะสำหรับเทรนโมเดลจำพวก Llama 3, Qwen 2.5 หรือ Mistral ให้มีความเชี่ยวชาญด้านกฎหมายไทย
  • —CoT Training: ใช้สำหรับสอนโมเดลให้รู้จักการให้เหตุผล (Reasoning) ก่อนตอบคำถามเชิงลึก

License & Disclaimer

  • —License: CC-BY-SA 4.0
  • —Disclaimer: ชุดข้อมูลนี้สร้างขึ้นโดย AI เพื่อวัตถุประสงค์ในการวิจัยและพัฒนาเทคโนโลยีเท่านั้น ไม่สามารถนำไปใช้อ้างอิงทางกฎหมายที่เป็นทางการได้ ผู้ใช้งานควรตรวจสอบความถูกต้องกับทนายความหรือตัวบทกฎหมายจริงจากราชกิจจานุเบกษาอีกครั้ง

Acknowledgments

ขอขอบคุณแหล่งข้อมูลจาก:

  • —Open Law Data Thailand และ สำนักเลขาธิการคณะรัฐมนตรี สำหรับข้อมูลราชกิจจานุเบกษา
  • —iApp Technology สำหรับการทำ OCR ข้อมูลคุณภาพสูง
  • —PyThaiNLP สำหรับชุดข้อมูลกฎหมายไทยที่สะอาดและพร้อมใช้งาน