Phonsiri/legal-chat-sft-dataset
Thai Legal Chat SFT Dataset (CoT & Hybrid RAG) ชุดข้อมูลสำหรับการทำ Instruction Fine-Tuning (SFT) เพื่อสร้าง AI ผู้ช่วยนักกฎหมายไทยที่มีความสามารถในการคิดวิเคราะห์แบบเป็นขั้นตอน (Chain-of-Thought) และมีความรู้กฎหมายที่ทันสมัยจากการใช้ Hybrid RAG (Retrieval-Augmented Generation) Dataset Summary ชุดข้อมูลนี้ถูกสร้างขึ้นแบบสังเคราะห์ (Synthetic Data) โดยใช้โมเดลภาษาขนาดใหญ่ (LLM) ตระกูล Qwen (27B+) บนขุมพลัง AMD MI300X ผ่านระบบ vLLM Monster Engine… See the full description on the dataset page: https://huggingface.co/datasets/Phonsiri/legal-chat-sft-dataset.
Thai Legal Chat SFT Dataset (CoT & Hybrid RAG)
ชุดข้อมูลสำหรับการทำ Instruction Fine-Tuning (SFT) เพื่อสร้าง AI ผู้ช่วยนักกฎหมายไทยที่มีความสามารถในการคิดวิเคราะห์แบบเป็นขั้นตอน (Chain-of-Thought) และมีความรู้กฎหมายที่ทันสมัยจากการใช้ Hybrid RAG (Retrieval-Augmented Generation)
Dataset Summary
ชุดข้อมูลนี้ถูกสร้างขึ้นแบบสังเคราะห์ (Synthetic Data) โดยใช้โมเดลภาษาขนาดใหญ่ (LLM) ตระกูล Qwen (27B+) บนขุมพลัง AMD MI300X ผ่านระบบ vLLM Monster Engine เพื่อรีดประสิทธิภาพสูงสุดในการผลิตข้อมูลคุณภาพสูงปริมาณมาก
Key Features
- Native Thinking (CoT): คำตอบของ AI ถูกออกแบบให้มีส่วน
<think>...</think>เพื่อจำลองกระบวนการวิเคราะห์ตัวบทกฎหมายก่อนจะสรุปคำตอบ - Hybrid Knowledge Base: ข้อมูลพื้นฐานที่ใช้ในการสร้างบทสนทนามาจาก 2 แหล่งหลัก:
- Cleaned Laws: ข้อมูลกฎหมายที่สะอาดจาก
pythainlp/thailaw-v1.0 - Modern Gazette: ประกาศราชกิจจานุเบกษาล่าสุดปี 2021-2025 จากโครงการ
open-law-data-thailand/soc-ratchakitcha(iApp OCR) - Two-Step Generation: กระบวนการสร้าง 2 ขั้นตอน (สร้างคำถามผู้เดือดร้อน -> วิเคราะห์มาตรากฎหมาย -> ตอบคำถามแบบมืออาชีพ)
Data Structure
ชุดข้อมูลอยู่ในรูปแบบ JSONL (JSON Lines) โดยแต่ละรายการประกอบด้วยบทสนทนาในรูปแบบ messages ที่รองรับการเทรนแบบ Chat Template ทั่วไป:
{
"messages": [
{"role": "system", "content": "คุณคือ AI ผู้ช่วยนักกฎหมายไทยที่เก่งที่สุด"},
{"role": "user", "content": "สอบถามเรื่องการกู้ยืมเงินเกิน 2,000 บาท ต้องทำสัญญาอย่างไร?"},
{"role": "assistant", "content": "<think>\nวิเคราะห์ประมวลกฎหมายแพ่งและพาณิชย์ มาตรา 653...\n</think>\nการกู้ยืมเงินเกินกว่า 2,000 บาทขึ้นไปนั้น..."}
]
}Data Fields
- messages: รายการบทสนทนา ประกอบด้วยบทบาท system, user และ assistant
- user: คำถามกฎหมายจากมุมมองชาวบ้านหรือผู้ใช้งานทั่วไป
- assistant: คำตอบจาก AI ทนายความที่มีส่วนวิเคราะห์ (Thinking) และส่วนสรุปเนื้อหา
Generation Methodology
ชุดข้อมูลนี้ถูกสร้างด้วยกระบวนการทางวิศวกรรมที่เน้นความเร็วและความถูกต้อง:
- RAG Retrieval: สุ่มดึงข้อความกฎหมายจากฐานข้อมูล Hybrid (PyThaiNLP + Ratchakitcha)
- Context Enrichment: นำชื่อเรื่องและเนื้อหากฎหมายมาประกอบเป็นบริบทให้ LLM
- High-Throughput Inference: ใช้ vLLM บน AMD MI300X ประมวลผลแบบ Batch (512 sequences) เพื่อความสม่ำเสมอของสไตล์ภาษา
Intended Use
- Fine-Tuning: เหมาะสำหรับเทรนโมเดลจำพวก Llama 3, Qwen 2.5 หรือ Mistral ให้มีความเชี่ยวชาญด้านกฎหมายไทย
- CoT Training: ใช้สำหรับสอนโมเดลให้รู้จักการให้เหตุผล (Reasoning) ก่อนตอบคำถามเชิงลึก
License & Disclaimer
- License: CC-BY-SA 4.0
- Disclaimer: ชุดข้อมูลนี้สร้างขึ้นโดย AI เพื่อวัตถุประสงค์ในการวิจัยและพัฒนาเทคโนโลยีเท่านั้น ไม่สามารถนำไปใช้อ้างอิงทางกฎหมายที่เป็นทางการได้ ผู้ใช้งานควรตรวจสอบความถูกต้องกับทนายความหรือตัวบทกฎหมายจริงจากราชกิจจานุเบกษาอีกครั้ง
Acknowledgments
ขอขอบคุณแหล่งข้อมูลจาก:
- Open Law Data Thailand และ สำนักเลขาธิการคณะรัฐมนตรี สำหรับข้อมูลราชกิจจานุเบกษา
- iApp Technology สำหรับการทำ OCR ข้อมูลคุณภาพสูง
- PyThaiNLP สำหรับชุดข้อมูลกฎหมายไทยที่สะอาดและพร้อมใช้งาน
