udold/czech-legal-sft-dataset
Czech Legal SFT Dataset Conversational dataset for fine-tuning Czech legal advisor language models. Sources roslein/Legal_advice_czech: 23,950 public legal Q&A from Czech advice websites kucerj56/czech-sacd-legal-questions: 200 expert Q&A from Nejvyšší správní soud roslein/Czech_legal_code: 3,080 Czech laws with document creation instructions Format Each sample contains a messages field — a list of dicts with role and content: [ {"role":… See the full description on the dataset page: https://huggingface.co/datasets/udold/czech-legal-sft-dataset.
Czech Legal SFT Dataset
Conversational dataset for fine-tuning Czech legal advisor language models.
Sources
- roslein/Legal_advice_czech: 23,950 public legal Q&A from Czech advice websites
- kucerj56/czech-sacd-legal-questions: 200 expert Q&A from Nejvyšší správní soud
- roslein/Czech_legal_code: 3,080 Czech laws with document creation instructions
Format
Each sample contains a messages field — a list of dicts with role and content:
[
{"role": "system", "content": "Jste zkušený český právní poradce..."},
{"role": "user", "content": "Jaké jsou podmínky pro..."},
{"role": "assistant", "content": "Podle § 5 odst. 2..."}
]Statistics
- Total samples: 27,148
- Average conversation length: 4.2 messages
- Languages: Czech (primary), Latin legal terms
Intended Use
Fine-tuning instruction-tuned LLMs for Czech legal QA and document drafting.
Loading
from datasets import load_dataset
dataset = load_dataset("udold/czech-legal-sft-dataset", split="train")Limitations
- Advice quality varies (public Q&A vs. expert SACD annotations)
- May contain outdated statutory references
- Not attorney-client privileged content
