CoolFace
Datasetpublic

udold/czech-legal-sft-dataset

Czech Legal SFT Dataset Conversational dataset for fine-tuning Czech legal advisor language models. Sources roslein/Legal_advice_czech: 23,950 public legal Q&A from Czech advice websites kucerj56/czech-sacd-legal-questions: 200 expert Q&A from Nejvyšší správní soud roslein/Czech_legal_code: 3,080 Czech laws with document creation instructions Format Each sample contains a messages field — a list of dicts with role and content: [ {"role":… See the full description on the dataset page: https://huggingface.co/datasets/udold/czech-legal-sft-dataset.

sourceHugging Facecc-by-nc-4.0updated 5mo agoView on Hugging Face
0likes62downloads
Dataset Card

Czech Legal SFT Dataset

Conversational dataset for fine-tuning Czech legal advisor language models.

Sources

  • —roslein/Legal_advice_czech: 23,950 public legal Q&A from Czech advice websites
  • —kucerj56/czech-sacd-legal-questions: 200 expert Q&A from Nejvyšší správní soud
  • —roslein/Czech_legal_code: 3,080 Czech laws with document creation instructions

Format

Each sample contains a messages field — a list of dicts with role and content:

json
[
  {"role": "system", "content": "Jste zkušený český právní poradce..."},
  {"role": "user", "content": "Jaké jsou podmínky pro..."},
  {"role": "assistant", "content": "Podle § 5 odst. 2..."}
]

Statistics

  • —Total samples: 27,148
  • —Average conversation length: 4.2 messages
  • —Languages: Czech (primary), Latin legal terms

Intended Use

Fine-tuning instruction-tuned LLMs for Czech legal QA and document drafting.

Loading

python
from datasets import load_dataset
dataset = load_dataset("udold/czech-legal-sft-dataset", split="train")

Limitations

  • —Advice quality varies (public Q&A vs. expert SACD annotations)
  • —May contain outdated statutory references
  • —Not attorney-client privileged content