CoolFace
Datasetpublic

celsowm/valdoria-sft-qwen35-dataset

Dataset Card — Valdoria SFT Pack v3.3.1 Dataset sintético em português para Supervised Fine-Tuning (SFT), baseado em um país fictício chamado República de Valdoria. Formato ChatML (messages), combinando os splits train + validation (2125 exemplos). Descrição Cobertura de tarefas: factual_qa (358) fantasy_boundary (534) refusal (251) unknown_canonical_field (252) negative_case (200) decision_making (191) rule_application (108) classification (131)… See the full description on the dataset page: https://huggingface.co/datasets/celsowm/valdoria-sft-qwen35-dataset.

sourceHugging Facemitupdated 3mo agoView on Hugging Face
0likes18downloads
Dataset Card

Dataset Card — Valdoria SFT Pack v3.3.1

Dataset sintético em português para Supervised Fine-Tuning (SFT), baseado em um país fictício chamado República de Valdoria. Formato ChatML (messages), combinando os splits train + validation (2125 exemplos).

Descrição

Cobertura de tarefas:

  • —factual_qa (358)
  • —fantasy_boundary (534)
  • —refusal (251)
  • —unknown_canonical_field (252)
  • —negative_case (200)
  • —decision_making (191)
  • —rule_application (108)
  • —classification (131)
  • —clarification_request (64)
  • —e outros

Comportamentos treinados

  • —Respostas canônicas com cabeçalho ⟦VALDORIA-CANON-v3.3⟧
  • —Recusa de pressupostos fantásticos
  • —Limites de escopo quando o cânone não contém o dado pedido
  • —Comparações de regras e documentos

Uso

python
from datasets import load_dataset
ds = load_dataset("celsowm/valdoria-sft-qwen35-dataset")

Modelo alvo

Qwen/Qwen3.5-0.8B via Full SFT.

Limitações

  • —Valdoria é fictícia; os fatos canônicos não refletem o mundo real.
  • —Dataset sintético, não anotado por humanos.