CoolFace
Datasetpublic

thinkPy/oasst2-es-3k-topics

oasst2-short-es-topics Dataset de conversaciones cortas en español con clasificación automática de tópicos, derivado de thinkPy/oasst2-short-es. Origen thinkPy/oasst2-short-es es una versión en español de conversaciones cortas basadas en OpenAssistant/oasst2. Este dataset toma una muestra aleatoria (seed=42) y agrega dos columnas de clasificación temática. Clasificación de tópicos Se utilizó el modelo MoritzLaurer/mDeBERTa-v3-base-mnli-xnli con… See the full description on the dataset page: https://huggingface.co/datasets/thinkPy/oasst2-es-3k-topics.

sourceHugging Facemitupdated 4mo agoView on Hugging Face
1likes9downloads
Dataset Card

oasst2-short-es-topics

Dataset de conversaciones cortas en español con clasificación automática de tópicos, derivado de thinkPy/oasst2-short-es.

Origen

thinkPy/oasst2-short-es es una versión en español de conversaciones cortas basadas en OpenAssistant/oasst2. Este dataset toma una muestra aleatoria (seed=42) y agrega dos columnas de clasificación temática.

Clasificación de tópicos

Se utilizó el modelo MoritzLaurer/mDeBERTa-v3-base-mnli-xnli con zero-shot classification (NLI) sobre el primer mensaje del usuario, truncado a 256 caracteres.

Tópicos disponibles
tópicodescripción
tecnologíaprogramación, software, hardware, IA
matemáticaálgebra, estadística, cálculo
cienciafísica, química, biología, investigación
humanidadesfilosofía, lingüística, literatura
historiaeventos y personajes históricos
culturatradiciones, arte, música, gastronomía
políticagobierno, relaciones internacionales
economíafinanzas, mercados, emprendimiento
saludmedicina, bienestar, nutrición
educaciónpedagogía, aprendizaje, academia
sociedadrelaciones, ética, vida cotidiana
medio ambienteecología, cambio climático, naturaleza
entretenimientocine, videojuegos, viajes
deportescompetencias, disciplinas, actividad física

Esquema

json
{
  "id": "0",
  "messages": [
    {"role": "user", "content": "..."},
    {"role": "assistant", "content": "..."}
  ],
  "lang": "es",
  "topic": "cultura",
  "topic_score": 0.7231
}

Uso

python
from datasets import load_dataset

ds = load_dataset("thinkPy/oasst2-short-es-topics", split="train")

# Filtrar por tópico
ds_cultura = ds.filter(lambda x: x["topic"] == "cultura")

# Filtrar por confianza
ds_alta_confianza = ds.filter(lambda x: x["topic_score"] >= 0.5)

Limitaciones

  • La clasificación es automática y puede contener errores, especialmente en textos ambiguos o muy cortos.
  • Los ejemplos con topic_score bajo deben tratarse con cautela.