CoolFace
Datasetpublic

thinkPy/dpo-cultura-paraguaya-ranking

DPO Cultura Paraguaya — Ranking de Fragmentos Culturales Dataset de preferencias en español para entrenamiento con Direct Preference Optimization (DPO). Diseñado para enseñar a modelos a seleccionar y rankear fragmentos culturales paraguayos más relevantes dado un contexto conversacional. Nota: Este dataset contiene los pares (prompt, chosen, rejected) en formato de ranking puro. Una versión extendida con conclusiones narrativas culturales generadas (transiciones tipo "esto me… See the full description on the dataset page: https://huggingface.co/datasets/thinkPy/dpo-cultura-paraguaya-ranking.

sourceHugging Faceapache-2.0updated 4mo agoView on Hugging Face
0likes7downloads
Dataset Card

DPO Cultura Paraguaya — Ranking de Fragmentos Culturales

Dataset de preferencias en español para entrenamiento con Direct Preference Optimization (DPO). Diseñado para enseñar a modelos a seleccionar y rankear fragmentos culturales paraguayos más relevantes dado un contexto conversacional.

Nota: Este dataset contiene los pares (prompt, chosen, rejected) en formato de ranking puro. Una versión extendida con conclusiones narrativas culturales generadas (transiciones tipo "esto me recuerda lo que decía mi abuelo...") estará disponible en thinkPy/dpo-cultura-paraguaya-narrativa.

Fuentes

DatasetDescripción
thinkPy/ultrachat-es-30k-topicsConversaciones en español con tópicos y scores
thinkPy/corpus-cultura-paraguayaCorpus de referencia cultural paraguaya

Objetivo del Modelo

Este dataset entrena modelos para rankear fragmentos del corpus cultural paraguayo por relevancia dado un prompt conversacional. Es el paso previo a la generación de conclusiones narrativas culturales.

Estructura

Cada ejemplo contiene:

CampoDescripción
promptMensaje del asistente extraído de ultrachat-es-30k-topics
chosenFragmento del corpus cultural paraguayo con mayor score de relevancia
rejectedFragmento del corpus cultural paraguayo con menor score de relevancia
topicTema de la conversación
score_chosenScore ponderado del chosen
score_rejectedScore ponderado del rejected
marginDiferencia entre chosen y rejected (scorechosen - scorerejected)

Subsets

SubsetParesCorpus IDsPares por corpusGPU recomendada
dpo_50005,00010050<8GB
dpo_1000010,0001001008GB
dpo_2000020,00010020016GB
dpo_full44,200100442>16GB

Todos los subsets están perfectamente balanceados por corpus_id y ordenados por margin descendente (los subsets pequeños contienen los pares con mayor señal de preferencia).

Construcción del Score

score = corpusscore × topicscore × (topic_scale / 10)

Donde:

  • —corpus_score: similitud semántica entre el prompt y el fragmento del corpus
  • —topic_score: score de relevancia temática asignado a la conversación
  • —topic_scale: peso manual por categoría temática

Topic Scale

TopicScale
medio ambiente9
literatura8
educación8
humanidades8
cultura8
salud7
histórico7
geografía7
sociedad7
tecnología5
política5
economía5
deportes3
ciencia3
entretenimiento3
matemática3

Estadísticas

MétricaValor
Conversaciones únicas (prompts)8,407
Corpus IDs100
Margen promedio (chosen - rejected)0.1842
Margen mínimo0.0114
Margen máximo0.4550
Tokens por prompt (mediana)372
Rango de tokens por prompt71 - 519

Filtros Aplicados

  • —Tokens por prompt: entre 71 y 519 (percentil 5 - percentil 75)
  • —Margen mínimo: 0.0114 (sin pares con señal negativa)
  • —Corpus ID 251 excluido
  • —Top 100 corpus IDs seleccionados por score mínimo

Uso

python
from datasets import load_dataset

# Subset recomendado para GPU limitada (<8GB)
ds = load_dataset("thinkPy/dpo-cultura-paraguaya-ranking", "dpo_5000")

# Dataset completo
ds = load_dataset("thinkPy/dpo-cultura-paraguaya-ranking", "dpo_full")

# Formato estándar DPO (TRL)
from trl import DPOTrainer
# prompt -> chosen / rejected listos para usar

Licencia

Derivado de fuentes de acceso público. Uso académico y de investigación.