thinkPy/dpo-cultura-paraguaya-ranking
DPO Cultura Paraguaya — Ranking de Fragmentos Culturales Dataset de preferencias en español para entrenamiento con Direct Preference Optimization (DPO). Diseñado para enseñar a modelos a seleccionar y rankear fragmentos culturales paraguayos más relevantes dado un contexto conversacional. Nota: Este dataset contiene los pares (prompt, chosen, rejected) en formato de ranking puro. Una versión extendida con conclusiones narrativas culturales generadas (transiciones tipo "esto me… See the full description on the dataset page: https://huggingface.co/datasets/thinkPy/dpo-cultura-paraguaya-ranking.
DPO Cultura Paraguaya — Ranking de Fragmentos Culturales
Dataset de preferencias en español para entrenamiento con Direct Preference Optimization (DPO). Diseñado para enseñar a modelos a seleccionar y rankear fragmentos culturales paraguayos más relevantes dado un contexto conversacional.
Nota: Este dataset contiene los pares (prompt, chosen, rejected) en formato de ranking puro. Una versión extendida con conclusiones narrativas culturales generadas (transiciones tipo "esto me recuerda lo que decía mi abuelo...") estará disponible en thinkPy/dpo-cultura-paraguaya-narrativa.
Fuentes
Objetivo del Modelo
Este dataset entrena modelos para rankear fragmentos del corpus cultural paraguayo por relevancia dado un prompt conversacional. Es el paso previo a la generación de conclusiones narrativas culturales.
Estructura
Cada ejemplo contiene:
Subsets
Todos los subsets están perfectamente balanceados por corpus_id y ordenados por margin descendente (los subsets pequeños contienen los pares con mayor señal de preferencia).
Construcción del Score
score = corpusscore × topicscore × (topic_scale / 10)
Donde:
corpus_score: similitud semántica entre el prompt y el fragmento del corpustopic_score: score de relevancia temática asignado a la conversacióntopic_scale: peso manual por categoría temática
Topic Scale
Estadísticas
Filtros Aplicados
- Tokens por prompt: entre 71 y 519 (percentil 5 - percentil 75)
- Margen mínimo: 0.0114 (sin pares con señal negativa)
- Corpus ID 251 excluido
- Top 100 corpus IDs seleccionados por score mínimo
Uso
from datasets import load_dataset
# Subset recomendado para GPU limitada (<8GB)
ds = load_dataset("thinkPy/dpo-cultura-paraguaya-ranking", "dpo_5000")
# Dataset completo
ds = load_dataset("thinkPy/dpo-cultura-paraguaya-ranking", "dpo_full")
# Formato estándar DPO (TRL)
from trl import DPOTrainer
# prompt -> chosen / rejected listos para usarLicencia
Derivado de fuentes de acceso público. Uso académico y de investigación.
