CoolFace
Datasetpublic

rjcg/efemerides-cumana-sft-qa-small

Efemérides de Cumaná/Venezuela – Dataset de Preguntas y Respuestas para SFT Descripción general Este dataset contiene un conjunto curado de pares pregunta–respuesta en español, diseñado específicamente para ajuste fino supervisado (Supervised Fine-Tuning, SFT) de modelos de lenguaje de gran tamaño (LLMs). El contenido se centra en la historia de Cumaná, ciudad de Venezuela durante el período de la Guerra de Independencia, con énfasis en la interpretación histórica… See the full description on the dataset page: https://huggingface.co/datasets/rjcg/efemerides-cumana-sft-qa-small.

sourceHugging Facemitupdated 9mo agoView on Hugging Face
0likes35downloads
Dataset Card

Efemérides de Cumaná/Venezuela – Dataset de Preguntas y Respuestas para SFT

Descripción general

Este dataset contiene un conjunto curado de pares pregunta–respuesta en español, diseñado específicamente para ajuste fino supervisado (Supervised Fine-Tuning, SFT) de modelos de lenguaje de gran tamaño (LLMs). El contenido se centra en la historia de Cumaná, ciudad de Venezuela durante el período de la Guerra de Independencia, con énfasis en la interpretación histórica, el análisis crítico de fuentes y el uso de un tono académico en las respuestas.

A diferencia de datasets históricos basados en documentos en bruto o cronologías extensas, este conjunto de datos adopta un enfoque conversacional e instructivo, transformando material histórico en preguntas explícitas que requieren razonamiento contextual y respuestas argumentadas. El objetivo principal no es la inyección masiva de hechos nuevos, sino la alineación del comportamiento del modelo hacia un estilo analítico, reflexivo y contextualizado al responder consultas históricas.


Motivación y objetivos

El dataset fue creado como parte de un proceso experimental de afinado de modelos de lenguaje, con los siguientes objetivos:

  • —Evaluar pipelines de ajuste fino supervisado con conjuntos de datos pequeños y de alta calidad.
  • —Ajustar el estilo discursivo del modelo hacia respuestas históricas de carácter académico.
  • —Fomentar la interpretación crítica de eventos históricos, en lugar de la simple enumeración de hechos.
  • —Probar la viabilidad de datasets compactos para alineación conductual, especialmente en contextos educativos y humanísticos.

Este enfoque responde a la premisa de que, en tareas de SFT, la calidad y coherencia semántica de las muestras es más relevante que el volumen de datos, particularmente cuando se emplean técnicas como LoRA.


Contenido del dataset

Cada entrada del dataset representa una unidad conversacional completa, compuesta por los siguientes campos:

json
{
  "instruction": "string",
  "context": "string",
  "response": "string",
  "category": "string"
}

Descripción de los campos

  • —instruction Pregunta o instrucción formulada para inducir razonamiento histórico. Las preguntas están diseñadas para no admitir respuestas genéricas o intercambiables.
  • —context Marco temporal, geográfico o situacional mínimo que orienta la respuesta. No pretende sustituir a una fuente primaria, sino situar al modelo dentro de un escenario histórico concreto.
  • —response Respuesta elaborada en español, con tono académico e interpretativo. Las respuestas priorizan la explicación causal, las consecuencias sociales y políticas, y la lectura crítica de los hechos.
  • —category Clasificación temática general (por ejemplo: Guerra de Independencia, demografía, política y administración, memoria histórica), utilizada para organización y análisis del dataset.

Metodología de construcción

El dataset fue construido mediante un proceso de curaduría manual y síntesis conceptual a partir de textos históricos y reflexiones interpretativas sobre el período independentista venezolano. En lugar de conservar documentos históricos en su forma original, el contenido fue reinterpretado y reformulado como pares pregunta–respuesta, siguiendo criterios de claridad, especificidad y relevancia histórica.

Durante la construcción se aplicaron las siguientes reglas:

  • —Cada pregunta debe requerir comprensión histórica y no permitir respuestas triviales.
  • —Cada respuesta debe ser específica a su pregunta y no intercambiable con otras.
  • —Se evitaron formulaciones repetitivas o plantillas genéricas.
  • —Se priorizó la coherencia narrativa y el tono académico sobre la exhaustividad factual.

Tamaño del dataset

El dataset contiene aproximadamente 100 pares de pregunta–respuesta.

Este tamaño está pensado para:

  • —Ajustes finos de comportamiento y estilo.
  • —Validación técnica de pipelines de entrenamiento.
  • —Experimentos con LoRA y otros métodos de afinado eficiente.

No está destinado a entrenamientos a gran escala ni a la creación de modelos con conocimiento histórico exhaustivo.


Uso previsto

Este dataset está diseñado para ser utilizado en:

  • —Ajuste fino supervisado (SFT) de modelos tipo LLaMA o Gemma.
  • —Experimentos de alineación conversacional en español.
  • —Contextos educativos, académicos o exploratorios relacionados con historia y humanidades.

Es compatible con plantillas de chat del ecosistema LLaMA 3.x, incluyendo configuraciones usadas por frameworks como Unsloth.


Usos fuera de alcance

Este dataset no debe utilizarse para:

  • —Verificación factual automática de hechos históricos.
  • —Sustituir fuentes primarias o secundarias de investigación histórica.
  • —Sistemas de toma de decisiones históricas o políticas.

Las respuestas generadas por modelos entrenados con este dataset deben ser contrastadas con fuentes historiográficas confiables.


Limitaciones y sesgos

Como todo dataset de carácter histórico e interpretativo, este conjunto refleja una perspectiva analítica particular, influida por la selección de temas, preguntas y marcos interpretativos. Además, debido a su tamaño reducido, no cubre de forma exhaustiva la diversidad de eventos, regiones o actores del período estudiado.

Los usuarios deben ser conscientes de que el ajuste fino realizado con este dataset modifica principalmente el estilo y la estructura de las respuestas, y no garantiza mayor precisión factual.


Consideraciones éticas

El dataset aborda episodios de violencia, conflicto armado y represión propios de la Guerra de Independencia. El tratamiento de estos temas es analítico y educativo, sin intención de justificar ni glorificar la violencia histórica.


Citación

Si utilizas este dataset en trabajos académicos, experimentales o educativos, por favor cítalo como:

Rommel Contreras, Efemérides de Cumaná/Venezuela – Dataset de Preguntas y Respuestas para SFT, Hugging Face, 2025.


Fuentes de referencia

Como fuente contextual primaria se utilizó el blog *Efemérides AGHES* de la Academia de GeoHistoria del Estado Sucre / Venezuela, consultado a través de su canal RSS oficial:

Efemérides Cumaná. Feed RSS. Disponible en: https://efemeridescumana.blogspot.com/feeds/posts/default?alt=rss Consulta realizada en: enero de 2025.

El contenido fue empleado como material de referencia temática, sirviendo de base para inferencias semánticas y construcción de pares pregunta–respuesta, sin reproducción literal de los textos originales.


Notas finales

Este dataset fue concebido como una herramienta experimental de alineación conductual, no como un compendio histórico definitivo. Su principal valor reside en demostrar cómo conjuntos pequeños, bien diseñados y semánticamente coherentes pueden ser utilizados para ajustar modelos de lenguaje hacia estilos de respuesta más reflexivos y contextualizados.