CoolFace
Datasetpublic

AngelGabrielTroncoso/dataset-aeroespacial-cultural-somosnlp

LATAM Aerospace History QA Descripción General LATAM Aerospace History QA es un dataset curado orientado a instruction tuning y sistemas conversacionales culturalmente alineados para Iberoamérica. El dataset se enfoca principalmente en español, incorporando además cobertura parcial en portugués brasileño para mejorar representación multicultural y multilingüe dentro de modelos de lenguaje abiertos. La colección está especializada en: historia aeroespacial… See the full description on the dataset page: https://huggingface.co/datasets/AngelGabrielTroncoso/dataset-aeroespacial-cultural-somosnlp.

sourceHugging Facecc-by-4.0updated 4mo agoView on Hugging Face
0likes41downloads
Dataset Card

LATAM Aerospace History QA

Descripción General

LATAM Aerospace History QA es un dataset curado orientado a instruction tuning y sistemas conversacionales culturalmente alineados para Iberoamérica.

El dataset se enfoca principalmente en español, incorporando además cobertura parcial en portugués brasileño para mejorar representación multicultural y multilingüe dentro de modelos de lenguaje abiertos.

La colección está especializada en:

  • —historia aeroespacial,
  • —programas espaciales latinoamericanos,
  • —desarrollo satelital,
  • —geopolítica tecnológica,
  • —patrimonio científico de América Latina y España.

El dataset fue diseñado para:

  • —Instruction tuning
  • —Fine-tuning supervisado (SFT)
  • —Sistemas conversacionales en español y portugués
  • —Generación de datos sintéticos
  • —Benchmarks QA históricos
  • —Aplicaciones RAG
  • —Modelos culturalmente alineados

A diferencia de datasets traducidos automáticamente o excesivamente académicos, esta colección prioriza:

  • —Lenguaje humano natural
  • —Diversidad dialectal iberoamericana
  • —Conversaciones realistas
  • —Fluidez cultural
  • —Precisión histórica y técnica
  • —Variabilidad lingüística

El objetivo principal es mejorar el comportamiento de modelos LLM en lenguas iberoamericanas dentro de dominios históricos, científicos y culturales relacionados con el sector aeroespacial regional.


Motivación

La historia aeroespacial de América Latina, Brasil y España se encuentra subrepresentada en datasets públicos para entrenamiento de modelos de lenguaje.

La mayoría de datasets existentes:

  • —están dominados por contenido en inglés,
  • —utilizan traducciones automáticas,
  • —carecen de contexto cultural iberoamericano,
  • —presentan lenguaje excesivamente robótico o académico.

Este dataset busca reducir esas limitaciones mediante ejemplos diseñados para sonar como conversaciones humanas reales en español y portugués.


Estructura del Dataset

Cada ejemplo sigue una estructura tipo instruction-tuning:

json
{
  "instruction": "¿Qué pasó con la primera misión satelital chilena?",
  "context": "Misión FASat-Alfa (Chile). Lanzamiento: 1995...",
  "response": "El FASat-Alfa fue el primer satélite chileno..."
}

Campos del Dataset

instruction

Pregunta formulada en lenguaje natural simulando patrones humanos reales.

Incluye:

  • —preguntas coloquiales,
  • —formulaciones técnicas,
  • —estilo periodístico,
  • —lenguaje educativo,
  • —preguntas ambiguas,
  • —variaciones regionales del español y portugués.

Ejemplos:

  • —"¿Cachai por qué falló el FASat?"
  • —"¿Qué tan avanzado era el Cóndor II?"
  • —"Explícame fácil qué hacía ese satélite."
  • —"Por que o programa espacial brasileiro foi importante?"

context

Contexto factual comprimido utilizado como base de generación.

Generalmente contiene:

  • —nombre de misión,
  • —país,
  • —fecha,
  • —operador,
  • —tipo de vehículo,
  • —clasificación técnica,
  • —estado de misión,
  • —notas históricas.

Este campo puede utilizarse en:

  • —Retrieval-Augmented Generation (RAG),
  • —generación controlada,
  • —fine-tuning supervisado,
  • —destilación de conocimiento.

response

Respuesta generada utilizando información histórica y técnica contextualizada.

Las respuestas fueron diseñadas para equilibrar:

  • —precisión,
  • —claridad,
  • —naturalidad conversacional,
  • —valor educativo,
  • —coherencia cultural.

Cobertura Temática

El dataset incluye ejemplos relacionados con:

  • —Satélites
  • —Misiones espaciales
  • —Cohetería
  • —Guerra Fría
  • —Telecomunicaciones
  • —Observación terrestre
  • —Accidentes aeroespaciales
  • —Programas militares
  • —Desarrollo tecnológico latinoamericano
  • —Geopolítica científica
  • —Agencias espaciales
  • —Patrimonio científico regional

Países Representados

Incluye contenido relacionado con:

  • —Argentina
  • —Chile
  • —Brasil
  • —México
  • —España
  • —Cuba
  • —Perú
  • —Colombia
  • —Venezuela
  • —Cooperaciones regionales latinoamericanas
  • —Cooperaciones iberoamericanas

Cobertura Lusófona

El dataset incorpora ejemplos limitados en portugués brasileño orientados a mejorar la representación cultural iberoamericana dentro de modelos conversacionales.

Incluye referencias relacionadas con:

  • —Programa espacial brasileño
  • —INPE
  • —Satélites CBERS
  • —Centro de Lanzamento de Alcântara
  • —Cooperación Brasil-China
  • —Variaciones lingüísticas del portugués brasileño

El objetivo es expandir progresivamente la cobertura multicultural y multilingüe del dataset.


Diversidad Lingüística

El dataset incorpora variaciones reales de lenguas iberoamericanas.

EstiloEjemplo
Coloquial chileno"¿Cachai por qué falló el FASat?"
Técnico argentino"¿Qué capacidades tenía el Cóndor II?"
Conversacional mexicano"¿Neta México fue pionero espacial?"
Académico español"¿Cómo evolucionó el INTA durante la Guerra Fría?"
Portugués brasileño"Por que o programa espacial brasileiro foi importante?"
Periodístico"¿Qué impacto geopolítico tuvo el programa espacial brasileño?"

El objetivo fue reducir patrones robóticos frecuentes en datasets sintéticos tradicionales.


Metodología de Curación

El dataset fue construido mediante:

  • —generación sintética controlada,
  • —reformulación lingüística,
  • —augmentación dialectal,
  • —validación contextual,
  • —curación manual parcial.

Los objetivos principales fueron:

  • —mejorar naturalidad conversacional,
  • —aumentar diversidad de instrucciones,
  • —mantener coherencia histórica,
  • —reducir repetición sintáctica,
  • —incorporar identidad cultural regional.

Casos de Uso Recomendados

Este dataset puede utilizarse para:

  • —Fine-tuning supervisado (SFT)
  • —Instruction tuning
  • —Chatbots educativos
  • —Sistemas QA históricos
  • —Aplicaciones RAG
  • —Benchmarks multilingües
  • —Generación sintética adicional
  • —Evaluación de fluidez conversacional
  • —Modelos culturalmente alineados

Calidad del Dataset

El dataset fue diseñado para minimizar:

  • —respuestas robóticas,
  • —patrones repetitivos,
  • —traducciones literales,
  • —rigidez sintáctica,
  • —lenguaje excesivamente neutral.

La curación priorizó:

  • —naturalidad,
  • —diversidad lingüística,
  • —coherencia contextual,
  • —identidad cultural regional.

Formato del Archivo

El dataset se distribuye en formato JSONL.

Cada línea contiene un ejemplo independiente:

json
{"instruction":"...","context":"...","response":"..."}

Campos principales:

CampoDescripción
instructionPregunta del usuario
contextContexto factual
responseRespuesta generada

Validación del JSONL

Para evitar errores en el Dataset Viewer de Hugging Face, se recomienda validar el archivo train.jsonl antes de subirlo.

Script recomendado:

python
import json

with open("train.jsonl", "r", encoding="utf-8") as f:
    for i, line in enumerate(f, 1):
        try:
            json.loads(line)
        except Exception as e:
            print(f"Error en línea {i}: {e}")

Cada línea debe contener un único objeto JSON válido.

Ejemplo correcto:

json
{"instruction":"¿Qué pasó con el FASat-Alfa?","context":"Misión chilena de 1995...","response":"El FASat-Alfa fue el primer satélite chileno..."}

Ejemplos de Uso

Fine-Tuning Conversacional

Entrenamiento de modelos en español y portugués con conocimiento histórico y cultural especializado.

Sistemas Educativos

Creación de asistentes educativos sobre historia espacial latinoamericana e iberoamericana.

RAG Histórico

Uso del campo context como metadata estructurada para recuperación documental.

Evaluación de LLMs

Benchmark de fluidez conversacional y QA histórico multilingüe.


Limitaciones

  • —Algunas respuestas están simplificadas para mejorar claridad conversacional.
  • —El dataset prioriza fluidez y naturalidad sobre profundidad académica extrema.
  • —Algunos eventos históricos pueden resumirse.
  • —La generación sintética puede introducir pequeñas variaciones estilísticas.
  • —La cobertura en portugués actualmente es parcial.
  • —No reemplaza fuentes científicas o históricas primarias.

Sesgos y Riesgos

Posibles limitaciones:

  • —Cobertura desigual según disponibilidad documental histórica.
  • —Simplificación de eventos geopolíticos complejos.
  • —Sobre representación de ciertos dialectos hispanohablantes.
  • —Cobertura lusófona todavía limitada.
  • —Posibles inconsistencias menores derivadas de generación sintética.

Se recomienda validación adicional para aplicaciones académicas críticas.


Licencia

Este dataset se distribuye bajo licencia CC BY 4.0.

Se permite:

  • —compartir,
  • —adaptar,
  • —modificar,
  • —construir trabajos derivados,

siempre otorgando atribución correspondiente.


Citación

Si utilizas este dataset en investigaciones o proyectos derivados, por favor cita:

bibtex
@dataset{latam_aerospace_history_qa,
  title={LATAM Aerospace History QA},
  author={AngelGabrielTroncoso},
  year={2026},
  publisher={Hugging Face}
}

Agradecimientos

Este proyecto busca fortalecer la representación del patrimonio aeroespacial latinoamericano, brasileño e iberoamericano dentro del ecosistema open-source de inteligencia artificial.

Inspirado en la necesidad de construir datasets culturalmente alineados para modelos conversacionales en lenguas iberoamericanas.