AngelGabrielTroncoso/dataset-aeroespacial-cultural-somosnlp
LATAM Aerospace History QA Descripción General LATAM Aerospace History QA es un dataset curado orientado a instruction tuning y sistemas conversacionales culturalmente alineados para Iberoamérica. El dataset se enfoca principalmente en español, incorporando además cobertura parcial en portugués brasileño para mejorar representación multicultural y multilingüe dentro de modelos de lenguaje abiertos. La colección está especializada en: historia aeroespacial… See the full description on the dataset page: https://huggingface.co/datasets/AngelGabrielTroncoso/dataset-aeroespacial-cultural-somosnlp.
LATAM Aerospace History QA
Descripción General
LATAM Aerospace History QA es un dataset curado orientado a instruction tuning y sistemas conversacionales culturalmente alineados para Iberoamérica.
El dataset se enfoca principalmente en español, incorporando además cobertura parcial en portugués brasileño para mejorar representación multicultural y multilingüe dentro de modelos de lenguaje abiertos.
La colección está especializada en:
- historia aeroespacial,
- programas espaciales latinoamericanos,
- desarrollo satelital,
- geopolítica tecnológica,
- patrimonio científico de América Latina y España.
El dataset fue diseñado para:
- Instruction tuning
- Fine-tuning supervisado (SFT)
- Sistemas conversacionales en español y portugués
- Generación de datos sintéticos
- Benchmarks QA históricos
- Aplicaciones RAG
- Modelos culturalmente alineados
A diferencia de datasets traducidos automáticamente o excesivamente académicos, esta colección prioriza:
- Lenguaje humano natural
- Diversidad dialectal iberoamericana
- Conversaciones realistas
- Fluidez cultural
- Precisión histórica y técnica
- Variabilidad lingüística
El objetivo principal es mejorar el comportamiento de modelos LLM en lenguas iberoamericanas dentro de dominios históricos, científicos y culturales relacionados con el sector aeroespacial regional.
Motivación
La historia aeroespacial de América Latina, Brasil y España se encuentra subrepresentada en datasets públicos para entrenamiento de modelos de lenguaje.
La mayoría de datasets existentes:
- están dominados por contenido en inglés,
- utilizan traducciones automáticas,
- carecen de contexto cultural iberoamericano,
- presentan lenguaje excesivamente robótico o académico.
Este dataset busca reducir esas limitaciones mediante ejemplos diseñados para sonar como conversaciones humanas reales en español y portugués.
Estructura del Dataset
Cada ejemplo sigue una estructura tipo instruction-tuning:
{
"instruction": "¿Qué pasó con la primera misión satelital chilena?",
"context": "Misión FASat-Alfa (Chile). Lanzamiento: 1995...",
"response": "El FASat-Alfa fue el primer satélite chileno..."
}Campos del Dataset
instruction
Pregunta formulada en lenguaje natural simulando patrones humanos reales.
Incluye:
- preguntas coloquiales,
- formulaciones técnicas,
- estilo periodístico,
- lenguaje educativo,
- preguntas ambiguas,
- variaciones regionales del español y portugués.
Ejemplos:
- "¿Cachai por qué falló el FASat?"
- "¿Qué tan avanzado era el Cóndor II?"
- "Explícame fácil qué hacía ese satélite."
- "Por que o programa espacial brasileiro foi importante?"
context
Contexto factual comprimido utilizado como base de generación.
Generalmente contiene:
- nombre de misión,
- país,
- fecha,
- operador,
- tipo de vehículo,
- clasificación técnica,
- estado de misión,
- notas históricas.
Este campo puede utilizarse en:
- Retrieval-Augmented Generation (RAG),
- generación controlada,
- fine-tuning supervisado,
- destilación de conocimiento.
response
Respuesta generada utilizando información histórica y técnica contextualizada.
Las respuestas fueron diseñadas para equilibrar:
- precisión,
- claridad,
- naturalidad conversacional,
- valor educativo,
- coherencia cultural.
Cobertura Temática
El dataset incluye ejemplos relacionados con:
- Satélites
- Misiones espaciales
- Cohetería
- Guerra Fría
- Telecomunicaciones
- Observación terrestre
- Accidentes aeroespaciales
- Programas militares
- Desarrollo tecnológico latinoamericano
- Geopolítica científica
- Agencias espaciales
- Patrimonio científico regional
Países Representados
Incluye contenido relacionado con:
- Argentina
- Chile
- Brasil
- México
- España
- Cuba
- Perú
- Colombia
- Venezuela
- Cooperaciones regionales latinoamericanas
- Cooperaciones iberoamericanas
Cobertura Lusófona
El dataset incorpora ejemplos limitados en portugués brasileño orientados a mejorar la representación cultural iberoamericana dentro de modelos conversacionales.
Incluye referencias relacionadas con:
- Programa espacial brasileño
- INPE
- Satélites CBERS
- Centro de Lanzamento de Alcântara
- Cooperación Brasil-China
- Variaciones lingüísticas del portugués brasileño
El objetivo es expandir progresivamente la cobertura multicultural y multilingüe del dataset.
Diversidad Lingüística
El dataset incorpora variaciones reales de lenguas iberoamericanas.
El objetivo fue reducir patrones robóticos frecuentes en datasets sintéticos tradicionales.
Metodología de Curación
El dataset fue construido mediante:
- generación sintética controlada,
- reformulación lingüística,
- augmentación dialectal,
- validación contextual,
- curación manual parcial.
Los objetivos principales fueron:
- mejorar naturalidad conversacional,
- aumentar diversidad de instrucciones,
- mantener coherencia histórica,
- reducir repetición sintáctica,
- incorporar identidad cultural regional.
Casos de Uso Recomendados
Este dataset puede utilizarse para:
- Fine-tuning supervisado (SFT)
- Instruction tuning
- Chatbots educativos
- Sistemas QA históricos
- Aplicaciones RAG
- Benchmarks multilingües
- Generación sintética adicional
- Evaluación de fluidez conversacional
- Modelos culturalmente alineados
Calidad del Dataset
El dataset fue diseñado para minimizar:
- respuestas robóticas,
- patrones repetitivos,
- traducciones literales,
- rigidez sintáctica,
- lenguaje excesivamente neutral.
La curación priorizó:
- naturalidad,
- diversidad lingüística,
- coherencia contextual,
- identidad cultural regional.
Formato del Archivo
El dataset se distribuye en formato JSONL.
Cada línea contiene un ejemplo independiente:
{"instruction":"...","context":"...","response":"..."}Campos principales:
Validación del JSONL
Para evitar errores en el Dataset Viewer de Hugging Face, se recomienda validar el archivo train.jsonl antes de subirlo.
Script recomendado:
import json
with open("train.jsonl", "r", encoding="utf-8") as f:
for i, line in enumerate(f, 1):
try:
json.loads(line)
except Exception as e:
print(f"Error en línea {i}: {e}")Cada línea debe contener un único objeto JSON válido.
Ejemplo correcto:
{"instruction":"¿Qué pasó con el FASat-Alfa?","context":"Misión chilena de 1995...","response":"El FASat-Alfa fue el primer satélite chileno..."}Ejemplos de Uso
Fine-Tuning Conversacional
Entrenamiento de modelos en español y portugués con conocimiento histórico y cultural especializado.
Sistemas Educativos
Creación de asistentes educativos sobre historia espacial latinoamericana e iberoamericana.
RAG Histórico
Uso del campo context como metadata estructurada para recuperación documental.
Evaluación de LLMs
Benchmark de fluidez conversacional y QA histórico multilingüe.
Limitaciones
- Algunas respuestas están simplificadas para mejorar claridad conversacional.
- El dataset prioriza fluidez y naturalidad sobre profundidad académica extrema.
- Algunos eventos históricos pueden resumirse.
- La generación sintética puede introducir pequeñas variaciones estilísticas.
- La cobertura en portugués actualmente es parcial.
- No reemplaza fuentes científicas o históricas primarias.
Sesgos y Riesgos
Posibles limitaciones:
- Cobertura desigual según disponibilidad documental histórica.
- Simplificación de eventos geopolíticos complejos.
- Sobre representación de ciertos dialectos hispanohablantes.
- Cobertura lusófona todavía limitada.
- Posibles inconsistencias menores derivadas de generación sintética.
Se recomienda validación adicional para aplicaciones académicas críticas.
Licencia
Este dataset se distribuye bajo licencia CC BY 4.0.
Se permite:
- compartir,
- adaptar,
- modificar,
- construir trabajos derivados,
siempre otorgando atribución correspondiente.
Citación
Si utilizas este dataset en investigaciones o proyectos derivados, por favor cita:
@dataset{latam_aerospace_history_qa,
title={LATAM Aerospace History QA},
author={AngelGabrielTroncoso},
year={2026},
publisher={Hugging Face}
}Agradecimientos
Este proyecto busca fortalecer la representación del patrimonio aeroespacial latinoamericano, brasileño e iberoamericano dentro del ecosistema open-source de inteligencia artificial.
Inspirado en la necesidad de construir datasets culturalmente alineados para modelos conversacionales en lenguas iberoamericanas.
