AngelGabrielTroncoso/dataset_aeroespacial_cultural_completo.csv
🚀 LATAM Aerospace Cultural QA Dataset culturalmente alineado para modelos conversacionales en español y portugués, especializado en historia aeroespacial iberoamericana. Desarrollado para el #HackathonSomosNLP 2026 — ¿Son los LLMs realmente multiculturales? 🛠 Metodología y Pipeline de Construcción La versión actual del dataset ha sido refinada mediante un pipeline automatizado diseñado para maximizar la calidad y la diversidad cultural: Generación Dinámica: Se… See the full description on the dataset page: https://huggingface.co/datasets/AngelGabrielTroncoso/dataset_aeroespacial_cultural_completo.csv.
🚀 LATAM Aerospace Cultural QA
Dataset culturalmente alineado para modelos conversacionales en español y portugués, especializado en historia aeroespacial iberoamericana.
Desarrollado para el #HackathonSomosNLP 2026 — ¿Son los LLMs realmente multiculturales?
🛠 Metodología y Pipeline de Construcción
La versión actual del dataset ha sido refinada mediante un pipeline automatizado diseñado para maximizar la calidad y la diversidad cultural:
- Generación Dinámica: Se generan 1,000 ejemplos utilizando
google/gemma-2b-it. El proceso emplea plantillas de contexto (PLANTILLAS_ES) integradas con datos geoespaciales de países iberoamericanos, permitiendo que el LLM cree contenido natural en lugar de respuestas estáticas. - Limpieza Inteligente (Embeddings): Para garantizar la singularidad de los datos, utilizamos
sentence-transformers/all-MiniLM-L6-v2. Cada respuesta es convertida a un vector (embedding) y se calcula la similitud coseno. Se eliminan automáticamente aquellos ejemplos con una redundancia superior al 95%. - Filtro de Seguridad y Calidad: Implementamos una capa de moderación conceptual donde el mismo modelo generador evalúa cada ejemplo bajo criterios de tono, precisión y adecuación cultural, descartando automáticamente entradas inadecuadas.
- Output Final: Los datos procesados se exportan al archivo
/content/final_generated_self_instruct_examples.csv.
📊 Estructura del Dataset
Cada registro contiene metadatos demográficos que permiten un análisis de sesgos y una personalización del diálogo:
🌍 Cobertura Temática
El dataset incluye:
- Programas espaciales nacionales (CONAE, INPE, AEB, FACH, etc.)
- Historia de la cohetería e hitos tecnológicos iberoamericanos.
- Geopolítica tecnológica y colaboraciones regionales.
- Variaciones dialectales del español y portugués en contextos técnicos.
🚀 Casos de Uso
- Fine-tuning supervisado (SFT): Adaptar modelos para el contexto cultural iberoamericano.
- Instruction tuning: Mejorar la capacidad del modelo para seguir instrucciones con tono cultural auténtico.
- Benchmarks de Evaluación: Testear la alineación cultural de modelos pre-entrenados.
- RAG Histórico: Utilizar los datos como base de conocimiento para asistentes educativos.
⚠️ Notas sobre la Implementación
- Acceso a Modelos: El pipeline requiere acceso a modelos en Hugging Face. Asegúrate de tener tu
HF_TOKENconfigurado si utilizas modelos gated. - Reproducibilidad: Los modelos
gemma-3-27b-it,embeddinggemma-300myshieldgemma-27bmencionados en la estrategia original se han mapeado a alternativas accesibles (gemma-2b-ityall-MiniLM-L6-v2) para garantizar la ejecución exitosa en entornos como Google Colab.
📖 Citación
@dataset{latam_aerospace_cultural_qa_2026,
title = {LATAM Aerospace Cultural QA},
author = {AngelGabrielTroncoso},
year = {2026},
publisher = {Hugging Face},
url = {[https://huggingface.co/datasets/AngelGabrielTroncoso/dataset-aeroespacial-cultural-somosnlp](https://huggingface.co/datasets/AngelGabrielTroncoso/dataset-aeroespacial-cultural-somosnlp)},
note = {Desarrollado para #HackathonSomosNLP 2026}
}Desarrollado con ❤️ para fortalecer la representación del patrimonio aeroespacial iberoamericano en el ecosistema open-source.
#HackathonSomosNLP 2026 · #Somos600M
