CoolFace
Datasetpublic

AngelGabrielTroncoso/dataset_aeroespacial_cultural_completo.csv

🚀 LATAM Aerospace Cultural QA Dataset culturalmente alineado para modelos conversacionales en español y portugués, especializado en historia aeroespacial iberoamericana. Desarrollado para el #HackathonSomosNLP 2026 — ¿Son los LLMs realmente multiculturales? 🛠 Metodología y Pipeline de Construcción La versión actual del dataset ha sido refinada mediante un pipeline automatizado diseñado para maximizar la calidad y la diversidad cultural: Generación Dinámica: Se… See the full description on the dataset page: https://huggingface.co/datasets/AngelGabrielTroncoso/dataset_aeroespacial_cultural_completo.csv.

sourceHugging Faceapache-2.0updated 4mo agoView on Hugging Face
0likes6downloads
Dataset Card

🚀 LATAM Aerospace Cultural QA

Dataset culturalmente alineado para modelos conversacionales en español y portugués, especializado en historia aeroespacial iberoamericana.

Desarrollado para el #HackathonSomosNLP 2026 — ¿Son los LLMs realmente multiculturales?


🛠 Metodología y Pipeline de Construcción

La versión actual del dataset ha sido refinada mediante un pipeline automatizado diseñado para maximizar la calidad y la diversidad cultural:

  1. 1.Generación Dinámica: Se generan 1,000 ejemplos utilizando google/gemma-2b-it. El proceso emplea plantillas de contexto (PLANTILLAS_ES) integradas con datos geoespaciales de países iberoamericanos, permitiendo que el LLM cree contenido natural en lugar de respuestas estáticas.
  2. 2.Limpieza Inteligente (Embeddings): Para garantizar la singularidad de los datos, utilizamos sentence-transformers/all-MiniLM-L6-v2. Cada respuesta es convertida a un vector (embedding) y se calcula la similitud coseno. Se eliminan automáticamente aquellos ejemplos con una redundancia superior al 95%.
  3. 3.Filtro de Seguridad y Calidad: Implementamos una capa de moderación conceptual donde el mismo modelo generador evalúa cada ejemplo bajo criterios de tono, precisión y adecuación cultural, descartando automáticamente entradas inadecuadas.
  4. 4.Output Final: Los datos procesados se exportan al archivo /content/final_generated_self_instruct_examples.csv.

📊 Estructura del Dataset

Cada registro contiene metadatos demográficos que permiten un análisis de sesgos y una personalización del diálogo:

CampoDescripción
idIdentificador único del registro.
paisPaís de contexto del avance aeroespacial.
preguntaQuery generado por el modelo.
respuestaRespuesta generada y validada por el LLM.
edad / generoPerfil demográfico del usuario simulado.
region / educacionContexto sociodemográfico del perfil.
musica_favorita / vocacionDatos de estilo de vida para mayor realismo.
modelo_genMétodo de generación utilizado.

🌍 Cobertura Temática

El dataset incluye:

  • —Programas espaciales nacionales (CONAE, INPE, AEB, FACH, etc.)
  • —Historia de la cohetería e hitos tecnológicos iberoamericanos.
  • —Geopolítica tecnológica y colaboraciones regionales.
  • —Variaciones dialectales del español y portugués en contextos técnicos.

🚀 Casos de Uso

  • —Fine-tuning supervisado (SFT): Adaptar modelos para el contexto cultural iberoamericano.
  • —Instruction tuning: Mejorar la capacidad del modelo para seguir instrucciones con tono cultural auténtico.
  • —Benchmarks de Evaluación: Testear la alineación cultural de modelos pre-entrenados.
  • —RAG Histórico: Utilizar los datos como base de conocimiento para asistentes educativos.

⚠️ Notas sobre la Implementación

  • —Acceso a Modelos: El pipeline requiere acceso a modelos en Hugging Face. Asegúrate de tener tu HF_TOKEN configurado si utilizas modelos gated.
  • —Reproducibilidad: Los modelos gemma-3-27b-it, embeddinggemma-300m y shieldgemma-27b mencionados en la estrategia original se han mapeado a alternativas accesibles (gemma-2b-it y all-MiniLM-L6-v2) para garantizar la ejecución exitosa en entornos como Google Colab.

📖 Citación

bibtex
@dataset{latam_aerospace_cultural_qa_2026,
  title   = {LATAM Aerospace Cultural QA},
  author  = {AngelGabrielTroncoso},
  year    = {2026},
  publisher = {Hugging Face},
  url     = {[https://huggingface.co/datasets/AngelGabrielTroncoso/dataset-aeroespacial-cultural-somosnlp](https://huggingface.co/datasets/AngelGabrielTroncoso/dataset-aeroespacial-cultural-somosnlp)},
  note    = {Desarrollado para #HackathonSomosNLP 2026}
}

Desarrollado con ❤️ para fortalecer la representación del patrimonio aeroespacial iberoamericano en el ecosistema open-source.

#HackathonSomosNLP 2026 · #Somos600M