Capibara-LLM/dataset-guarani-jopara-v01
Dataset Guaraní-Jopara v01 (Alpaca Style) 🇵🇾 Resumen del Dataset Este dataset contiene pares de instrucción-respuesta diseñados para el entrenamiento de ajuste fino (Fine-Tuning) de Modelos de Lenguaje Grande (LLMs) en el idioma Guaraní, específicamente en su variante Jopara (la mezcla coloquial de Guaraní y Español hablada comúnmente en Paraguay). El formato sigue la estructura estándar de Alpaca, lo que lo hace compatible con la mayoría de las librerías de… See the full description on the dataset page: https://huggingface.co/datasets/Capibara-LLM/dataset-guarani-jopara-v01.
Dataset Guaraní-Jopara v01 (Alpaca Style) 🇵🇾
Resumen del Dataset
Este dataset contiene pares de instrucción-respuesta diseñados para el entrenamiento de ajuste fino (Fine-Tuning) de Modelos de Lenguaje Grande (LLMs) en el idioma Guaraní, específicamente en su variante Jopara (la mezcla coloquial de Guaraní y Español hablada comúnmente en Paraguay).
El formato sigue la estructura estándar de Alpaca, lo que lo hace compatible con la mayoría de las librerías de entrenamiento (como unsloth, trl, axolotl o llama-factory).
- Repositorio original: Basado en
rubuntu/dataset-guarani-jopara-v01. - Limpieza: Se han eliminado filas con respuestas vacías o nulas para asegurar la calidad del entrenamiento.
- Mantenedor: Capibara-LLM Project.
Estructura del Dataset
Instancia de Ejemplo
{
"instruction": "Mba'éichapa ikatu ajapo peteĩ sopa paraguaya?",
"input": "",
"output": "Rejapo haguã sopa paraguaya oñekotevẽ: harina de maíz, kesu paraguái, sevói, kure ñandy térã manteca, leche ha huevo. \n\n1. Embojy la sevói la kure ñandýpe.\n2. Ejehe'a la leche, huevo ha kesu.\n3. Oñemoĩ la harina de maíz mbeguekatúpe...\n(etc)"
}Campos de Datos
- `instruction` (string): La tarea o pregunta que se le hace al modelo. Generalmente en Guaraní/Jopara.
- `input` (string): Contexto adicional para la instrucción (puede estar vacío en muchos casos).
- `output` (string): La respuesta deseada o completación correcta en Guaraní/Jopara.
Proceso de Curación y Limpieza
Este dataset es una versión procesada de rubuntu/dataset-guarani-jopara-v01. Se aplicaron los siguientes pasos de preprocesamiento:
- Filtrado de Nulos: Se eliminaron todas las filas donde el campo
outputeraNoneonull. - Filtrado de Vacíos: Se eliminaron filas donde el
outputera una cadena de texto vacía o solo contenía espacios en blanco. - Validación: Se verificó que los campos sean cadenas de texto válidas.
Usos Recomendados
Este dataset es ideal para:
- Instruction Tuning (SFT): Enseñar a modelos base (como Llama 3, Mistral, Gemma) a seguir instrucciones en Guaraní.
- Preservación Cultural: Digitalizar y procesar conocimientos en el idioma nativo de Paraguay.
- Chatbots: Crear asistentes conversacionales que entiendan el contexto local y el dialecto Jopara.
Limitaciones y Sesgos
- Dialecto Jopara: El dataset contiene una mezcla de Guaraní académico y Español (Jopara). Esto refleja el uso real en Paraguay, pero puede no ser apto para contextos puramente académicos o de Guaraní cerrado.
- Origen: Parte de los datos pueden haber sido generados o traducidos. Se recomienda verificar la precisión gramatical para usos críticos.
Cita
Si utilizas este dataset, por favor cita el repositorio original y este proyecto:
@misc{capibara_guarani_jopara,
title={Dataset Guaraní-Jopara Instruct v01},
author={Capibara-LLM},
year={2025},
publisher={Hugging Face},
howpublished={\url{[https://huggingface.co/Capibara-LLM/dataset-guarani-jopara-v01](https://huggingface.co/Capibara-LLM/dataset-guarani-jopara-v01)}}
}