CoolFace
Datasetpublic

Capibara-LLM/dataset-guarani-jopara-v01

Dataset Guaraní-Jopara v01 (Alpaca Style) 🇵🇾 Resumen del Dataset Este dataset contiene pares de instrucción-respuesta diseñados para el entrenamiento de ajuste fino (Fine-Tuning) de Modelos de Lenguaje Grande (LLMs) en el idioma Guaraní, específicamente en su variante Jopara (la mezcla coloquial de Guaraní y Español hablada comúnmente en Paraguay). El formato sigue la estructura estándar de Alpaca, lo que lo hace compatible con la mayoría de las librerías de… See the full description on the dataset page: https://huggingface.co/datasets/Capibara-LLM/dataset-guarani-jopara-v01.

sourceHugging Faceapache-2.0updated 10mo agoView on Hugging Face
0likes37downloads
Dataset Card

Dataset Guaraní-Jopara v01 (Alpaca Style) 🇵🇾

Resumen del Dataset

Este dataset contiene pares de instrucción-respuesta diseñados para el entrenamiento de ajuste fino (Fine-Tuning) de Modelos de Lenguaje Grande (LLMs) en el idioma Guaraní, específicamente en su variante Jopara (la mezcla coloquial de Guaraní y Español hablada comúnmente en Paraguay).

El formato sigue la estructura estándar de Alpaca, lo que lo hace compatible con la mayoría de las librerías de entrenamiento (como unsloth, trl, axolotl o llama-factory).

  • —Repositorio original: Basado en rubuntu/dataset-guarani-jopara-v01.
  • —Limpieza: Se han eliminado filas con respuestas vacías o nulas para asegurar la calidad del entrenamiento.
  • —Mantenedor: Capibara-LLM Project.

Estructura del Dataset

Instancia de Ejemplo

json
{
  "instruction": "Mba'éichapa ikatu ajapo peteĩ sopa paraguaya?",
  "input": "",
  "output": "Rejapo haguã sopa paraguaya oñekotevẽ: harina de maíz, kesu paraguái, sevói, kure ñandy térã manteca, leche ha huevo. \n\n1. Embojy la sevói la kure ñandýpe.\n2. Ejehe'a la leche, huevo ha kesu.\n3. Oñemoĩ la harina de maíz mbeguekatúpe...\n(etc)"
}

Campos de Datos

  • —`instruction` (string): La tarea o pregunta que se le hace al modelo. Generalmente en Guaraní/Jopara.
  • —`input` (string): Contexto adicional para la instrucción (puede estar vacío en muchos casos).
  • —`output` (string): La respuesta deseada o completación correcta en Guaraní/Jopara.

Proceso de Curación y Limpieza

Este dataset es una versión procesada de rubuntu/dataset-guarani-jopara-v01. Se aplicaron los siguientes pasos de preprocesamiento:

  1. 1.Filtrado de Nulos: Se eliminaron todas las filas donde el campo output era None o null.
  2. 2.Filtrado de Vacíos: Se eliminaron filas donde el output era una cadena de texto vacía o solo contenía espacios en blanco.
  3. 3.Validación: Se verificó que los campos sean cadenas de texto válidas.

Usos Recomendados

Este dataset es ideal para:

  • —Instruction Tuning (SFT): Enseñar a modelos base (como Llama 3, Mistral, Gemma) a seguir instrucciones en Guaraní.
  • —Preservación Cultural: Digitalizar y procesar conocimientos en el idioma nativo de Paraguay.
  • —Chatbots: Crear asistentes conversacionales que entiendan el contexto local y el dialecto Jopara.

Limitaciones y Sesgos

  • —Dialecto Jopara: El dataset contiene una mezcla de Guaraní académico y Español (Jopara). Esto refleja el uso real en Paraguay, pero puede no ser apto para contextos puramente académicos o de Guaraní cerrado.
  • —Origen: Parte de los datos pueden haber sido generados o traducidos. Se recomienda verificar la precisión gramatical para usos críticos.

Cita

Si utilizas este dataset, por favor cita el repositorio original y este proyecto:

bibtex
@misc{capibara_guarani_jopara,
  title={Dataset Guaraní-Jopara Instruct v01},
  author={Capibara-LLM},
  year={2025},
  publisher={Hugging Face},
  howpublished={\url{[https://huggingface.co/Capibara-LLM/dataset-guarani-jopara-v01](https://huggingface.co/Capibara-LLM/dataset-guarani-jopara-v01)}}
}