CoolFace
Modelpublic

javipinochet02/tesis-srl-qwen38-27b-response

sourceHugging Faceupdated 13d agoView on Hugging Face
0likes
Model Card

Adaptador de respuesta del agente tutor

Javier Iván Pinochet Contreras · Universidad de Chile

Este adaptador forma parte de la tesis Agentes de IA Generativa para Autorregulación en Educación Online. Su función es redactar una respuesta en español a partir de la pregunta, el historial, los fragmentos del curso y el contexto de tutoría. La guía didáctica determina cómo desarrollar la explicación y el estado semanal fundamenta el repaso que se introduce al comenzar la conversación. La versión documentada es provisional y se utiliza para preparar la demostración mientras continúa la evaluación del agente.

Modelo y funciones

El entrenamiento contempla adaptadores separados para el enrutamiento, la planificación y la respuesta, compatibles con la misma base. El último entrenamiento modificó únicamente el adaptador de respuesta que documenta esta ficha. En la configuración provisional de la demostración, el enrutamiento utiliza el modelo base y la planificación conserva su adaptador Qwen3.8-27B anterior. La demostración identifica por separado los pesos conservados para cada rol y los que se utilizan durante la generación.

ConfiguraciónValor
Base y tokenizadorunsloth/Qwen3.8-27B-unsloth-bnb-4bit
Revisión de ambos8aa5f05d26b7205477066e1449e0af13f762a299
Arquitectura registradaQwen3_5ForCausalLM
Carga de la base4 bits, con adaptador PEFT
Microbatch1
Acumulación de gradiente16
Tasa de aprendizaje5e-5
Pesos global y por tipo de preferencia$\lambda=1$ y $w_c=1$
Factor de longitud en respuesta completa$a_{icj}=1$
Generación para la comparaciónSelección del token más probable; máximo de 768 tokens nuevos; ventana de 4.096 tokens
Rango LoRA / alpha16 / 32
rsLoRA / dropoutactivado / 0
Longitud máxima del entrenamiento4.096 tokens
Plantilla de conversaciónNativa; enable_thinking=false, preserve_thinking=false

Datos y revisión

Los ejemplos sintéticos reúnen preguntas, antecedentes de conversación y respuestas de referencia para las funciones del agente. Su autoría combina borradores elaborados mediante modelos de lenguaje con indicaciones del autor sobre redacción, guía didáctica y repaso según el contexto semanal. Estas indicaciones se incorporan a las fuentes de autoría antes de compilar los datos, que también se comprueban mediante reglas de estructura, consistencia y separación entre entrenamiento y validación. La revisión humana de casos representativos y la revisión asistida mediante modelos se distinguen de la evaluación de las respuestas generadas después del entrenamiento.

En el conjunto del redactor se separan 733 ejemplos de entrenamiento y 148 de validación. Los grupos de contraste y los turnos de una misma conversación permanecen en la partición a la que fueron asignados. Se repiten determinados ejemplos de entrenamiento para aumentar su frecuencia de presentación.

Procedencia de los pesos

IdentificaciónReferencia
EntrenamientoJob `6aa59ca95527934177ed1181`
Finalización13 de septiembre de 2026, 01:39 UTC
GPU de entrenamientoNVIDIA L40S, 48 GB
Adaptador documentadoAl finalizar el entrenamiento, actualización 55
Revisión de los artefactos621eed396bc3963c13d7606c1915c28d0aff43fe
SHA-256 de los pesosfdad6158d56ddef1864bf85247403f209d67c0941ba8060900ad69e696ea3692

Los pesos se conservan en el repositorio privado de artefactos javipinochet02/tesis-srl-hf-job-artifacts, bajo supervision-cuerpo-posicion-20260912/entrenamiento/final/adaptador/paso-000055. Este repositorio público contiene la ficha y la identificación de esa salida. La referencia terminal se eligió para preparar la demo por instrucción del autor, mientras que la selección definitiva depende de la evaluación del comportamiento del agente.

Recursos del entrenamiento

MagnitudValor
Memoria máxima asignada por PyTorch27,46 GiB
Memoria máxima reservada por PyTorch42,47 GiB
Presentaciones programadas / procesadas881 / 880
Tiempo registrado por el entrenador9.437,7892 s
Duración de la ejecución completa25.105,886 s
Cota estimada de costo de la ejecuciónUSD 12,57

La duración completa incluye la preparación y el entrenamiento. El costo indicado es una estimación según el tiempo de uso de la GPU.

Evaluación disponible y límites

El entrenamiento terminó con estado completed_not_promoted. En el diagnóstico de desarrollo del paso 55 se registraron 7 de 19 casos con el repaso esperado y 2 de 12 con la aplicación esperada de la guía didáctica. Ambos resultados quedaron bajo los criterios fijados para ese diagnóstico, de 16 de 19 y 10 de 12, respectivamente. Por ello, la salida terminal conserva su condición provisional y los resultados de la evaluación posterior se incorporarán con la revisión concreta de los pesos y del servicio utilizados.

La demostración permite configurar escenarios de tutoría y conversar con el agente. La inferencia se apoya en registros y variables parciales de actividad del curso, cuya interpretación no equivale a una medición completa de la autorregulación. La evaluación disponible corresponde a pruebas del sistema y no a un estudio de eficacia educativa con estudiantes. Las conversaciones que se publiquen en el archivo de casos se incorporarán al finalizar su revisión.