CoolFace
Modelpublic

Rckflr/kev-gemma-270m-rule-classifier-es-v8-experimental

sourceHugging Faceotherupdated 3d agoView on Hugging Face
0likes11downloads
Model Card

Kev–Gemma 3 270M: clasificación de reglas en español, v8 (experimental)

Artefacto de investigación, no sistema para tomar decisiones sobre personas. Clasifica una regla, los hechos de un caso y una solución propuesta como cumple, no_cumple o no_aplica. La respuesta revisar procede de una política externa de abstención (policy.json), no es una cuarta clase aprendida. El benchmark toma la forma de un juego ficticio inspirado en Papers, Please; no contiene procedimientos migratorios reales.

Este repositorio es un derivado de [`google/gemma-3-270m`](https://huggingface.co/google/gemma-3-270m). Incluye un adaptador LoRA, el cabezal de decisión de Kev, el tokenizador y la política externa. No incluye los pesos del modelo base. No es un modelo conversacional ni genera una respuesta token por token; asigna probabilidades a opciones mediante el runtime y el cabezal de Kev. transformers.pipeline() o PeftModel por sí solos no reproducen estas predicciones ni el rechazo selectivo.

Uso previsto y exclusiones

Uso previsto: investigación reproducible sobre clasificación de reglas sintéticas, generalización composicional y abstención selectiva en español.

No usar para controles fronterizos reales, asesoría jurídica, evaluación de personas o decisiones automatizadas que afecten derechos o bienestar. No se ha validado con expedientes reales, variaciones abiertas de lenguaje, datos adversariales ni cambios de distribución. No debe atribuirse seguridad operativa a las cifras de este benchmark. Véanse las Gemma Terms of Use y la Gemma Prohibited Use Policy.

Cómo usarlo en el entorno de investigación Kev

Se necesita un checkout compatible con este experimento del runtime de Kev, en particular kev.checkpoint, kev.api y kev.border_inspector.BorderInspector, además de acceso aceptado al modelo base Gemma. El repositorio de Hugging Face contiene los artefactos del modelo y un ejemplo para entradas sin etiqueta, no una aplicación autónoma. No existe integración directa con el widget estándar de clasificación de Transformers.

Desde ese checkout compatible, con sus dependencias instaladas:

powershell
hf download Rckflr/kev-gemma-270m-rule-classifier-es-v8-experimental --local-dir ./model-v8
python ./model-v8/example_inference.py --model-dir ./model-v8

El script muestra una solicitud de ejemplo con state (regla, hechos, solución propuesta) y una pregunta estado_regla con los criterios de las tres clases. No requiere ni inventa una etiqueta verdadera para inferir. La redacción del ejemplo ilustra la interfaz, no es el protocolo exacto del benchmark ni una demostración de acierto. Para reproducir sus métricas, se necesitan las mismas instrucciones, el mismo runtime y los datos/protocolo congelados del experimento. El parámetro temperature del cabezal debe coincidir con el de policy.json; BorderInspector lo comprueba.

Entrenamiento y evaluación

Continuación de v7 sobre Gemma 3 270M, LoRA rango 16, una época, tasa de aprendizaje 1e-5, CPU fp32. Se usaron 2.560 casos sintéticos únicos más 400 de repetición, con cuatro preguntas por caso y mayor peso para etiquetas negativas de ámbito y disparador. Se completaron 2.960/2.960 registros y 370 pasos de optimizador, sin descartes ni truncamientos. La temperatura (1.5157165665103978) y los umbrales por clase se ajustaron en particiones de desarrollo previamente observadas, antes de generar el panel final.

Panel final sintético reservado: 2.048 casos, ocho familias no puntuadas antes de congelar el modelo y la política; SHA-256 del panel ec53785eb99dd7d13842c2391f1afc52cef44eb4e68936262d5c6d5a4176dd97. Se evaluaron los 2.048 sin descartar ninguno.

Métrica en el panel finalResultado v8
Exactitud bruta de tres clases1.708/2.048 = 83,40 %
Casos aceptados por la política externa901/2.048 = 43,99 %
Errores observados entre aceptados0/901
cumple verdaderos aceptados184/512 = 35,94 %

En el mismo panel, la exactitud bruta fue 65,97 % para v4b, 80,27 % para v6 y 77,69 % para v7. La política original de v4b aceptó 489 casos y cometió 22 errores entre ellos. v6 y v7 no tenían políticas finales admitidas; no se ajustaron nuevas políticas usando este test.

Limitación importante: en bruto, v8 cometió 340 errores; 157 casos no_aplica fueron predichos como cumple. En los casos cuyo disparador estaba explícitamente ausente, la exactitud bruta fue 228/512 (44,53 %). La política externa envió todos los errores observados en este panel a revisar; eso no garantiza cero errores futuros. Los ejemplos comparten plantillas y no constituyen evidencia de rendimiento en decisiones reales.

Los umbrales congelados son 0.9216254588912728 para predicciones cumple y 0.9817178925818578 para no_cumple/no_aplica, aplicados al máximo de las probabilidades calibradas. Si no se supera el umbral de la clase predicha, la salida operativa es revisar.

Véanse evaluation/report.json, evaluation/audit.json, evaluation/paired-v4b.json, evaluation/manifest.json y evaluation/protocol.json para los detalles y hashes. Los archivos training_config.json y training_metrics.json describen la ejecución. La medición de latencia (~421 ms mediana y ~508 ms p95) corresponde a una ejecución local en CPU, no a una garantía de producción.

Licencia y procedencia

La base y este derivado están sujetos a las Gemma Terms of Use, cuya copia se proporciona en GEMMA_TERMS.html. La política de usos prohibidos también se adjunta en GEMMA_PROHIBITED_USE_POLICY.html. NOTICE y MODIFICATIONS.md identifican el aviso y los archivos derivados. Los receptores deben cumplir las restricciones de uso de Gemma; este repositorio no concede derechos sobre la base fuera de esos términos.