CoolFace
Modelpublic

jalbarracin/T5-spanish-efficient-tiny

sourceHugging Faceapache-2.0updated 3y agoView on Hugging Face
5likes14downloads
Model Card

T5-Spanish-Efficient-TINY (NUEVA Versión Deep-Narrow en español - Marzo 2024)

T5-Efficient-TINY es una variación de Google's original T5 que sigue la arquitectura del modelo T5. Es una variación que ha sido entrenada por Javier Albarracín de Quantico AI. La versión original fue compartida en el paper [Scale Efficiently: Insights from Pre-training and Fine-tuning Transformers](https://arxiv.org/abs/2109.10686) por Yi Tay, Mostafa Dehghani, Jinfeng Rao, William Fedus, Samira Abnar, Hyung Won Chung, Sharan Narang, Dani Yogatama, Ashish Vaswani, Donald Metzler.

Esta versión del modelo ha sido entrenado desde cero usando un dataset en español. Esta versión NECESITA FINE-TUNE no ha sido entrenada en ninguna tarea. lo positivo del modelo es que está en español y puede servir para entrenar tareas simples. Por su relativa poca complejidad y su peso <29mb es ideal para uso en CPU.

Tiene su propio tokenizador español (solo letras minúsculas) con 5000 tokens de tamaño.

Detalles de arquitectura del modelo:

Este modelo - T5-spanish-efficient-tiny - es de tipo Tiny con variaciones en dimensión y tamaño de las capas feed forward. Tiene 17.94 milliones de parámetros y requiere 29 MB de memoria en full precision (fp32) o 15 MB de memoria en half precision (fp16 o bf16).

Este modelo en español ha sido creado con características más ligeras que el modelo Tiny original.

Modelonl (el/dl)ffdmkvnh#Params
This4/35123206447M

Un resumen del modelo original T5 puede ser visto aquí:

Modelonl (el/dl)ffdmkvnh#Params
Tiny4/4102425632416M
Mini4/4153638432831M
Small6/6204851232860M
Base12/1230727686412220M
Large24/24409610246416738M
Xl24/24163841024128323B
XXl24/2465536102412812811B

Las abreviaciones usadas:

AbreviaciónDefinición
nlNumber of transformer blocks (depth)
dmDimension of embedding vector (output vector of transformers block)
kvDimension of key/value projection matrix
nhNumber of attention heads
ffDimension of intermediate vector within transformer block (size of feed-forward projection matrix)
elNumber of transformer blocks in the encoder (encoder depth)
dlNumber of transformer blocks in the decoder (decoder depth)
shSignifies that attention heads are shared
skvSignifies that key-values projection matrices are tied

If a model checkpoint has no specific, el or dl than both the number of encoder- and decoder layers correspond to nl.

Pre-Training

Ha sido pre entrenado con 2MM de registros random del dataset MSMARCO en idioma en español.

Fine-Tuning

Nota: Este modelo requiere fine tune para funcionar aquí algunos ejemplos de como hacerlo:

PyTorch:

Tensorflow:

JAX/Flax: