guillermoruiz/bilmaLAT
Modelo BilmaLat
Este modelo basado en Roberta se entrenó usando más de 600 millones de tweets en español recolectados entre diciembre del 2015 y febrero del 2023. A cada mensaje se le agruegó una etiqueta de información regionalizada como sigue:
cc year _mo Texto del mensaje.
donde cc es el código de dos letras del país de origen del mensaje, year y _mo son el año y el mes de publicación.
Por ejemplo
- do 2017 09 Y que es lo que uno va hacer con usr ? E ponen hoy mi Plan de dato y con 5 minutos de eso se acabó usr usr 😤😤
- ve 2016 _08 No te necesito, ni quiero morir por ti me sobran las razones para andar este camino pero que sentido tiene, yo te vi entre tanta gente
- ar 2020 _03 soy demasiado buena para todo el mundo y se viven cagando en mí, que hago? me vuelvo una forra de mierda así me valoran?
- mx 2019 12 Felicidades para la nueva pareja, y para usted tambien. Gracias por el pedazo de pastel. url
- mx 2022 01 Mayra, lectora de "El psicoanalista" del escritor estadounidense John Katzenbach. Felicidades. url
- es 2020 05 usr Ansias no ,lo tradicional es en semana Santa helados Durán, vamos con retraso, tenemos que recuperar los helados perdidos, jajajaja
Como se puede observar, se mantuvieron mayúsculas y minúsculas, emoticones y palabras mal escritas. Por motivos de privacidad, se cambiaron las menciones de usuario por el token usr y las direcciones de internet por url.
Los tokens que se usaron para los códigos de los paíes son:
Los años son 2015 a 2023 y los meses 01 hasta 12.
Se creó el vocabulario de tamaño 30k usando WordPiece. El modelo se entrenaron usando el enmascaramiento de palabras con probabilidad de 0.15. Se usó el optimizador AdamW con una tasa de aprendizaje de 0.00002 durante una época.
Uso
El modelo se puede usar con una pipeline:
from transformers import pipeline
unmasker = pipeline('fill-mask', model="guillermoruiz/bilmaLAT")
