CoolFace
Modelpublic

BrCamp/bee-350m-pt-base-15b

sourceHugging Faceapache-2.0updated 1mo agoView on Hugging Face
0likes150downloads
Model Card

Bee-350M PT — variante 15B (fork de decaimento)

Este e' o gemeo experimental de [BrCamp/bee-350m-pt-base](https://huggingface.co/BrCamp/bee-350m-pt-base). Mesma arquitetura, mesmo corpus, mesmo tokenizador, mesma forma de schedule — a unica coisa que difere e' o total de tokens: 15,00B aqui contra 21,75B no principal.

Ele existe porque foi bifurcado do checkpoint do run principal no passo 165.000 (com estado do Adam e posicao no dado), decaindo dali ate 15,00B enquanto o principal seguia no plato.

Por que ele importa

modelotokenstok/parambpb
bee-350m-pt-base21,75B630,8207
este (15B)15,00B430,8223
bee-150m-pt-base21,75B1430,8438

45% mais dado renderam 0,19% de bpb. Ja ir de 151M para 345M parametros rendeu 2,76%. Nesta arquitetura o volume de tokens satura por volta de 43 tok/param — e a escala continua pagando.

⭐ E o mesmo modelo, nos mesmos 15,00B tokens, mede 0,9167 se colhido no plato do WSD e 0,8223 decaido: o decaimento de LR sozinho vale 10,3% de bpb. Comparar marcos intermediarios de modelos com schedules diferentes mede o schedule, nao o modelo.

Para que serve

Como modelo, ele e' ligeiramente pior que o principal — use o principal. Este aqui serve para reproduzir a ablacao: e' o unico ponto que permite isolar o efeito do volume de tokens com todo o resto fixo.

Detalhes: bpb medido.

Limitacoes

As mesmas do principal: modelo base, nao segue instrucoes, nao conversa, nao usa ferramentas; 345M parametros e 2048 de contexto alucinam fatos com facilidade; herda os vieses da web em portugues. bpb mede modelagem de linguagem, nao fluencia de resposta.