BrCamp/bee-350m-pt-base-15b
Bee-350M PT — variante 15B (fork de decaimento)
Este e' o gemeo experimental de [BrCamp/bee-350m-pt-base](https://huggingface.co/BrCamp/bee-350m-pt-base). Mesma arquitetura, mesmo corpus, mesmo tokenizador, mesma forma de schedule — a unica coisa que difere e' o total de tokens: 15,00B aqui contra 21,75B no principal.
Ele existe porque foi bifurcado do checkpoint do run principal no passo 165.000 (com estado do Adam e posicao no dado), decaindo dali ate 15,00B enquanto o principal seguia no plato.
Por que ele importa
⭐ 45% mais dado renderam 0,19% de bpb. Ja ir de 151M para 345M parametros rendeu 2,76%. Nesta arquitetura o volume de tokens satura por volta de 43 tok/param — e a escala continua pagando.
⭐ E o mesmo modelo, nos mesmos 15,00B tokens, mede 0,9167 se colhido no plato do WSD e 0,8223 decaido: o decaimento de LR sozinho vale 10,3% de bpb. Comparar marcos intermediarios de modelos com schedules diferentes mede o schedule, nao o modelo.
Para que serve
Como modelo, ele e' ligeiramente pior que o principal — use o principal. Este aqui serve para reproduzir a ablacao: e' o unico ponto que permite isolar o efeito do volume de tokens com todo o resto fixo.
Detalhes: bpb medido.
Limitacoes
As mesmas do principal: modelo base, nao segue instrucoes, nao conversa, nao usa ferramentas; 345M parametros e 2048 de contexto alucinam fatos com facilidade; herda os vieses da web em portugues. bpb mede modelagem de linguagem, nao fluencia de resposta.
