BananaMind-Model-Previewers/BananaMind-2-Micro-Preview
067
BananaMind 2 Micro Preview - 100%
This is the 100% training preview of BananaMind 2 Micro, a 2,933,193-parameter base causal language model. It is not an instruction-tuned chat model.
Architecture
The learned refresh scalar is initialized to zero. During cached generation, the causal convolution history is carried alongside each layer's K/V cache.
Training
Usage
from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "BananaMind-Model-Previewers/BananaMind-2-Micro-Preview"
tokenizer = AutoTokenizer.from_pretrained(model_id, trust_remote_code=True)
model = AutoModelForCausalLM.from_pretrained(model_id, trust_remote_code=True)