CoolFace
Modelpublic

Vili-Elvis01/Qwen3.8-Max

sourceHugging Faceotherupdated 23d agoView on Hugging Face
0likes
Model Card

Qwen3.8-Max

This repository contains the open-weight version of Qwen3.8-Max, officially released as Qwen3.8-2.4T-A95B.

Model Overview

  • —Architecture: Sparse Mixture-of-Experts (MoE)
  • —Total Parameters: 2.4 Trillion
  • —Active Parameters: 95 Billion per token
  • —Experts: 512 total (10 routed + 1 shared activated per token)
  • —Context Length: 262,144 tokens natively (extensible up to ~1M tokens)
  • —Type: Causal Language Model
  • —Modalities: Text → Text (open weights version)
  • —License: Qwen3.8-Max License
Note: The official hosted version of Qwen3.8-Max (available via Qwen Cloud / Alibaba Cloud) includes additional features such as native vision/video input, non-thinking mode, and built-in tools. The open-weight version focuses on text generation with strong reasoning capabilities.

Model Details

PropertyValue
Model TypeCausal LM (MoE)
Total Parameters2.4T
Activated Parameters95B
Hidden Size8192
Number of Layers92
Vocabulary Size248,320
Native Context Length262,144
Max Context (with scaling)~1,010,000

Usage

With Transformers

python
from transformers import AutoModelForCausalLM, AutoTokenizer

model_name = "Vili-Elvis01/Qwen3.8-Max"

tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(
    model_name,
    torch_dtype="auto",
    device_map="auto"
)

prompt = "Explain quantum computing in simple terms."
messages = [
    {"role": "user", "content": prompt}
]

text = tokenizer.apply_chat_template(
    messages,
    tokenize=False,
    add_generation_prompt=True
)

model_inputs = tokenizer([text], return_tensors="pt").to(model.device)

generated_ids = model.generate(
    **model_inputs,
    max_new_tokens=512
)

response = tokenizer.batch_decode(generated_ids, skip_special_tokens=True)[0]
print(response)