manuel121357/Dolphin3.0-Llama3.1-8B-q4f16_1-MLC
057
Dolphin3.0-Llama3.1-8B · q4f16_1 (MLC, vocab parchado a 128256)
Build MLC de Dolphin3.0-Llama3.1-8B basado en huggingkot/Dolphin3.0-Llama3.1-8B-q4f16_1-MLC, con el vocabulario recortado de 128258 → 128256 para que sea compatible con los motores WASM estándar de WebLLM (Llama-3_1-8B-Instruct-q4f16_1_cs1k-webgpu.wasm).
Qué cambió: solo se recortaron las últimas 2 filas de model.embed_tokens y lm_head (los tokens extra <|im_end|>/<|im_start|>, ids 128256-128257, que el modelo base Llama-3.1 no necesita). El resto de los pesos es idéntico al original.
Para usarlo en WebLLM:
const model_list = [{
model: "https://huggingface.co/manuel121357/Dolphin3.0-Llama3.1-8B-q4f16_1-MLC/resolve/main/",
model_id: "Dolphin3.0-Llama3.1-8B-q4f16_1-MLC",
model_lib: "https://raw.githubusercontent.com/mlc-ai/binary-mlc-llm-libs/main/web-llm-models/v0_2_84/base/Llama-3_1-8B-Instruct-q4f16_1_cs1k-webgpu.wasm",
overrides: { context_window_size: 4096, prefill_chunk_size: 1024 },
}];