CoolFace
Modelpublic

manuel121357/Dolphin3.0-Llama3.1-8B-q4f16_1-MLC

sourceHugging Facellama3.1updated 14d agoView on Hugging Face
0likes57downloads
Model Card

Dolphin3.0-Llama3.1-8B · q4f16_1 (MLC, vocab parchado a 128256)

Build MLC de Dolphin3.0-Llama3.1-8B basado en huggingkot/Dolphin3.0-Llama3.1-8B-q4f16_1-MLC, con el vocabulario recortado de 128258 → 128256 para que sea compatible con los motores WASM estándar de WebLLM (Llama-3_1-8B-Instruct-q4f16_1_cs1k-webgpu.wasm).

Qué cambió: solo se recortaron las últimas 2 filas de model.embed_tokens y lm_head (los tokens extra <|im_end|>/<|im_start|>, ids 128256-128257, que el modelo base Llama-3.1 no necesita). El resto de los pesos es idéntico al original.

Para usarlo en WebLLM:

js
const model_list = [{
  model: "https://huggingface.co/manuel121357/Dolphin3.0-Llama3.1-8B-q4f16_1-MLC/resolve/main/",
  model_id: "Dolphin3.0-Llama3.1-8B-q4f16_1-MLC",
  model_lib: "https://raw.githubusercontent.com/mlc-ai/binary-mlc-llm-libs/main/web-llm-models/v0_2_84/base/Llama-3_1-8B-Instruct-q4f16_1_cs1k-webgpu.wasm",
  overrides: { context_window_size: 4096, prefill_chunk_size: 1024 },
}];