meganovaai/L3.3-70B-Euryale-v2.3-AWQ
0971
L3.3-70B-Euryale-v2.3-AWQ
### Provenance Quantized by Meganova AI from the base model named above. No upstream quantized repo was used.
AWQ 4-bit quantized version of Sao10K/L3.3-70B-Euryale-v2.3 — a Llama 3.3 70B finetune for structured, immersive long-form roleplay.
Serving with vLLM
pip install vllm compressed-tensors
python3 -m vllm.entrypoints.openai.api_server \
--model meganovaai/L3.3-70B-Euryale-v2.3-AWQ \
--served-model-name L3.3-70B-Euryale-v2.3 \
--gpu-memory-utilization 0.9 \
--dtype half \
--quantization compressed-tensors \
--tensor-parallel-size 4 \
--port 8000Quantization
Applied via llmcompressor with AWQ W4A16 scheme, calibrated on 64 samples from ultrachat200k. `lmhead` excluded from quantization.
Credits
- Original model: Sao10K/L3.3-70B-Euryale-v2.3
- Quantized by: Meganova AI
