CoolFace
Modelpublic

KnutJaegersberg/Galactica-120B-GPTQ-2-bit-64g

sourceHugging Facecc-by-4.0updated 3y agoView on Hugging Face
3likes21downloads
Model Card

Experimental quantization.

Working inference code (regular inference with autogptq does not work without returntokentype_ids=False, didn't get it to work with textgen-webui):

from auto_gptq import AutoGPTQForCausalLM, BaseQuantizeConfig

from transformers import AutoTokenizer, TextGenerationPipeline

tokenizer = AutoTokenizer.frompretrained(quantizedmodeldir, usefast=True)

model = AutoGPTQForCausalLM.fromquantized(quantizedmodeldir, device="cuda:0", usetriton=False)

inputids = tokenizer("Question: What is the purpose of life?\n\nAnswer:", returntensors="pt").input_ids.to("cuda:0")

out = model.generate(inputids=inputids,max_length=300)

print(tokenizer.decode(out[0]))

or

print(tokenizer.decode(model.generate(**tokenizer("test is", returntensors="pt", returntokentypeids=False).to("cuda:0"))[0]))