RichardErkhov/Menouar_-_gemma-2b-chat-ultra-gguf
0599
Quantization made by Richard Erkhov.
gemma-2b-chat-ultra - GGUF
- Model creator: https://huggingface.co/Menouar/
- Original model: https://huggingface.co/Menouar/gemma-2b-chat-ultra/
Original model description:
license: other tags:
- generatedfromtrainer
- google/gemma
- PyTorch
- transformers
- trl
- peft
- tensorboard model-index:
- name: gemma-2b-chat-ultra results: [] datasets:
- HuggingFaceH4/deita-10k-v0-sft licensename: gemma-terms-of-use licenselink: https://ai.google.dev/gemma/terms language:
- en base_model: google/gemma-2b widget:
- example_title: LLM messages:
- role: user content: What is a large language model (LLM)? pipeline_tag: text-generation ---
Model Card for gemma-2b-chat-ultra:
💬🤖
gemma-2b-chat-ultra is a language model that is trained to act as AI assistant. It is a finetuned version of google/gemma-2b that was trained using SFTTrainer on publicly available dataset HuggingFaceH4/deita-10k-v0-sft.
Training Metrics
The training metrics can be found on **TensorBoard**.
Training hyperparameters
The following hyperparameters were used during the training:
- output_dir: peft-lora-model
- overwriteoutputdir: True
- do_train: False
- do_eval: False
- do_predict: False
- evaluation_strategy: no
- predictionlossonly: False
- perdevicetrainbatchsize: 2
- perdeviceevalbatchsize: None
- pergputrainbatchsize: None
- pergpuevalbatchsize: None
- gradientaccumulationsteps: 4
- evalaccumulationsteps: None
- eval_delay: 0
- learning_rate: 2e-05
- weight_decay: 0.0
- adam_beta1: 0.9
- adam_beta2: 0.999
- adam_epsilon: 1e-08
- maxgradnorm: 0.3
- numtrainepochs: 3
- max_steps: -1
- lrschedulertype: cosine
- lrschedulerkwargs: {}
- warmup_ratio: 0.1
- warmup_steps: 0
- log_level: passive
- loglevelreplica: warning
- logoneach_node: True
- loggingdir: peft-lora-model/runs/Mar2107-18-25_a518bf4a6403
- logging_strategy: steps
- loggingfirststep: False
- logging_steps: 10
- loggingnaninf_filter: True
- save_strategy: epoch
- save_steps: 500
- savetotallimit: None
- save_safetensors: True
- saveoneach_node: False
- saveonlymodel: False
- no_cuda: False
- use_cpu: False
- usempsdevice: False
- seed: 42
- data_seed: None
- jitmodeeval: False
- use_ipex: False
- bf16: True
- fp16: False
- fp16optlevel: O1
- halfprecisionbackend: auto
- bf16fulleval: False
- fp16fulleval: False
- tf32: None
- local_rank: 0
- ddp_backend: None
- tpunumcores: None
- tpumetricsdebug: False
- debug: []
- dataloaderdroplast: False
- eval_steps: None
- dataloadernumworkers: 0
- dataloaderprefetchfactor: None
- past_index: -1
- run_name: peft-lora-model
- disable_tqdm: False
- removeunusedcolumns: True
- label_names: None
- loadbestmodelatend: False
- metricforbest_model: None
- greaterisbetter: None
- ignoredataskip: False
- fsdp: []
- fsdpminnum_params: 0
- fsdpconfig: {'minnumparams': 0, 'xla': False, 'xlafsdpv2': False, 'xlafsdpgradckpt': False}
- fsdptransformerlayerclsto_wrap: None
- acceleratorconfig: AcceleratorConfig(splitbatches=False, dispatchbatches=None, evenbatches=True, useseedablesampler=True)
- deepspeed: None
- labelsmoothingfactor: 0.0
- optim: adamwtorchfused
- optim_args: None
- adafactor: False
- groupbylength: False
- lengthcolumnname: length
- report_to: ['tensorboard']
- ddpfindunused_parameters: None
- ddpbucketcap_mb: None
- ddpbroadcastbuffers: None
- dataloaderpinmemory: True
- dataloaderpersistentworkers: False
- skipmemorymetrics: True
- uselegacyprediction_loop: False
- pushtohub: False
- resumefromcheckpoint: None
- hubmodelid: None
- hubstrategy: everysave
- hub_token: None
- hubprivaterepo: False
- hubalwayspush: False
- gradient_checkpointing: True
- gradientcheckpointingkwargs: {'use_reentrant': False}
- includeinputsfor_metrics: False
- fp16_backend: auto
- pushtohubmodelid: None
- pushtohub_organization: None
- pushtohub_token: None
- mp_parameters:
- autofindbatch_size: False
- full_determinism: False
- torchdynamo: None
- ray_scope: last
- ddp_timeout: 1800
- torch_compile: False
- torchcompilebackend: None
- torchcompilemode: None
- dispatch_batches: None
- split_batches: None
- includetokensper_second: False
- includenuminputtokensseen: False
- neftunenoisealpha: None
- distributed_state: Distributed environment: NO Num processes: 1 Process index: 0 Local process index: 0 Device: cuda
- ngpu: 1
- _cachedsetupdevices: cuda:0
- deepspeed_plugin: None
