CoolFace
Modelpublic

RichardErkhov/Menouar_-_gemma-2b-chat-ultra-gguf

sourceHugging Faceupdated 2y agoView on Hugging Face
0likes599downloads
Model Card

Quantization made by Richard Erkhov.

Github

Discord

Request more models

gemma-2b-chat-ultra - GGUF

  • —Model creator: https://huggingface.co/Menouar/
  • —Original model: https://huggingface.co/Menouar/gemma-2b-chat-ultra/

Original model description:


license: other tags:

  • —generatedfromtrainer
  • —google/gemma
  • —PyTorch
  • —transformers
  • —trl
  • —peft
  • —tensorboard model-index:
  • —name: gemma-2b-chat-ultra results: [] datasets:
  • —HuggingFaceH4/deita-10k-v0-sft licensename: gemma-terms-of-use licenselink: https://ai.google.dev/gemma/terms language:
  • —en base_model: google/gemma-2b widget:
  • —example_title: LLM messages:
  • —role: user content: What is a large language model (LLM)? pipeline_tag: text-generation ---

Model Card for gemma-2b-chat-ultra:

💬🤖

gemma-2b-chat-ultra is a language model that is trained to act as AI assistant. It is a finetuned version of google/gemma-2b that was trained using SFTTrainer on publicly available dataset HuggingFaceH4/deita-10k-v0-sft.

Training Metrics

The training metrics can be found on **TensorBoard**.

Training hyperparameters

The following hyperparameters were used during the training:

  • —output_dir: peft-lora-model
  • —overwriteoutputdir: True
  • —do_train: False
  • —do_eval: False
  • —do_predict: False
  • —evaluation_strategy: no
  • —predictionlossonly: False
  • —perdevicetrainbatchsize: 2
  • —perdeviceevalbatchsize: None
  • —pergputrainbatchsize: None
  • —pergpuevalbatchsize: None
  • —gradientaccumulationsteps: 4
  • —evalaccumulationsteps: None
  • —eval_delay: 0
  • —learning_rate: 2e-05
  • —weight_decay: 0.0
  • —adam_beta1: 0.9
  • —adam_beta2: 0.999
  • —adam_epsilon: 1e-08
  • —maxgradnorm: 0.3
  • —numtrainepochs: 3
  • —max_steps: -1
  • —lrschedulertype: cosine
  • —lrschedulerkwargs: {}
  • —warmup_ratio: 0.1
  • —warmup_steps: 0
  • —log_level: passive
  • —loglevelreplica: warning
  • —logoneach_node: True
  • —loggingdir: peft-lora-model/runs/Mar2107-18-25_a518bf4a6403
  • —logging_strategy: steps
  • —loggingfirststep: False
  • —logging_steps: 10
  • —loggingnaninf_filter: True
  • —save_strategy: epoch
  • —save_steps: 500
  • —savetotallimit: None
  • —save_safetensors: True
  • —saveoneach_node: False
  • —saveonlymodel: False
  • —no_cuda: False
  • —use_cpu: False
  • —usempsdevice: False
  • —seed: 42
  • —data_seed: None
  • —jitmodeeval: False
  • —use_ipex: False
  • —bf16: True
  • —fp16: False
  • —fp16optlevel: O1
  • —halfprecisionbackend: auto
  • —bf16fulleval: False
  • —fp16fulleval: False
  • —tf32: None
  • —local_rank: 0
  • —ddp_backend: None
  • —tpunumcores: None
  • —tpumetricsdebug: False
  • —debug: []
  • —dataloaderdroplast: False
  • —eval_steps: None
  • —dataloadernumworkers: 0
  • —dataloaderprefetchfactor: None
  • —past_index: -1
  • —run_name: peft-lora-model
  • —disable_tqdm: False
  • —removeunusedcolumns: True
  • —label_names: None
  • —loadbestmodelatend: False
  • —metricforbest_model: None
  • —greaterisbetter: None
  • —ignoredataskip: False
  • —fsdp: []
  • —fsdpminnum_params: 0
  • —fsdpconfig: {'minnumparams': 0, 'xla': False, 'xlafsdpv2': False, 'xlafsdpgradckpt': False}
  • —fsdptransformerlayerclsto_wrap: None
  • —acceleratorconfig: AcceleratorConfig(splitbatches=False, dispatchbatches=None, evenbatches=True, useseedablesampler=True)
  • —deepspeed: None
  • —labelsmoothingfactor: 0.0
  • —optim: adamwtorchfused
  • —optim_args: None
  • —adafactor: False
  • —groupbylength: False
  • —lengthcolumnname: length
  • —report_to: ['tensorboard']
  • —ddpfindunused_parameters: None
  • —ddpbucketcap_mb: None
  • —ddpbroadcastbuffers: None
  • —dataloaderpinmemory: True
  • —dataloaderpersistentworkers: False
  • —skipmemorymetrics: True
  • —uselegacyprediction_loop: False
  • —pushtohub: False
  • —resumefromcheckpoint: None
  • —hubmodelid: None
  • —hubstrategy: everysave
  • —hub_token: None
  • —hubprivaterepo: False
  • —hubalwayspush: False
  • —gradient_checkpointing: True
  • —gradientcheckpointingkwargs: {'use_reentrant': False}
  • —includeinputsfor_metrics: False
  • —fp16_backend: auto
  • —pushtohubmodelid: None
  • —pushtohub_organization: None
  • —pushtohub_token: None
  • —mp_parameters:
  • —autofindbatch_size: False
  • —full_determinism: False
  • —torchdynamo: None
  • —ray_scope: last
  • —ddp_timeout: 1800
  • —torch_compile: False
  • —torchcompilebackend: None
  • —torchcompilemode: None
  • —dispatch_batches: None
  • —split_batches: None
  • —includetokensper_second: False
  • —includenuminputtokensseen: False
  • —neftunenoisealpha: None
  • —distributed_state: Distributed environment: NO Num processes: 1 Process index: 0 Local process index: 0 Device: cuda
  • —ngpu: 1
  • —_cachedsetupdevices: cuda:0
  • —deepspeed_plugin: None
RichardErkhov/Menouar_-_gemma-2b-chat-ultra-gguf · CoolFace