CoolFace
Modelpublic

RichardErkhov/CorticalStack_-_mistral-7b-tak-stack-dpo-gguf

sourceHugging Faceupdated 2y agoView on Hugging Face
0likes608downloads
Model Card

Quantization made by Richard Erkhov.

Github

Discord

Request more models

mistral-7b-tak-stack-dpo - GGUF

  • Model creator: https://huggingface.co/CorticalStack/
  • Original model: https://huggingface.co/CorticalStack/mistral-7b-tak-stack-dpo/

Original model description: --- license: apache-2.0 tags:

  • dpo base_model:
  • mistralai/Mistral-7B-v0.1 dataset:
  • CorticalStack/tak-stack-dpo ---

mistral-7b-tak-stack-dpo

mistral-7b-tak-stack-dpo is a DPO fine-tuned version of mistralai/Mistral-7B-v0.1 using the CorticalStack/tak-stack-dpo dataset.

LoRA

  • r: 32
  • LoRA alpha: 32
  • LoRA dropout: 0.05

Training arguments

  • Batch size: 4
  • Gradient accumulation steps: 4
  • Optimizer: pagedadamw32bit
  • Max steps: 100
  • Learning rate: 5e-05
  • Learning rate scheduler type: cosine
  • Beta: 0.1
  • Max prompt length: 1024
  • Max length: 1536