CoolFace
Apppublic

RaviNaik/MultiModal-Phi2

sourceHugging Facemitupdated 3y agoView on Hugging Face
4likes
App README

Phi2 : Multimodal Finetuning

Details

  1. 1.LLM Backbone: Phi2
  2. 2.Vision Tower: clip-vit-large-patch14-336
  3. 3.Audio Model: Whisper
  4. 4.Pretraining Dataset: LAION-CC-SBU dataset with BLIP captions(200k samples)
  5. 5.Finetuning Dataset: Instruct 150k dataset based on COCO

Design

image

Pretraining

Training Loss Curve

image

Learing Rate

image

Training Logs

image

Finetuning

Training Loss Curve

image

Learing Rate

image

Training Logs

image

Results

image