RaviNaik/MultiModal-Phi2
4
Phi2 : Multimodal Finetuning
Details
- LLM Backbone: Phi2
- Vision Tower: clip-vit-large-patch14-336
- Audio Model: Whisper
- Pretraining Dataset: LAION-CC-SBU dataset with BLIP captions(200k samples)
- Finetuning Dataset: Instruct 150k dataset based on COCO
