bilalfaye/OneEncoder-text-image-audio
๐ผ๏ธ๐ OneEncoder: A Unified Text & Image & Audio Model
OneEncoder is a lightweight framework for cross-modal alignment, focusing on efficiently integrating text, image and audio (with future extensions to other modalities). Unlike traditional methods relying on massive modality-specific encoders, OneEncoder progressively aligns different data types, making it cost-effective and performant even on small paired datasets.
๐ Key Features
โ Multimodal Alignment: Initially supports text & image & audio, with extension to other modalities. โ Lightweight & Efficient: Avoids full retraining when adding new modalities. โ Superior Performance: Outperforms models that require large specialized datasets.
๐ฏ Applications
- Visual Question Answering (VQA)
- Image-Text-Audio Retrieval
- Multimodal Content Understanding
๐ Research Paper
๐ arXiv: OneEncoder: Progressive Cross-Modal Alignment
๐ Resources
๐ GitHub Repo: OneEncoder ๐ Hugging Face Demo: OneEncoder Retriever ๐ Demo Notebook: OneEncoder Demos ๐ OneEncoder for Text, Image: HF Model ๐ OneEncoder for Text, Image & Video: HF Model ๐ OneEncoder for Text, Image & X-ray: HF Model
๐ Authors
๐ Bilal FAYE, Hanane AZZAG, Mustapha LEBBAH, Djamel BOUCHAFFRA
Note: This model is training with temperature=2.5 and addition as fusion operation
