CoolFace
Modelpublic

bilalfaye/OneEncoder-text-image-audio

sourceHugging Faceupdated 2y agoView on Hugging Face
0likes8downloads
Model Card

๐Ÿ–ผ๏ธ๐Ÿ“ OneEncoder: A Unified Text & Image & Audio Model

OneEncoder is a lightweight framework for cross-modal alignment, focusing on efficiently integrating text, image and audio (with future extensions to other modalities). Unlike traditional methods relying on massive modality-specific encoders, OneEncoder progressively aligns different data types, making it cost-effective and performant even on small paired datasets.

๐Ÿš€ Key Features

โœ… Multimodal Alignment: Initially supports text & image & audio, with extension to other modalities. โœ… Lightweight & Efficient: Avoids full retraining when adding new modalities. โœ… Superior Performance: Outperforms models that require large specialized datasets.

๐ŸŽฏ Applications

  • โ€”Visual Question Answering (VQA)
  • โ€”Image-Text-Audio Retrieval
  • โ€”Multimodal Content Understanding

๐Ÿ“„ Research Paper

๐Ÿ“œ arXiv: OneEncoder: Progressive Cross-Modal Alignment

๐Ÿ“Œ Resources

๐Ÿ”— GitHub Repo: OneEncoder ๐Ÿš€ Hugging Face Demo: OneEncoder Retriever ๐Ÿ““ Demo Notebook: OneEncoder Demos ๐Ÿ”Š OneEncoder for Text, Image: HF Model ๐Ÿ”Š OneEncoder for Text, Image & Video: HF Model ๐Ÿ”Š OneEncoder for Text, Image & X-ray: HF Model

๐Ÿ“ Authors

๐Ÿ“Œ Bilal FAYE, Hanane AZZAG, Mustapha LEBBAH, Djamel BOUCHAFFRA

Note: This model is training with temperature=2.5 and addition as fusion operation