CoolFace
Apppublic

ainulyaqinmhd/SpatialReasoning

sourceHugging Faceupdated 1y agoView on Hugging Face
0likes
App README

๐Ÿง  Multimodal AI Agent: Image + Text + Voice โ†’ Text + Natural Voice

This Hugging Face Space accepts:

  • โ€”Uploaded Image
  • โ€”Text Prompt
  • โ€”Uploaded Audio file (voice)

It then generates:

  • โ€”AI-written Text output
  • โ€”Human-like Voice Output (using Hugging Face Text-to-Speech model)

Models Used

  • โ€”Image-to-Text: Salesforce/blip-image-captioning-base
  • โ€”Speech-to-Text: openai/whisper-small
  • โ€”Text Generation: gpt2
  • โ€”Text-to-Speech: espnet/kan-bayashi_ljspeech_vits

How to Use

  1. 1.Upload an image.
  2. 2.Enter a text prompt.
  3. 3.Upload a voice file.
  4. 4.Click "Generate".
  5. 5.Receive AI-generated text and voice audio.

Created with โค๏ธ using Gradio + Hugging Face Transformers.