CoolFace
Apppublic

arshadul/indic_conformer

sourceHugging Facemitupdated 8mo agoView on Hugging Face
0likes
App README

IndicConformer Speech-to-Text API ๐ŸŽ™๏ธ

Fast and accurate Speech-to-Text API for 22 Indian languages powered by AI4Bharat's IndicConformer model.

๐ŸŒŸ Features

  • โ€”22 Indian Languages Supported: Hindi, Telugu, Bengali, Tamil, and 18 more
  • โ€”Long Audio Support: Process up to 30 minutes of audio
  • โ€”Parallel Processing: Fast transcription with chunked inference
  • โ€”Multiple Formats: Supports WAV, MP3, FLAC, M4A

๐Ÿš€ Quick Start

API Endpoints

  • โ€”Base URL: Your Space URL
  • โ€”Documentation: /docs (Interactive Swagger UI)
  • โ€”Transcribe: POST /transcribe
  • โ€”Health Check: GET /health

Example Usage

Using cURL
bash
curl -X POST "https://your-space-url.hf.space/transcribe" \
  -F "file=@audio.wav" \
  -F "language=hi"
Using Python
python
import requests

url = "https://your-space-url.hf.space/transcribe"

files = {"file": open("audio.wav", "rb")}
data = {"language": "hi"}

response = requests.post(url, files=files, data=data)
print(response.json())
Using JavaScript
javascript
const formData = new FormData();
formData.append('file', audioFile);
formData.append('language', 'hi');

const response = await fetch('https://your-space-url.hf.space/transcribe', {
  method: 'POST',
  body: formData
});

const result = await response.json();
console.log(result.transcription);

๐Ÿ—ฃ๏ธ Supported Languages

CodeLanguageCodeLanguage
hiHinditeTelugu
bnBengalitaTamil
mrMarathiguGujarati
knKannadamlMalayalam
paPunjabiorOdia
asAssameseurUrdu
neNepalikokKonkani
sdSindhidoiDogri
brxBodomaiMaithili
mniManipuriksKashmiri
saSanskritsatSantali

๐Ÿ“Š Response Format

json
{
  "success": true,
  "transcription": "เค†เคชเค•เคพ เคŸเฅ‡เค•เฅเคธเฅเคŸ เคฏเคนเคพเค‚",
  "metadata": {
    "audio_duration": 45.2,
    "audio_duration_minutes": 0.75,
    "inference_time": 2.1543,
    "rtf": 0.0476,
    "language": "hi",
    "decoder": "rnnt",
    "num_chunks": 2
  }
}

โšก Performance

  • โ€”Real-Time Factor (RTF): ~0.05 (20x faster than real-time on GPU)
  • โ€”Max Audio Length: 30 minutes
  • โ€”Chunk Processing: 30s chunks with 2s overlap for optimal accuracy

๐Ÿ› ๏ธ Model Information

๐Ÿ“ Notes

  • โ€”Audio files are automatically resampled to 16kHz mono
  • โ€”Longer audio files are split into chunks for parallel processing
  • โ€”GPU acceleration is automatically used when available
  • โ€”Maximum audio duration is 30 minutes per request

๐Ÿค Credits

Built with:

๐Ÿ“„ License

MIT License