LocalAI-io/whisper-tiny-it
012
1---2language: it3license: mit4tags:5- whisper6- automatic-speech-recognition7- italian8- ctranslate29- faster-whisper10- whisperx11- localai12datasets:13- mozilla-foundation/common_voice_25_014base_model: openai/whisper-tiny15pipeline_tag: automatic-speech-recognition16---17 18# whisper-tiny-it19 20Fine-tuned [openai/whisper-tiny](https://huggingface.co/openai/whisper-tiny) (39M params) for Italian automatic speech recognition (ASR).21 22**Author:** Ettore Di Giacinto23 24Brought to you by the [LocalAI](https://github.com/mudler/LocalAI) team. This model can be used directly with [LocalAI](https://localai.io).25 26## Usage with LocalAI27 28This model is ready to use with [LocalAI](https://localai.io) via the `whisperx` backend.29 30Save the following as `whisperx-tiny-it.yaml` in your LocalAI models directory:31 32```yaml33name: whisperx-tiny-it34backend: whisperx35known_usecases:36 - transcript37parameters:38 model: LocalAI-io/whisper-tiny-it-ct2-int839 language: it40```41 42Then transcribe audio via the OpenAI-compatible endpoint:43 44```bash45curl http://localhost:8080/v1/audio/transcriptions \46 -H "Content-Type: multipart/form-data" \47 -F file="@audio.mp3" \48 -F model="whisperx-tiny-it"49```50 51## Results52 53Evaluated on Common Voice 25.0 Italian test set (15,184 samples):54 55| Step | Train Loss | Eval Loss | WER |56|------|-----------|-----------|-----|57| 1000 | — | 0.59 | 37.1% |58| 3000 | 0.42 | 0.47 | 30.8% |59| 5000 | — | 0.43 | 28.7% |60| 10000 | 0.29 | 0.40 | **27.1%** |61 62## Training Details63 64- **Base model:** openai/whisper-tiny (39M parameters)65- **Dataset:** Common Voice 25.0 Italian (173k train, 15k dev, 15k test)66- **Steps:** 10,000 (batch size 32, ~1.8 epochs)67- **Learning rate:** 1e-5 with 500 warmup steps68- **Precision:** bf16 on NVIDIA GB1069- **Training time:** ~2 hours70 71## Usage72 73### Transformers74 75```python76from transformers import pipeline77 78pipe = pipeline("automatic-speech-recognition", model="LocalAI-io/whisper-tiny-it")79result = pipe("audio.mp3", generate_kwargs={"language": "it", "task": "transcribe"})80print(result["text"])81```82 83### CTranslate2 / faster-whisper84 85For optimized CPU inference, use the INT8 quantized version: [LocalAI-io/whisper-tiny-it-ct2-int8](https://huggingface.co/LocalAI-io/whisper-tiny-it-ct2-int8) (39MB).86 87### LocalAI88 89This model is compatible with [LocalAI](https://github.com/mudler/LocalAI) for local, self-hosted AI inference.90 91## Links92 93- **Code:** [github.com/mudler/italian-asr](https://github.com/mudler/italian-asr)94- **CTranslate2 INT8:** [LocalAI-io/whisper-tiny-it-ct2-int8](https://huggingface.co/LocalAI-io/whisper-tiny-it-ct2-int8)95- **LocalAI:** [github.com/mudler/LocalAI](https://github.com/mudler/LocalAI)96 