CoolFace
Modelpublic

LocalAI-io/whisper-large-v3-it-multi

sourceHugging Facemitupdated 4mo agoView on Hugging Face
0likes49downloads
Model Card

whisper-large-v3-it-multi

Fine-tuned openai/whisper-large-v3 (1.55B params) for Italian ASR on multiple datasets.

Author: Ettore Di Giacinto

Brought to you by the LocalAI team. This model can be used directly with LocalAI.

Usage with LocalAI

This model is ready to use with LocalAI via the whisperx backend.

Save the following as whisperx-large-v3-it-multi.yaml in your LocalAI models directory:

yaml
name: whisperx-large-v3-it-multi
backend: whisperx
known_usecases:
  - transcript
parameters:
  model: LocalAI-io/whisper-large-v3-it-multi-ct2-int8
  language: it

Then transcribe audio via the OpenAI-compatible endpoint:

bash
curl http://localhost:8080/v1/audio/transcriptions \
  -H "Content-Type: multipart/form-data" \
  -F file="@audio.mp3" \
  -F model="whisperx-large-v3-it-multi"

Training Details

  • Base model: openai/whisper-large-v3 (1.55B parameters)
  • Datasets: Common Voice 25.0 Italian (173k) + MLS Italian (60k) + VoxPopuli Italian (23k) = 255k train samples
  • Steps: 10,000
  • Precision: bf16 on NVIDIA GB10
  • Note: trained with --no-eval; final WER to be measured separately

Usage

Transformers

python
from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="LocalAI-io/whisper-large-v3-it-multi")
result = pipe("audio.mp3", generate_kwargs={"language": "it", "task": "transcribe"})
print(result["text"])

CTranslate2 / faster-whisper

For optimized CPU inference: LocalAI-io/whisper-large-v3-it-multi-ct2-int8

Links