Jbautistas/whisper-large-v3-lora-medical-TTS-aug
036
Whisper Large v3 - LoRA Fine-Tuned (Español Médico)
Este modelo es un fine-tuning de openai/whisper-large-v3 usando LoRA con datos médicos en español.
📊 Métricas
- WER (test set): 46.46%
🎯 Uso
from transformers import pipeline
# Cargar pipeline
pipe = pipeline(
"automatic-speech-recognition",
model="Jbautistas/whisper-large-v3-lora-medical-TTS-aug"
)
# Transcribir audio
result = pipe("audio.wav", generate_kwargs={"language": "spanish", "task": "transcribe"})
print(result["text"])Uso avanzado con WhisperProcessor
from transformers import WhisperForConditionalGeneration, WhisperProcessor
import torch
# Cargar modelo y processor
model = WhisperForConditionalGeneration.from_pretrained("Jbautistas/whisper-large-v3-lora-medical-TTS-aug")
processor = WhisperProcessor.from_pretrained("Jbautistas/whisper-large-v3-lora-medical-TTS-aug")
# Preparar audio
audio_input = ... # tu array de audio
input_features = processor(audio_input, sampling_rate=16000, return_tensors="pt").input_features
# Generar transcripción
with torch.no_grad():
predicted_ids = model.generate(input_features)
transcription = processor.batch_decode(predicted_ids, skip_special_tokens=True)[0]
print(transcription)📚 Dataset
Entrenado con un dataset privado de aproximadamente 2 horas de audio médico en español, con data augmentation.
🔧 Detalles de Entrenamiento
- Modelo base: openai/whisper-large-v3
- Técnica: LoRA (Low-Rank Adaptation)
- Rango LoRA: 16
- Alpha: 32
- Target modules: qproj, vproj
- Cuantización: 8-bit
- Idioma: Español (es)
- Tarea: Transcripción
📄 Licencia
Apache 2.0
👤 Autor
Jbautistas
