CoolFace
Modelpublic

Jbautistas/whisper-large-v3-lora-medical-TTS-aug

sourceHugging Faceapache-2.0updated 1y agoView on Hugging Face
0likes36downloads
Model Card

Whisper Large v3 - LoRA Fine-Tuned (Español Médico)

Este modelo es un fine-tuning de openai/whisper-large-v3 usando LoRA con datos médicos en español.

📊 Métricas

  • —WER (test set): 46.46%

🎯 Uso

python
from transformers import pipeline

# Cargar pipeline
pipe = pipeline(
    "automatic-speech-recognition",
    model="Jbautistas/whisper-large-v3-lora-medical-TTS-aug"
)

# Transcribir audio
result = pipe("audio.wav", generate_kwargs={"language": "spanish", "task": "transcribe"})
print(result["text"])

Uso avanzado con WhisperProcessor

python
from transformers import WhisperForConditionalGeneration, WhisperProcessor
import torch

# Cargar modelo y processor
model = WhisperForConditionalGeneration.from_pretrained("Jbautistas/whisper-large-v3-lora-medical-TTS-aug")
processor = WhisperProcessor.from_pretrained("Jbautistas/whisper-large-v3-lora-medical-TTS-aug")

# Preparar audio
audio_input = ...  # tu array de audio
input_features = processor(audio_input, sampling_rate=16000, return_tensors="pt").input_features

# Generar transcripción
with torch.no_grad():
    predicted_ids = model.generate(input_features)
    
transcription = processor.batch_decode(predicted_ids, skip_special_tokens=True)[0]
print(transcription)

📚 Dataset

Entrenado con un dataset privado de aproximadamente 2 horas de audio médico en español, con data augmentation.

🔧 Detalles de Entrenamiento

  • —Modelo base: openai/whisper-large-v3
  • —Técnica: LoRA (Low-Rank Adaptation)
  • —Rango LoRA: 16
  • —Alpha: 32
  • —Target modules: qproj, vproj
  • —Cuantización: 8-bit
  • —Idioma: Español (es)
  • —Tarea: Transcripción

📄 Licencia

Apache 2.0

👤 Autor

Jbautistas