CoolFace
Modelpublic

inference4j/wav2vec2-base-960h

sourceHugging Facemitupdated 7mo agoView on Hugging Face
1likes
Model Card

Wav2Vec2 Base 960h — ONNX

ONNX export of wav2vec2-base-960h, a Wav2Vec2 model fine-tuned on 960 hours of LibriSpeech for automatic speech recognition using CTC decoding.

Mirrored for use with inference4j, an inference-only AI library for Java.

Original Source

Usage with inference4j

java
try (Wav2Vec2 model = Wav2Vec2.fromPretrained("models/wav2vec2-base-960h")) {
    Transcription result = model.transcribe(Path.of("audio.wav"));
    System.out.println(result.text());
}

Model Details

PropertyValue
ArchitectureWav2Vec2 Base (12 transformer layers)
TaskAutomatic speech recognition (CTC decoding)
Training dataLibriSpeech 960h
Input16kHz mono audio (float32 waveform)
OutputCTC logits → greedy-decoded text
Original frameworkPyTorch (HuggingFace Transformers)
ONNX exportBy Xenova (Transformers.js)

License

This model is licensed under the MIT License. Original model by Facebook AI, ONNX export by Xenova.