CoolFace
Modelpublic

Vyvo-Research/WavTokenizer-medium-speech-320-24k-v2

sourceHugging Facemitupdated 11mo agoView on Hugging Face
0likes
Model Card

WavTokenizer-medium-speech-320-24k-v2

WavTokenizer Medium Speech Model v2 - 320 dim, 24kHz

Installation

bash
pip install codecplus

Usage

python
from codecplus import load_codec
from codecplus.utils import load_audio, save_audio

# Load audio
audio, sr = load_audio('input.wav')

# WavTokenizer
tokenizer = load_codec('wav_tokenizer')
tokens = tokenizer.encode(audio)
output = tokenizer.decode(tokens)

# Save output
save_audio(output, 'output.wav', sr)

Model Details

  • —Source Repository: Vyvo-Research/WavTokenizer
  • —Original File: wavtokenizer_medium_speech_320_24k_v2.ckpt
  • —Architecture: WavTokenizer
  • —License: MIT

Features

  • —High-quality audio tokenization
  • —Efficient compression
  • —Suitable for TTS and audio generation tasks
  • —Low-latency encoding/decoding

Citation

bibtex
@misc{wavtokenizer2024,
  title={WavTokenizer: Efficient Audio Tokenization},
  author={Vyvo Research Team},
  year={2024},
  url={https://github.com/Vyvo-ai/WavTokenizer}
}