Vikhrmodels/Borealis
5477k

Borealis
Описание
Borealis - это наша первая audio llm c ASR для русского языка. В этом репозитории представлен чекпоинт, который видел примерно 7000 часов аудио на русском языке. Важным отличием от других моделей является то, что тут есть поддержка пунктуации в распознанных аудио. Архитектура во многом вдохновлена Voxtral, но отличается в некоторых моментах.
Использование
from transformers import AutoModelForCausalLM, AutoTokenizer, AutoFeatureExtractor
import torch
import librosa
model = AutoModelForCausalLM.from_pretrained("Vikhrmodels/Borealis", trust_remote_code=True)
tokenizer = AutoTokenizer.from_pretrained("Vikhrmodels/Borealis")
extractor = AutoFeatureExtractor.from_pretrained("Vikhrmodels/Borealis")
generation_params = {
"max_new_tokens": 350,
"do_sample": True,
"top_p": 0.9,
"top_k": 50,
"temperature": 0.2,
}
model.eval()
model.to("cuda")
waveform, sr = librosa.load("path/to/your/audio.wav", sr=16_000)
proc = extractor(
waveform,
sampling_rate=sr,
padding="max_length",
max_length=480_000,
return_attention_mask=True,
return_tensors="pt",
)
mel = proc.input_features.squeeze(0).to("cuda")
att_mask = proc.attention_mask.squeeze(0).to("cuda")
with torch.inference_mode():
transcript = model.generate(mel=mel, att_mask=att_mask, **generation_params)
print(transcript)Метрики модели
Ниже представлены замеры Borealis на фоне остальных открытых моделей, который поддерживают русский язык. Бенчмарк мы скоро выложим в открытый доступ
Авторы
- Илья Кулешов, Vikhr Team
- Александр Николич, Vikhr Team
