lynx9844/whisper-large-v3-turbo-uzbek-v1
1239
πΊπΏ Whisper Large v3 Turbo Uzbek (v1)
Bu model OpenAI Whisper Large v3 Turbo arxitekturasi asosida yaratilgan bo'lib, o'zbek tili nutqini matnga aylantirish (Speech-to-Text / STT) uchun maxsus sozlangan va optimallashtirilgan 1-versiyadir (v1).
Ushbu reliz butun o'zbek ochiq kodli dasturchilar hamjamiyati (open-source community) uchun ochiq taqdim etilmoqda. Maqsad β har bir tadqiqotchi va dasturchi noldan katta hisoblash quvvati sarflamasdan, tayyor yuqori sifatli o'zbek STT modelidan foydalana olishi.
π¨βπ» Muallif & Identifikatsiya (Author & Provenance)
Kelajakdagi barcha o'zbek nutq va AI loyihalari uchun rasmiy mualliflik imzosi:
- Muallif (Author): R. Nematov
- Taxallus (Handle / Alias): Lynx (@lynx9844)
- GitHub: github.com/nematov9844
- Bog'lanish (Email):
nematov9844@gmail.com - Yo'nalish (Initiative): Mustaqil O'zbek AI Tadqiqoti (Independent Uzbek Speech AI Initiative)
π― Model Haqida va Qilingan Ishlar
- Baza Model:
openai/whisper-large-v3-turbo(800M parametr, OpenAI'ning eng tezkor flagmani). - O'zbek tiliga moslashtirish (Finetuning & Conditioning):
- Universal Whisper modelining o'zbek tilidagi kamchiliklari (turkcha/qirg'izcha tovushlarga chalg'ishi) bartaraf etildi.
- O'zbek tili alifbosi, tutuq belgilari (
',Κ»,ΚΌ), jarangli/jarangsiz tovushlar va keng tarqalgan so'zlashuv iboralari uchun maxsus yo'naltiruvchi dekoder (prompt conditioning & vocabulary alignment) integratsiya qilindi. - Ma'lumotlar bazasi (Dataset): O'zbekistonning turli mintaqaviy lahjalari va aksentlarini o'z ichiga olgan DavronSherbaev/uzbekvoice-filtered hamda saralangan o'zbek audio to'plamlari orqali tahlil qilingan.
βοΈ Sifat Darajasi va Xolisona Baho (Neutral Evaluation)
π Qanday Foydalanish Mumkin? (Quickstart)
Modelni o'z loyihalaringizga oddiy va tez ulash mumkin:
Python (Transformers kutubxonasi orqali):
import torch
import torchaudio
from transformers import WhisperProcessor, WhisperForConditionalGeneration
# 1. Model va Processorni yuklash
model_id = "lynx9844/whisper-large-v3-turbo-uzbek-v1"
device = "cuda:0" if torch.cuda.is_available() else "cpu"
processor = WhisperProcessor.from_pretrained(model_id)
model = WhisperForConditionalGeneration.from_pretrained(
model_id,
torch_dtype=torch.float16 if device != "cpu" else torch.float32,
low_cpu_mem_usage=True
).to(device)
# 2. Audioni yuklash (16kHz mono tavsiya etiladi)
speech_tensor, rate = torchaudio.load("audio.ogg")
if rate != 16000:
import torchaudio.transforms as T
speech_tensor = T.Resample(rate, 16000)(speech_tensor)
if speech_tensor.shape[0] > 1:
speech_tensor = speech_tensor.mean(dim=0, keepdim=True)
inputs = processor(speech_tensor.squeeze().numpy(), sampling_rate=16000, return_tensors="pt").input_features.to(device)
if device != "cpu":
inputs = inputs.half()
# 3. Transkripsiya qilish
with torch.no_grad():
predicted_ids = model.generate(
inputs,
language="uz",
task="transcribe",
no_repeat_ngram_size=3
)
text = processor.batch_decode(predicted_ids, skip_special_tokens=True)[0]
print("Transkripsiya:", text)π Litsenziya
Ushbu loyiha Apache-2.0 litsenziyasi ostida ochiq tarqatiladi. Siz undan tijoriy va notijoriy loyihalarda erkin foydalanishingiz mumkin.
