SungBeom/whisper-small-ko
21978
whisper-small-ko
해당 모델은 Whisper Small을 아래의 AI hub dataset에 대해 파인튜닝을 진행했습니다. <br> 데이터셋의 크기가 큰 관계로 데이터셋을 랜덤하게 섞은 후 5개로 나누어 학습을 진행했습니다. <br>
Training results
dataset
해당 모델은 AI hub의 많은 데이터셋을 한번에 학습시킨 것이 특징입니다. <br> ASR은 domain에 대한 의존도가 매우 큽니다. 이 때문에 하나의 데이터셋에 학습을 시키더라도 다른 데이터셋에 대해서 테스트를 진행하면 성능이 크게 떨어지게 됩니다. <br> 이런 부분을 막기 위해 최대한 많은 데이터셋을 한 번에 학습시켰습니다. <br> 추후 사투리나 어린아이, 노인의 음성은 adapter를 활용하면 좋은 성능을 얻을 수 있을 것입니다.
Training procedure
Training hyperparameters
The following hyperparameters were used during training:
- learning_rate: 1e-05
- trainbatchsize: 32
- evalbatchsize: 16
- gradientaccumulationsteps: 2
- warmup_ratio: 0.01,
- numtrainepoch: 1
