CoolFace
Apppublic

fighter-programmer/voicegen

sourceHugging Faceupdated 4y agoView on Hugging Face
0likes
cleaners.py147 linesDownload Raw Back to text
1import re2 3 4def japanese_cleaners(text):5    from text.japanese import japanese_to_romaji_with_accent6    text = japanese_to_romaji_with_accent(text)7    text = re.sub(r'([A-Za-z])$', r'\1.', text)8    return text9 10 11def japanese_cleaners2(text):12    return japanese_cleaners(text).replace('ts', 'ʦ').replace('...', '…')13 14 15def korean_cleaners(text):16    '''Pipeline for Korean text'''17    from text.korean import latin_to_hangul, number_to_hangul, divide_hangul18    text = latin_to_hangul(text)19    text = number_to_hangul(text)20    text = divide_hangul(text)21    text = re.sub(r'([\u3131-\u3163])$', r'\1.', text)22    return text23 24 25def chinese_cleaners(text):26    '''Pipeline for Chinese text'''27    from text.mandarin import number_to_chinese, chinese_to_bopomofo, latin_to_bopomofo28    text = number_to_chinese(text)29    text = chinese_to_bopomofo(text)30    text = latin_to_bopomofo(text)31    text = re.sub(r'([ˉˊˇˋ˙])$', r'\1。', text)32    return text33 34 35def zh_ja_mixture_cleaners(text):36    from text.mandarin import chinese_to_romaji37    from text.japanese import japanese_to_romaji_with_accent38    text = re.sub(r'\[ZH\](.*?)\[ZH\]',39                  lambda x: chinese_to_romaji(x.group(1))+' ', text)40    text = re.sub(r'\[JA\](.*?)\[JA\]', lambda x: japanese_to_romaji_with_accent(41        x.group(1)).replace('ts', 'ʦ').replace('u', 'ɯ').replace('...', '…')+' ', text)42    text = re.sub(r'\s+$', '', text)43    text = re.sub(r'([^\.,!\?\-…~])$', r'\1.', text)44    return text45 46 47def sanskrit_cleaners(text):48    text = text.replace('॥', '।').replace('ॐ', 'ओम्')49    if text[-1] != '।':50        text += ' ।'51    return text52 53 54def cjks_cleaners(text):55    from text.mandarin import chinese_to_lazy_ipa56    from text.japanese import japanese_to_ipa57    from text.korean import korean_to_lazy_ipa58    from text.sanskrit import devanagari_to_ipa59    from text.english import english_to_lazy_ipa60    text = re.sub(r'\[ZH\](.*?)\[ZH\]',61                  lambda x: chinese_to_lazy_ipa(x.group(1))+' ', text)62    text = re.sub(r'\[JA\](.*?)\[JA\]',63                  lambda x: japanese_to_ipa(x.group(1))+' ', text)64    text = re.sub(r'\[KO\](.*?)\[KO\]',65                  lambda x: korean_to_lazy_ipa(x.group(1))+' ', text)66    text = re.sub(r'\[SA\](.*?)\[SA\]',67                  lambda x: devanagari_to_ipa(x.group(1))+' ', text)68    text = re.sub(r'\[EN\](.*?)\[EN\]',69                  lambda x: english_to_lazy_ipa(x.group(1))+' ', text)70    text = re.sub(r'\s+$', '', text)71    text = re.sub(r'([^\.,!\?\-…~])$', r'\1.', text)72    return text73 74 75def cjke_cleaners(text):76    from text.mandarin import chinese_to_lazy_ipa77    from text.japanese import japanese_to_ipa78    from text.korean import korean_to_ipa79    from text.english import english_to_ipa280    text = re.sub(r'\[ZH\](.*?)\[ZH\]', lambda x: chinese_to_lazy_ipa(x.group(1)).replace(81        'ʧ', 'tʃ').replace('ʦ', 'ts').replace('ɥan', 'ɥæn')+' ', text)82    text = re.sub(r'\[JA\](.*?)\[JA\]', lambda x: japanese_to_ipa(x.group(1)).replace('ʧ', 'tʃ').replace(83        'ʦ', 'ts').replace('ɥan', 'ɥæn').replace('ʥ', 'dz')+' ', text)84    text = re.sub(r'\[KO\](.*?)\[KO\]',85                  lambda x: korean_to_ipa(x.group(1))+' ', text)86    text = re.sub(r'\[EN\](.*?)\[EN\]', lambda x: english_to_ipa2(x.group(1)).replace('ɑ', 'a').replace(87        'ɔ', 'o').replace('ɛ', 'e').replace('ɪ', 'i').replace('ʊ', 'u')+' ', text)88    text = re.sub(r'\s+$', '', text)89    text = re.sub(r'([^\.,!\?\-…~])$', r'\1.', text)90    return text91 92 93def cjke_cleaners2(text):94    from text.mandarin import chinese_to_ipa95    from text.japanese import japanese_to_ipa296    from text.korean import korean_to_ipa97    from text.english import english_to_ipa298    text = re.sub(r'\[ZH\](.*?)\[ZH\]',99                  lambda x: chinese_to_ipa(x.group(1))+' ', text)100    text = re.sub(r'\[JA\](.*?)\[JA\]',101                  lambda x: japanese_to_ipa2(x.group(1))+' ', text)102    text = re.sub(r'\[KO\](.*?)\[KO\]',103                  lambda x: korean_to_ipa(x.group(1))+' ', text)104    text = re.sub(r'\[EN\](.*?)\[EN\]',105                  lambda x: english_to_ipa2(x.group(1))+' ', text)106    text = re.sub(r'\s+$', '', text)107    text = re.sub(r'([^\.,!\?\-…~])$', r'\1.', text)108    return text109 110 111def thai_cleaners(text):112    from text.thai import num_to_thai, latin_to_thai113    text = num_to_thai(text)114    text = latin_to_thai(text)115    return text116 117 118def shanghainese_cleaners(text):119    from text.shanghainese import shanghainese_to_ipa120    text = shanghainese_to_ipa(text)121    text = re.sub(r'([^\.,!\?\-…~])$', r'\1.', text)122    return text123 124 125def chinese_dialect_cleaners(text):126    from text.mandarin import chinese_to_ipa2127    from text.japanese import japanese_to_ipa3128    from text.shanghainese import shanghainese_to_ipa129    from text.cantonese import cantonese_to_ipa130    from text.english import english_to_lazy_ipa2131    from text.ngu_dialect import ngu_dialect_to_ipa132    text = re.sub(r'\[ZH\](.*?)\[ZH\]',133                  lambda x: chinese_to_ipa2(x.group(1))+' ', text)134    text = re.sub(r'\[JA\](.*?)\[JA\]',135                  lambda x: japanese_to_ipa3(x.group(1)).replace('Q', 'ʔ')+' ', text)136    text = re.sub(r'\[SH\](.*?)\[SH\]', lambda x: shanghainese_to_ipa(x.group(1)).replace('1', '˥˧').replace('5',137                  '˧˧˦').replace('6', '˩˩˧').replace('7', '˥').replace('8', '˩˨').replace('ᴀ', 'ɐ').replace('ᴇ', 'e')+' ', text)138    text = re.sub(r'\[GD\](.*?)\[GD\]',139                  lambda x: cantonese_to_ipa(x.group(1))+' ', text)140    text = re.sub(r'\[EN\](.*?)\[EN\]',141                  lambda x: english_to_lazy_ipa2(x.group(1))+' ', text)142    text = re.sub(r'\[([A-Z]{2})\](.*?)\[\1\]', lambda x: ngu_dialect_to_ipa(x.group(2), x.group(143        1)).replace('ʣ', 'dz').replace('ʥ', 'dʑ').replace('ʦ', 'ts').replace('ʨ', 'tɕ')+' ', text)144    text = re.sub(r'\s+$', '', text)145    text = re.sub(r'([^\.,!\?\-…~])$', r'\1.', text)146    return text147