fighter-programmer/voicegen
0
1import re2 3 4def japanese_cleaners(text):5 from text.japanese import japanese_to_romaji_with_accent6 text = japanese_to_romaji_with_accent(text)7 text = re.sub(r'([A-Za-z])$', r'\1.', text)8 return text9 10 11def japanese_cleaners2(text):12 return japanese_cleaners(text).replace('ts', 'ʦ').replace('...', '…')13 14 15def korean_cleaners(text):16 '''Pipeline for Korean text'''17 from text.korean import latin_to_hangul, number_to_hangul, divide_hangul18 text = latin_to_hangul(text)19 text = number_to_hangul(text)20 text = divide_hangul(text)21 text = re.sub(r'([\u3131-\u3163])$', r'\1.', text)22 return text23 24 25def chinese_cleaners(text):26 '''Pipeline for Chinese text'''27 from text.mandarin import number_to_chinese, chinese_to_bopomofo, latin_to_bopomofo28 text = number_to_chinese(text)29 text = chinese_to_bopomofo(text)30 text = latin_to_bopomofo(text)31 text = re.sub(r'([ˉˊˇˋ˙])$', r'\1。', text)32 return text33 34 35def zh_ja_mixture_cleaners(text):36 from text.mandarin import chinese_to_romaji37 from text.japanese import japanese_to_romaji_with_accent38 text = re.sub(r'\[ZH\](.*?)\[ZH\]',39 lambda x: chinese_to_romaji(x.group(1))+' ', text)40 text = re.sub(r'\[JA\](.*?)\[JA\]', lambda x: japanese_to_romaji_with_accent(41 x.group(1)).replace('ts', 'ʦ').replace('u', 'ɯ').replace('...', '…')+' ', text)42 text = re.sub(r'\s+$', '', text)43 text = re.sub(r'([^\.,!\?\-…~])$', r'\1.', text)44 return text45 46 47def sanskrit_cleaners(text):48 text = text.replace('॥', '।').replace('ॐ', 'ओम्')49 if text[-1] != '।':50 text += ' ।'51 return text52 53 54def cjks_cleaners(text):55 from text.mandarin import chinese_to_lazy_ipa56 from text.japanese import japanese_to_ipa57 from text.korean import korean_to_lazy_ipa58 from text.sanskrit import devanagari_to_ipa59 from text.english import english_to_lazy_ipa60 text = re.sub(r'\[ZH\](.*?)\[ZH\]',61 lambda x: chinese_to_lazy_ipa(x.group(1))+' ', text)62 text = re.sub(r'\[JA\](.*?)\[JA\]',63 lambda x: japanese_to_ipa(x.group(1))+' ', text)64 text = re.sub(r'\[KO\](.*?)\[KO\]',65 lambda x: korean_to_lazy_ipa(x.group(1))+' ', text)66 text = re.sub(r'\[SA\](.*?)\[SA\]',67 lambda x: devanagari_to_ipa(x.group(1))+' ', text)68 text = re.sub(r'\[EN\](.*?)\[EN\]',69 lambda x: english_to_lazy_ipa(x.group(1))+' ', text)70 text = re.sub(r'\s+$', '', text)71 text = re.sub(r'([^\.,!\?\-…~])$', r'\1.', text)72 return text73 74 75def cjke_cleaners(text):76 from text.mandarin import chinese_to_lazy_ipa77 from text.japanese import japanese_to_ipa78 from text.korean import korean_to_ipa79 from text.english import english_to_ipa280 text = re.sub(r'\[ZH\](.*?)\[ZH\]', lambda x: chinese_to_lazy_ipa(x.group(1)).replace(81 'ʧ', 'tʃ').replace('ʦ', 'ts').replace('ɥan', 'ɥæn')+' ', text)82 text = re.sub(r'\[JA\](.*?)\[JA\]', lambda x: japanese_to_ipa(x.group(1)).replace('ʧ', 'tʃ').replace(83 'ʦ', 'ts').replace('ɥan', 'ɥæn').replace('ʥ', 'dz')+' ', text)84 text = re.sub(r'\[KO\](.*?)\[KO\]',85 lambda x: korean_to_ipa(x.group(1))+' ', text)86 text = re.sub(r'\[EN\](.*?)\[EN\]', lambda x: english_to_ipa2(x.group(1)).replace('ɑ', 'a').replace(87 'ɔ', 'o').replace('ɛ', 'e').replace('ɪ', 'i').replace('ʊ', 'u')+' ', text)88 text = re.sub(r'\s+$', '', text)89 text = re.sub(r'([^\.,!\?\-…~])$', r'\1.', text)90 return text91 92 93def cjke_cleaners2(text):94 from text.mandarin import chinese_to_ipa95 from text.japanese import japanese_to_ipa296 from text.korean import korean_to_ipa97 from text.english import english_to_ipa298 text = re.sub(r'\[ZH\](.*?)\[ZH\]',99 lambda x: chinese_to_ipa(x.group(1))+' ', text)100 text = re.sub(r'\[JA\](.*?)\[JA\]',101 lambda x: japanese_to_ipa2(x.group(1))+' ', text)102 text = re.sub(r'\[KO\](.*?)\[KO\]',103 lambda x: korean_to_ipa(x.group(1))+' ', text)104 text = re.sub(r'\[EN\](.*?)\[EN\]',105 lambda x: english_to_ipa2(x.group(1))+' ', text)106 text = re.sub(r'\s+$', '', text)107 text = re.sub(r'([^\.,!\?\-…~])$', r'\1.', text)108 return text109 110 111def thai_cleaners(text):112 from text.thai import num_to_thai, latin_to_thai113 text = num_to_thai(text)114 text = latin_to_thai(text)115 return text116 117 118def shanghainese_cleaners(text):119 from text.shanghainese import shanghainese_to_ipa120 text = shanghainese_to_ipa(text)121 text = re.sub(r'([^\.,!\?\-…~])$', r'\1.', text)122 return text123 124 125def chinese_dialect_cleaners(text):126 from text.mandarin import chinese_to_ipa2127 from text.japanese import japanese_to_ipa3128 from text.shanghainese import shanghainese_to_ipa129 from text.cantonese import cantonese_to_ipa130 from text.english import english_to_lazy_ipa2131 from text.ngu_dialect import ngu_dialect_to_ipa132 text = re.sub(r'\[ZH\](.*?)\[ZH\]',133 lambda x: chinese_to_ipa2(x.group(1))+' ', text)134 text = re.sub(r'\[JA\](.*?)\[JA\]',135 lambda x: japanese_to_ipa3(x.group(1)).replace('Q', 'ʔ')+' ', text)136 text = re.sub(r'\[SH\](.*?)\[SH\]', lambda x: shanghainese_to_ipa(x.group(1)).replace('1', '˥˧').replace('5',137 '˧˧˦').replace('6', '˩˩˧').replace('7', '˥').replace('8', '˩˨').replace('ᴀ', 'ɐ').replace('ᴇ', 'e')+' ', text)138 text = re.sub(r'\[GD\](.*?)\[GD\]',139 lambda x: cantonese_to_ipa(x.group(1))+' ', text)140 text = re.sub(r'\[EN\](.*?)\[EN\]',141 lambda x: english_to_lazy_ipa2(x.group(1))+' ', text)142 text = re.sub(r'\[([A-Z]{2})\](.*?)\[\1\]', lambda x: ngu_dialect_to_ipa(x.group(2), x.group(143 1)).replace('ʣ', 'dz').replace('ʥ', 'dʑ').replace('ʦ', 'ts').replace('ʨ', 'tɕ')+' ', text)144 text = re.sub(r'\s+$', '', text)145 text = re.sub(r'([^\.,!\?\-…~])$', r'\1.', text)146 return text147 