code-switching/topic-classification
062
1---2language:3- ar4- su5- jv6- id7- en8- fr9pretty_name: Code-switch Topic Classification10dataset_info:11- config_name: ar-dz-fr12 features:13 - name: dialogue_id14 dtype: int6415 - name: initial_topic16 dtype: string17 - name: topic_category18 dtype: string19 - name: languages20 dtype: string21 - name: num_of_speakers22 dtype: int6423 - name: postprocessed_dialogue24 dtype: string25 - name: __index_level_0__26 dtype: int6427 splits:28 - name: train29 num_bytes: 378130 num_examples: 131 - name: test32 num_bytes: 36721033 num_examples: 9934 download_size: 27714535 dataset_size: 37099136- config_name: ha-en37 features:38 - name: dialogue_id39 dtype: int6440 - name: initial_topic41 dtype: string42 - name: topic_category43 dtype: string44 - name: languages45 dtype: string46 - name: num_of_speakers47 dtype: int6448 - name: postprocessed_dialogue49 dtype: string50 - name: __index_level_0__51 dtype: int6452 splits:53 - name: train54 num_bytes: 266355 num_examples: 156 - name: test57 num_bytes: 31258458 num_examples: 9959 download_size: 22080460 dataset_size: 31524761- config_name: hi-en62 features:63 - name: dialogue_id64 dtype: int6465 - name: initial_topic66 dtype: string67 - name: topic_category68 dtype: string69 - name: languages70 dtype: string71 - name: num_of_speakers72 dtype: int6473 - name: postprocessed_dialogue74 dtype: string75 - name: __index_level_0__76 dtype: int6477 splits:78 - name: train79 num_bytes: 306380 num_examples: 181 - name: test82 num_bytes: 34208783 num_examples: 9984 download_size: 24262885 dataset_size: 34515086- config_name: id-en87 features:88 - name: dialogue_id89 dtype: int6490 - name: initial_topic91 dtype: string92 - name: topic_category93 dtype: string94 - name: languages95 dtype: string96 - name: num_of_speakers97 dtype: int6498 - name: postprocessed_dialogue99 dtype: string100 - name: __index_level_0__101 dtype: int64102 splits:103 - name: train104 num_bytes: 4068105 num_examples: 1106 - name: test107 num_bytes: 343119108 num_examples: 99109 download_size: 256360110 dataset_size: 347187111- config_name: jv-id-en112 features:113 - name: dialogue_id114 dtype: int64115 - name: initial_topic116 dtype: string117 - name: topic_category118 dtype: string119 - name: languages120 dtype: string121 - name: num_of_speakers122 dtype: int64123 - name: postprocessed_dialogue124 dtype: string125 - name: __index_level_0__126 dtype: int64127 splits:128 - name: train129 num_bytes: 4502130 num_examples: 1131 - name: test132 num_bytes: 346225133 num_examples: 99134 download_size: 238207135 dataset_size: 350727136- config_name: su-id-en137 features:138 - name: dialogue_id139 dtype: int64140 - name: initial_topic141 dtype: string142 - name: topic_category143 dtype: string144 - name: languages145 dtype: string146 - name: num_of_speakers147 dtype: int64148 - name: postprocessed_dialogue149 dtype: string150 - name: __index_level_0__151 dtype: int64152 splits:153 - name: train154 num_bytes: 3046155 num_examples: 1156 - name: test157 num_bytes: 382940158 num_examples: 99159 download_size: 246745160 dataset_size: 385986161configs:162- config_name: ar-dz-fr163 data_files:164 - split: train165 path: ar-dz-fr/train-*166 - split: test167 path: ar-dz-fr/test-*168- config_name: ha-en169 data_files:170 - split: train171 path: ha-en/train-*172 - split: test173 path: ha-en/test-*174- config_name: hi-en175 data_files:176 - split: train177 path: hi-en/train-*178 - split: test179 path: hi-en/test-*180- config_name: id-en181 data_files:182 - split: train183 path: id-en/train-*184 - split: test185 path: id-en/test-*186- config_name: jv-id-en187 data_files:188 - split: train189 path: jv-id-en/train-*190 - split: test191 path: jv-id-en/test-*192- config_name: su-id-en193 data_files:194 - split: train195 path: su-id-en/train-*196 - split: test197 path: su-id-en/test-*198task_categories:199- text-classification200- zero-shot-classification201---202 