CoolFace
Datasetpublic

code-switching/topic-classification

sourceHugging Faceupdated 14d agoView on Hugging Face
0likes62downloads
README.md202 linesDownload Raw Back to root
1---2language:3- ar4- su5- jv6- id7- en8- fr9pretty_name: Code-switch Topic Classification10dataset_info:11- config_name: ar-dz-fr12  features:13  - name: dialogue_id14    dtype: int6415  - name: initial_topic16    dtype: string17  - name: topic_category18    dtype: string19  - name: languages20    dtype: string21  - name: num_of_speakers22    dtype: int6423  - name: postprocessed_dialogue24    dtype: string25  - name: __index_level_0__26    dtype: int6427  splits:28  - name: train29    num_bytes: 378130    num_examples: 131  - name: test32    num_bytes: 36721033    num_examples: 9934  download_size: 27714535  dataset_size: 37099136- config_name: ha-en37  features:38  - name: dialogue_id39    dtype: int6440  - name: initial_topic41    dtype: string42  - name: topic_category43    dtype: string44  - name: languages45    dtype: string46  - name: num_of_speakers47    dtype: int6448  - name: postprocessed_dialogue49    dtype: string50  - name: __index_level_0__51    dtype: int6452  splits:53  - name: train54    num_bytes: 266355    num_examples: 156  - name: test57    num_bytes: 31258458    num_examples: 9959  download_size: 22080460  dataset_size: 31524761- config_name: hi-en62  features:63  - name: dialogue_id64    dtype: int6465  - name: initial_topic66    dtype: string67  - name: topic_category68    dtype: string69  - name: languages70    dtype: string71  - name: num_of_speakers72    dtype: int6473  - name: postprocessed_dialogue74    dtype: string75  - name: __index_level_0__76    dtype: int6477  splits:78  - name: train79    num_bytes: 306380    num_examples: 181  - name: test82    num_bytes: 34208783    num_examples: 9984  download_size: 24262885  dataset_size: 34515086- config_name: id-en87  features:88  - name: dialogue_id89    dtype: int6490  - name: initial_topic91    dtype: string92  - name: topic_category93    dtype: string94  - name: languages95    dtype: string96  - name: num_of_speakers97    dtype: int6498  - name: postprocessed_dialogue99    dtype: string100  - name: __index_level_0__101    dtype: int64102  splits:103  - name: train104    num_bytes: 4068105    num_examples: 1106  - name: test107    num_bytes: 343119108    num_examples: 99109  download_size: 256360110  dataset_size: 347187111- config_name: jv-id-en112  features:113  - name: dialogue_id114    dtype: int64115  - name: initial_topic116    dtype: string117  - name: topic_category118    dtype: string119  - name: languages120    dtype: string121  - name: num_of_speakers122    dtype: int64123  - name: postprocessed_dialogue124    dtype: string125  - name: __index_level_0__126    dtype: int64127  splits:128  - name: train129    num_bytes: 4502130    num_examples: 1131  - name: test132    num_bytes: 346225133    num_examples: 99134  download_size: 238207135  dataset_size: 350727136- config_name: su-id-en137  features:138  - name: dialogue_id139    dtype: int64140  - name: initial_topic141    dtype: string142  - name: topic_category143    dtype: string144  - name: languages145    dtype: string146  - name: num_of_speakers147    dtype: int64148  - name: postprocessed_dialogue149    dtype: string150  - name: __index_level_0__151    dtype: int64152  splits:153  - name: train154    num_bytes: 3046155    num_examples: 1156  - name: test157    num_bytes: 382940158    num_examples: 99159  download_size: 246745160  dataset_size: 385986161configs:162- config_name: ar-dz-fr163  data_files:164  - split: train165    path: ar-dz-fr/train-*166  - split: test167    path: ar-dz-fr/test-*168- config_name: ha-en169  data_files:170  - split: train171    path: ha-en/train-*172  - split: test173    path: ha-en/test-*174- config_name: hi-en175  data_files:176  - split: train177    path: hi-en/train-*178  - split: test179    path: hi-en/test-*180- config_name: id-en181  data_files:182  - split: train183    path: id-en/train-*184  - split: test185    path: id-en/test-*186- config_name: jv-id-en187  data_files:188  - split: train189    path: jv-id-en/train-*190  - split: test191    path: jv-id-en/test-*192- config_name: su-id-en193  data_files:194  - split: train195    path: su-id-en/train-*196  - split: test197    path: su-id-en/test-*198task_categories:199- text-classification200- zero-shot-classification201---202