CoolFace
Datasetpublic

dhkim54/amazon_reviews_multi

dataset_info: config_name: all_languages features: name: review_id dtype: string name: product_id dtype: string name: reviewer_id dtype: string name: stars dtype: int32 name: review_body dtype: string name: review_title dtype: string name: language dtype: string name: product_category dtype: string splits: name: train num_bytes: 364401688 num_examples: 1200000 name: validation num_bytes: 9047449 num_examples: 30000 name: test num_bytes: 9099057 num_examples: 30000 download_size: 215646341… See the full description on the dataset page: https://huggingface.co/datasets/dhkim54/amazon_reviews_multi.

sourceHugging Faceupdated 1y agoView on Hugging Face
0likes5downloads
Dataset Card

dataset_info:

  • —configname: alllanguages features:
  • —name: review_id dtype: string
  • —name: product_id dtype: string
  • —name: reviewer_id dtype: string
  • —name: stars dtype: int32
  • —name: review_body dtype: string
  • —name: review_title dtype: string
  • —name: language dtype: string
  • —name: product_category dtype: string splits:
  • —name: train numbytes: 364401688 numexamples: 1200000
  • —name: validation numbytes: 9047449 numexamples: 30000
  • —name: test numbytes: 9099057 numexamples: 30000 downloadsize: 215646341 datasetsize: 382548194
  • —config_name: de features:
  • —name: review_id dtype: string
  • —name: product_id dtype: string
  • —name: reviewer_id dtype: string
  • —name: stars dtype: int32
  • —name: review_body dtype: string
  • —name: review_title dtype: string
  • —name: language dtype: string
  • —name: product_category dtype: string splits:
  • —name: train numbytes: 64485118 numexamples: 200000
  • —name: validation numbytes: 1605699 numexamples: 5000
  • —name: test numbytes: 1611016 numexamples: 5000 downloadsize: 38275886 datasetsize: 67701833
  • —config_name: en features:
  • —name: review_id dtype: string
  • —name: product_id dtype: string
  • —name: reviewer_id dtype: string
  • —name: stars dtype: int32
  • —name: review_body dtype: string
  • —name: review_title dtype: string
  • —name: language dtype: string
  • —name: product_category dtype: string splits:
  • —name: train numbytes: 58600529 numexamples: 200000
  • —name: validation numbytes: 1474644 numexamples: 5000
  • —name: test numbytes: 1460537 numexamples: 5000 downloadsize: 34791657 datasetsize: 61535710
  • —config_name: es features:
  • —name: review_id dtype: string
  • —name: product_id dtype: string
  • —name: reviewer_id dtype: string
  • —name: stars dtype: int32
  • —name: review_body dtype: string
  • —name: review_title dtype: string
  • —name: language dtype: string
  • —name: product_category dtype: string splits:
  • —name: train numbytes: 52375098 numexamples: 200000
  • —name: validation numbytes: 1303930 numexamples: 5000
  • —name: test numbytes: 1312319 numexamples: 5000 downloadsize: 30477387 datasetsize: 54991347
  • —config_name: fr features:
  • —name: review_id dtype: string
  • —name: product_id dtype: string
  • —name: reviewer_id dtype: string
  • —name: stars dtype: int32
  • —name: review_body dtype: string
  • —name: review_title dtype: string
  • —name: language dtype: string
  • —name: product_category dtype: string splits:
  • —name: train numbytes: 54593005 numexamples: 200000
  • —name: validation numbytes: 1340735 numexamples: 5000
  • —name: test numbytes: 1364482 numexamples: 5000 downloadsize: 31541799 datasetsize: 57298222
  • —config_name: ja features:
  • —name: review_id dtype: string
  • —name: product_id dtype: string
  • —name: reviewer_id dtype: string
  • —name: stars dtype: int32
  • —name: review_body dtype: string
  • —name: review_title dtype: string
  • —name: language dtype: string
  • —name: product_category dtype: string splits:
  • —name: train numbytes: 82400830 numexamples: 200000
  • —name: validation numbytes: 2035363 numexamples: 5000
  • —name: test numbytes: 2048020 numexamples: 5000 downloadsize: 47562531 datasetsize: 86484213
  • —config_name: zh features:
  • —name: review_id dtype: string
  • —name: product_id dtype: string
  • —name: reviewer_id dtype: string
  • —name: stars dtype: int32
  • —name: review_body dtype: string
  • —name: review_title dtype: string
  • —name: language dtype: string
  • —name: product_category dtype: string splits:
  • —name: train numbytes: 51947108 numexamples: 200000
  • —name: validation numbytes: 1287078 numexamples: 5000
  • —name: test numbytes: 1302683 numexamples: 5000 downloadsize: 33020310 datasetsize: 54536869 configs:
  • —configname: alllanguages data_files:
  • —split: train path: all_languages/train-*
  • —split: validation path: all_languages/validation-*
  • —split: test path: all_languages/test-*
  • —configname: de datafiles:
  • —split: train path: de/train-*
  • —split: validation path: de/validation-*
  • —split: test path: de/test-*
  • —configname: en datafiles:
  • —split: train path: en/train-*
  • —split: validation path: en/validation-*
  • —split: test path: en/test-*
  • —configname: es datafiles:
  • —split: train path: es/train-*
  • —split: validation path: es/validation-*
  • —split: test path: es/test-*
  • —configname: fr datafiles:
  • —split: train path: fr/train-*
  • —split: validation path: fr/validation-*
  • —split: test path: fr/test-*
  • —configname: ja datafiles:
  • —split: train path: ja/train-*
  • —split: validation path: ja/validation-*
  • —split: test path: ja/test-*
  • —configname: zh datafiles:
  • —split: train path: zh/train-*
  • —split: validation path: zh/validation-*
  • —split: test path: zh/test-*