bert-base-cased
BERT_Base_Cased_128_Dataset_MappedDataset using the bert-cased tokenizer, cutoff sentences to 128 length (not sentence pairs), all sentence pairs extracted.
Original datasets:
https://huggingface.co/datasets/bookcorpus
https://huggingface.co/datasets/wikipedia Variant: 20220301.en
Mapped from: https://huggingface.co/datasets/gmongaras/BERT_Base_Cased_128_Dataset
BERT_Base_Cased_512_DatasetDataset using the bert-cased tokenizer, cutoff sentences to 512 length (not sentence pairs), all sentence pairs extracted.
Original datasets:
https://huggingface.co/datasets/bookcorpus
https://huggingface.co/datasets/wikipedia Variant: 20220301.en
BERT_Base_Cased_512_Dataset2Dataset using the bert-cased tokenizer, cutoff sentences to 512 length (not sentence pairs), all sentence pairs extracted.
Original datasets:
https://huggingface.co/datasets/bookcorpus
Original dataset: https://huggingface.co/datasets/wikipedia Variant: 20220301.en
BERT_Base_Cased_512_Dataset_MappedDataset using the bert-cased tokenizer, cutoff sentences to 512 length (not sentence pairs), all sentence pairs extracted.
Original datasets:
https://huggingface.co/datasets/bookcorpus
https://huggingface.co/datasets/wikipedia Variant: 20220301.en
Mapped from: https://huggingface.co/datasets/gmongaras/BERT_Base_Cased_512_Dataset
raw_dataset_with_embeddings_bert-base-portuguese-cased-nli-assin-2
Dataset Card for "raw_dataset_with_embeddings_bert-base-portuguese-cased-nli-assin-2"
More Information needed
BERT_Base_Cased_128_DatasetDataset using the bert-cased tokenizer, cutoff sentences to 128 length (not sentence pairs), all sentence pairs extracted.
Original datasets:
https://huggingface.co/datasets/bookcorpus
https://huggingface.co/datasets/wikipedia Variant: 20220301.en
