CoolFace
Datasetpublic

plaguss/argilla_sdk_docs_raw_unstructured

Dataset info This dataset contains documentation chunks from repositories (ADD REPOS). Postprocessing After some inspection, some chunks contain text too short to be meaningful, so we decided to remove those by removing chunks whose number of tokens (computed with the same tokenizer of the model to be used for the embeddings) is lower or equal to the 5%: from transformers import AutoTokenizer tokenizer = AutoTokenizer.from_pretrained("BAAI/bge-base-en-v1.5") df =… See the full description on the dataset page: https://huggingface.co/datasets/plaguss/argilla_sdk_docs_raw_unstructured.

sourceHugging Faceupdated 2y agoView on Hugging Face
0likes1.6kdownloads
10 commits on main
ea9ac032y ago

Upload dataset

plaguss
64b051d2y ago

Update README.md

plaguss
d485c1e2y ago

Update README.md

plaguss
56c8a932y ago

Upload dataset

plaguss
016742e2y ago

Upload dataset

plaguss
a72fb2b2y ago

Upload dataset

plaguss
a99fe2a2y ago

Upload dataset

plaguss
a2d6f812y ago

Upload dataset

plaguss
1a417cc2y ago

Upload dataset

plaguss
a1dab2a2y ago

initial commit

plaguss