CoolFace
Datasetpublic

electroglyph/jina5_small_distill

distilled embeddings from jinaai/jina-embeddings-v5-text-small this is using data from UltraX-FineWeb-ProX-Doc from openbmb/UltraX-Preview dataset each row is approximately 256-512 tokens, chunks always begin and end on a sentence boundary.

sourceHugging Faceupdated 2mo agoView on Hugging Face
0likes3.4kdownloads
Dataset Card

distilled embeddings from jinaai/jina-embeddings-v5-text-small

this is using data from UltraX-FineWeb-ProX-Doc from openbmb/UltraX-Preview dataset

each row is approximately 256-512 tokens, chunks always begin and end on a sentence boundary.