CoolFace
Datasetpublic

LLM-OS-Models/korean-embedding-performance-v1-sionic-retrieval-train-family-4146

Korean Sionic Retrieval Train-Family 4,146 F2LLM-v2가 공개한 Korean MIRACL, MrTidy, MLDR train-family row만 1M decontaminated curriculum에서 lossless 추출한 target-adaptation dataset이다. 공개 evaluation query는 포함하지 않으며 current-student HN7 mining 전의 source artifact다. 구성과 목적 source rows 역할 f2_miracl_ko_train 700 MIRACL Korean retrieval train-family f2_mrtidy_korean_train 1,200 MrTidy Korean train f2_mldr_ko_train 2,246 MLDR Korean long-document train-family 합계 4… See the full description on the dataset page: https://huggingface.co/datasets/LLM-OS-Models/korean-embedding-performance-v1-sionic-retrieval-train-family-4146.

sourceHugging Faceotherupdated 3mo agoView on Hugging Face
0likes60downloads
4 commits on main
c9513a63mo ago

Use faster 2K microbatch contract

gyung
c847cbc3mo ago

Document 2K specialist training contract

gyung
d1310813mo ago

Publish validated Korean embedding pilot 50K

gyung
091b9613mo ago

initial commit

gyung