CoolFace
Modelpublic

jaehyun-kim/snowflake-arctic-embed-v2.0-onnx-quantized

sourceHugging Faceapache-2.0updated 6mo agoView on Hugging Face
0likes
Model Card

Snowflake Arctic Embed v2.0 (ONNX Quantized)

본 모델은 Snowflake/snowflake-arctic-embed-m-v2.0 모델을 온디바이스(Android/iOS) 환경에 최적화하기 위해 가지치기(Pruning) 및 Int8 양자화를 적용한 버전입니다. 불교 경전 검색 엔진 프로젝트의 온디바이스 엔진으로 사용됩니다.

💎 모델 최적화 결과 (Optimization)

항목상세 내용비고
원본 모델Snowflake/snowflake-arctic-embed-m-v2.0768차원
어휘 가지치기250,048개 → 99,435개 토큰한/중/영/산스크리트 보존
양자화Dynamic Int8 적용ARM64 추론 속도 향상
최종 용량1.23 GB → 188 MB85% 압축 성공

🚀 주요 특징

  • —비대칭 검색(Asymmetric Search) 최적화: 쿼리와 문서의 임베딩 형식이 다른 검색 시나리오에 특화되어 있습니다.
  • —MRL(Matryoshka Representation Learning) 지원: 768차원(원본) 성능을 유지하면서도, 필요에 따라 256차원으로 축소하여 리소스 사용량을 최적화할 수 있습니다.
  • —온디바이스 특화: Android/iOS 앱 내 로컬 추론에 최적화된 ONNX 포맷입니다.

🛠️ 사용 방법 (Usage)

Query Prefix (검색 쿼리 시 필수)

최적의 검색 성능을 위해 사용자 입력 쿼리 앞에는 항상 아래의 접두사를 붙여야 합니다: Represent this sentence for searching relevant passages:

주의: DB에 저장할 문서(Passage)에는 접두사를 붙이지 않습니다.

입/출력 정보

  • —Input: input_ids, attention_mask (int64)
  • —Output: last_hidden_state (float32)
  • —Post-processing: Mean Pooling 및 L2 Normalization 권장

📂 관련 리소스

  • —Source Code: GitHub Repository
  • —Base Model: [Snowflake/snowflake-arctic-embed-m-v2.0](