jaehyun-kim/snowflake-arctic-embed-v2.0-onnx-quantized
0
Snowflake Arctic Embed v2.0 (ONNX Quantized)
본 모델은 Snowflake/snowflake-arctic-embed-m-v2.0 모델을 온디바이스(Android/iOS) 환경에 최적화하기 위해 가지치기(Pruning) 및 Int8 양자화를 적용한 버전입니다. 불교 경전 검색 엔진 프로젝트의 온디바이스 엔진으로 사용됩니다.
💎 모델 최적화 결과 (Optimization)
🚀 주요 특징
- 비대칭 검색(Asymmetric Search) 최적화: 쿼리와 문서의 임베딩 형식이 다른 검색 시나리오에 특화되어 있습니다.
- MRL(Matryoshka Representation Learning) 지원: 768차원(원본) 성능을 유지하면서도, 필요에 따라 256차원으로 축소하여 리소스 사용량을 최적화할 수 있습니다.
- 온디바이스 특화: Android/iOS 앱 내 로컬 추론에 최적화된 ONNX 포맷입니다.
🛠️ 사용 방법 (Usage)
Query Prefix (검색 쿼리 시 필수)
최적의 검색 성능을 위해 사용자 입력 쿼리 앞에는 항상 아래의 접두사를 붙여야 합니다: Represent this sentence for searching relevant passages:
주의: DB에 저장할 문서(Passage)에는 접두사를 붙이지 않습니다.
입/출력 정보
- Input:
input_ids,attention_mask(int64) - Output:
last_hidden_state(float32) - Post-processing: Mean Pooling 및 L2 Normalization 권장
📂 관련 리소스
- Source Code: GitHub Repository
- Base Model: [Snowflake/snowflake-arctic-embed-m-v2.0](
