KitaSan/mecrab-jawiki-word2vec
MeCrab Japanese Word2Vec Vectors High-quality Japanese word embeddings trained on Wikipedia using MeCrab morphological analyzer. π Dataset Summary This dataset contains pre-trained Japanese word embeddings optimized for use with MeCrab, a high-performance morphological analyzer. Key Features: β Trained on Japanese Wikipedia β Zero-copy binary format (MCV1) for fast loading β Compatible with MeCrab Python API β 300-dimensional vectors β ~100,000 vocabulary sizeβ¦ See the full description on the dataset page: https://huggingface.co/datasets/KitaSan/mecrab-jawiki-word2vec.
MeCrab Japanese Word2Vec Vectors
High-quality Japanese word embeddings trained on Wikipedia using MeCrab morphological analyzer.
π Dataset Summary
This dataset contains pre-trained Japanese word embeddings optimized for use with MeCrab, a high-performance morphological analyzer.
Key Features:
- β Trained on Japanese Wikipedia
- β Zero-copy binary format (MCV1) for fast loading
- β Compatible with MeCrab Python API
- β 300-dimensional vectors
- β ~100,000 vocabulary size
π Dataset Structure
mecrab-jawiki-word2vec/
βββ vectors.bin # Word embeddings (MCV1 format)
βββ vocab.txt # Vocabulary mapping
βββ metadata.json # Training configurationπ Quick Start
Installation
pip install mecrabDownload Vectors
wget https://huggingface.co/datasets/KitaSan/mecrab-jawiki-word2vec/resolve/main/vectors.binUsage (Python)
import mecrab
# Load analyzer with vectors
m = mecrab.MeCrab(vector_path="vectors.bin")
# Get word embeddings
morphemes = m.parse_to_dict("ζ±δΊ¬γ«θ‘γ")
for morph in morphemes:
if 'embedding' in morph:
print(f"{morph['surface']}: {morph['embedding'][:5]}")
# => ζ±δΊ¬: [0.123, -0.456, 0.789, -0.234, 0.567]
# Compute cosine similarity
sim = m.similarity("ζ±δΊ¬", "δΊ¬ι½")
print(f"Similarity: {sim:.3f}") # => 0.856Usage (Command Line)
# With kizame CLI
kizame parse --vectors vectors.bin --output-format json input.txtπ Training Details
- Corpus: Japanese Wikipedia (2026-01 dump)
- Tokenizer: MeCrab with IPADIC dictionary
- Algorithm: Word2Vec Skip-gram with negative sampling
- Vector Dimension: 300
- Window Size: 5
- Negative Samples: 5
- Min Count: 5
- Epochs: 5
- Learning Rate: 0.025
π Evaluation
Word Similarity Benchmarks
Word Analogy Examples
# King - Man + Woman = Queen (Japanese equivalent)
# ηζ§ - η·ζ§ + ε₯³ζ§ β ε₯³ηπ§ Technical Details
MCV1 Binary Format
The vectors are stored in MCV1 format, a zero-copy binary format designed for fast memory-mapped access:
Header (32 bytes):
- Magic: 0x4D564331 ("MVC1")
- Vocab Size: uint32
- Vector Dim: uint32
- Data Type: uint32 (0=f32, 1=f16, 2=i8)
Data:
- Vector 0: [dim * 4 bytes]
- Vector 1: [dim * 4 bytes]
- ...Zero-Copy Loading
# No copying - directly memory-mapped
m = mecrab.MeCrab(vector_path="vectors.bin") # < 1ms loading timeπ Citation
If you use these vectors in your research, please cite:
@misc{mecrab-jawiki-word2vec,
author = {COOLJAPAN OU (Team KitaSan)},
title = {MeCrab Japanese Word2Vec Vectors},
year = {2026},
publisher = {HuggingFace},
howpublished = {\url{https://huggingface.co/datasets/YOUR_USERNAME/mecrab-jawiki-word2vec}}
}π License
Apache License 2.0
π Acknowledgements
- MeCrab - Morphological analyzer
- Japanese Wikipedia - Training corpus
- Word2Vec - Embedding algorithm
π€ Contributing
Found an issue or want to contribute improvements? Please open an issue on the MeCrab repository.
π Links
- MeCrab GitHub: https://github.com/cool-japan/mecrab
- Documentation: https://github.com/cool-japan/mecrab/blob/master/README.md
- Examples: https://github.com/cool-japan/mecrab/tree/master/python/examples
