CoolFace
Datasetpublic

KitaSan/mecrab-jawiki-word2vec

MeCrab Japanese Word2Vec Vectors High-quality Japanese word embeddings trained on Wikipedia using MeCrab morphological analyzer. πŸ“Š Dataset Summary This dataset contains pre-trained Japanese word embeddings optimized for use with MeCrab, a high-performance morphological analyzer. Key Features: βœ… Trained on Japanese Wikipedia βœ… Zero-copy binary format (MCV1) for fast loading βœ… Compatible with MeCrab Python API βœ… 300-dimensional vectors βœ… ~100,000 vocabulary size… See the full description on the dataset page: https://huggingface.co/datasets/KitaSan/mecrab-jawiki-word2vec.

sourceHugging Faceapache-2.0updated 9mo agoView on Hugging Face
1likes39downloads
Dataset Card

MeCrab Japanese Word2Vec Vectors

High-quality Japanese word embeddings trained on Wikipedia using MeCrab morphological analyzer.

πŸ“Š Dataset Summary

This dataset contains pre-trained Japanese word embeddings optimized for use with MeCrab, a high-performance morphological analyzer.

Key Features:

  • β€”βœ… Trained on Japanese Wikipedia
  • β€”βœ… Zero-copy binary format (MCV1) for fast loading
  • β€”βœ… Compatible with MeCrab Python API
  • β€”βœ… 300-dimensional vectors
  • β€”βœ… ~100,000 vocabulary size

πŸ“ Dataset Structure

mecrab-jawiki-word2vec/
β”œβ”€β”€ vectors.bin      # Word embeddings (MCV1 format)
β”œβ”€β”€ vocab.txt        # Vocabulary mapping
└── metadata.json    # Training configuration

πŸš€ Quick Start

Installation

bash
pip install mecrab

Download Vectors

bash
wget https://huggingface.co/datasets/KitaSan/mecrab-jawiki-word2vec/resolve/main/vectors.bin

Usage (Python)

python
import mecrab

# Load analyzer with vectors
m = mecrab.MeCrab(vector_path="vectors.bin")

# Get word embeddings
morphemes = m.parse_to_dict("東京に葌く")
for morph in morphemes:
    if 'embedding' in morph:
        print(f"{morph['surface']}: {morph['embedding'][:5]}")
# => 東京: [0.123, -0.456, 0.789, -0.234, 0.567]

# Compute cosine similarity
sim = m.similarity("東京", "京都")
print(f"Similarity: {sim:.3f}")  # => 0.856

Usage (Command Line)

bash
# With kizame CLI
kizame parse --vectors vectors.bin --output-format json input.txt

πŸ“ˆ Training Details

  • β€”Corpus: Japanese Wikipedia (2026-01 dump)
  • β€”Tokenizer: MeCrab with IPADIC dictionary
  • β€”Algorithm: Word2Vec Skip-gram with negative sampling
  • β€”Vector Dimension: 300
  • β€”Window Size: 5
  • β€”Negative Samples: 5
  • β€”Min Count: 5
  • β€”Epochs: 5
  • β€”Learning Rate: 0.025

πŸ“Š Evaluation

Word Similarity Benchmarks

Word PairSimilarity
東京 - 京都0.856
犬 - 猫0.782
ι£ŸγΉγ‚‹ - ι£²γ‚€0.671
ζ—₯本 - δΈ­ε›½0.834

Word Analogy Examples

python
# King - Man + Woman = Queen (Japanese equivalent)
# ηŽ‹ζ§˜ - η”·ζ€§ + ε₯³ζ€§ β‰ˆ ε₯³ηŽ‹

πŸ”§ Technical Details

MCV1 Binary Format

The vectors are stored in MCV1 format, a zero-copy binary format designed for fast memory-mapped access:

Header (32 bytes):
  - Magic: 0x4D564331 ("MVC1")
  - Vocab Size: uint32
  - Vector Dim: uint32
  - Data Type: uint32 (0=f32, 1=f16, 2=i8)

Data:
  - Vector 0: [dim * 4 bytes]
  - Vector 1: [dim * 4 bytes]
  - ...

Zero-Copy Loading

python
# No copying - directly memory-mapped
m = mecrab.MeCrab(vector_path="vectors.bin")  # < 1ms loading time

πŸ“š Citation

If you use these vectors in your research, please cite:

bibtex
@misc{mecrab-jawiki-word2vec,
  author = {COOLJAPAN OU (Team KitaSan)},
  title = {MeCrab Japanese Word2Vec Vectors},
  year = {2026},
  publisher = {HuggingFace},
  howpublished = {\url{https://huggingface.co/datasets/YOUR_USERNAME/mecrab-jawiki-word2vec}}
}

πŸ“œ License

Apache License 2.0

πŸ™ Acknowledgements

🀝 Contributing

Found an issue or want to contribute improvements? Please open an issue on the MeCrab repository.

πŸ”— Links

  • β€”MeCrab GitHub: https://github.com/cool-japan/mecrab
  • β€”Documentation: https://github.com/cool-japan/mecrab/blob/master/README.md
  • β€”Examples: https://github.com/cool-japan/mecrab/tree/master/python/examples