CoolFace
Datasetpublic

Abzalbek89/kk-tokenizer-fertility-baseline

Kazakh Tokenizer Fertility Baseline Reproducible fertility benchmark of subword tokenizers on the Kazakh language. Companion artifact for the paper "Tokenizer Optimization for Kazakh Small Language Models" (in preparation, target: ACM TALLIP). Headline numbers Tokenizer Fertility 🥇 Best overall kk-bpe-32k 1.679 🚨 Worst GPT-4 (cl100k) 5.895 GPT-4 penalty GPT-4 (cl100k) is 3.51× worse than the best Kazakh-trained tokenizer → The custom Kazakh… See the full description on the dataset page: https://huggingface.co/datasets/Abzalbek89/kk-tokenizer-fertility-baseline.

sourceHugging Faceapache-2.0updated 3mo agoView on Hugging Face
0likes601downloads
50 commits on main
4746d8e3mo ago

Exp4 MorphScore (morpheme-boundary faithfulness)

Abzalbek89
c5b7f9b3mo ago

Exp4 MorphScore (morpheme-boundary faithfulness)

Abzalbek89
aaf7c243mo ago

Exp4 MorphScore (morpheme-boundary faithfulness)

Abzalbek89
1518cdc3mo ago

Exp4 MorphScore (morpheme-boundary faithfulness)

Abzalbek89
712db6b3mo ago

Exp4 MorphScore (morpheme-boundary faithfulness)

Abzalbek89
f639a6d5mo ago

KazNERD metrics unigram

Abzalbek89
b1767475mo ago

KazNERD metrics morphbpe

Abzalbek89
44732b65mo ago

KazNERD metrics morphbpe

Abzalbek89
e9fb5fe5mo ago

KazNERD metrics bpe

Abzalbek89
d0600ff5mo ago

KazNERD metrics bpe

Abzalbek89
55e869b5mo ago

KazNERD metrics unigram

Abzalbek89
a8300465mo ago

add PUSH_MODEL flag for multi-seed runs

Abzalbek89
14064df5mo ago

KazQAD metrics bpe

Abzalbek89
a7535055mo ago

KazQAD metrics unigram

Abzalbek89
ba665985mo ago

KazQAD metrics morphbpe

Abzalbek89
fd05c9c5mo ago

KazQAD metrics unigram

Abzalbek89
ec823dc5mo ago

KazQAD metrics morphbpe

Abzalbek89
fffb2585mo ago

KazQAD metrics bpe

Abzalbek89
57e692f5mo ago

upload finetune_kazqad.py

Abzalbek89
019e2145mo ago

KazNERD metrics unigram

Abzalbek89
a68b00b5mo ago

KazNERD metrics bpe

Abzalbek89
258e8045mo ago

KazNERD metrics morphbpe

Abzalbek89
5f111d75mo ago

upload finetune_kaznerd_v2 (loads from GitHub)

Abzalbek89
7aada365mo ago

upload finetune_kaznerd.py

Abzalbek89
31d95d45mo ago

Upload pretrain_metrics.json with huggingface_hub

Abzalbek89
453ec405mo ago

Upload pretrain_metrics.json with huggingface_hub

Abzalbek89
39a09085mo ago

Upload pretrain_metrics.json with huggingface_hub

Abzalbek89
6c48e015mo ago

Add bpe pretrain metrics

Abzalbek89
8dd1c645mo ago

v2 streamlined pretrain (200K docs, 25K steps, streaming tokenize)

Abzalbek89
ce65eb25mo ago

Add KazNERD finetune script

Abzalbek89
6bb2b625mo ago

Fix: num_proc=1 to avoid multiprocessing deadlock

Abzalbek89
874d8a65mo ago

Fix Trainer tokenizer arg for transformers 4.46+

Abzalbek89
eec5dbf5mo ago

Add Exp 3 pretraining script

Abzalbek89
856b8735mo ago

Update master README with full ranking and methodology

Abzalbek89
ab529fc5mo ago

Add v3 morphology-aware results

Abzalbek89
a6fde5e5mo ago

Fix last len(generator) bug at line 389

Abzalbek89
9dfa2c95mo ago

Speed up segmentation: dict lookup instead of per-call viterbi

Abzalbek89
787d69b5mo ago

Cache trained Morfessor model

Abzalbek89
fea11c15mo ago

Update master README with full ranking and methodology

Abzalbek89
998b1005mo ago

Fix len(generator) bug + cache morfessor.bin on HF

Abzalbek89
1dfa7885mo ago

Add experiment 2 (morph-aware)

Abzalbek89
047b3d95mo ago

Fix: re-measure SentencePiece tokenizers with SentencePieceProcessor directly

Abzalbek89
f4264b35mo ago

Add fix script for SP tokenizers

Abzalbek89
18b151d5mo ago

Upload status.json with huggingface_hub

Abzalbek89
603ad375mo ago

Upload folder using huggingface_hub

Abzalbek89
6a9f2865mo ago

Upload status.json with huggingface_hub

Abzalbek89
c7481895mo ago

Upload status.json with huggingface_hub

Abzalbek89
2d4db715mo ago

Upload status.json with huggingface_hub

Abzalbek89
cd1f4b55mo ago

Upload status.json with huggingface_hub

Abzalbek89
4329c485mo ago

Upload status.json with huggingface_hub

Abzalbek89