CoolFace
Datasetpublic

kamoo-ai/tokenizer-benchmark

kamoo tokenizer-benchmark Dezelfde Nederlandse alinea door meerdere tokenizers. Minder tokens = meer context in hetzelfde venster en lagere kosten per antwoord. Reken het na. Dit is het meetlog achter de tokenizer-claims van kamoo.nl. Alles in deze repo is genoeg om de meting zelf te herhalen: de testalinea, het script en de uitkomsten. Meting (2026-07-06) Testalinea: de eerste alinea van het Nederlandse Wikipedia-artikel Nederland (CC-BY-SA, opgehaald 2026-07-06)… See the full description on the dataset page: https://huggingface.co/datasets/kamoo-ai/tokenizer-benchmark.

sourceHugging Facecc-by-sa-4.0updated 3mo agoView on Hugging Face
0likes17downloads
Dataset Card

kamoo tokenizer-benchmark

Dezelfde Nederlandse alinea door meerdere tokenizers. Minder tokens = meer context in hetzelfde venster en lagere kosten per antwoord. Reken het na.

Dit is het meetlog achter de tokenizer-claims van kamoo.nl. Alles in deze repo is genoeg om de meting zelf te herhalen: de testalinea, het script en de uitkomsten.

Meting (2026-07-06)

Testalinea: de eerste alinea van het Nederlandse Wikipedia-artikel Nederland (CC-BY-SA, opgehaald 2026-07-06), 388 tekens. Bewust een publieke, door niemand van ons gekozen tekst.

tokenizervocabulairetokenstekens per token
kamoo-one (kamoo-bpe-32k)32.768735,32
ChatGPT (o200k_base)200.019884,41
OLMo 2100.2781153,37

Dezelfde Nederlandse alinea kost bij kamoo 17% minder tokens dan bij ChatGPT (o200k_base, de tokenizer van de GPT-4o/GPT-5-familie) en 36% minder dan bij OLMo 2 — met een vocabulaire dat 6× kleiner is. Dat is het effect van een tokenizer die puur op Nederlands is getraind.

Zelf narekenen

bash
pip install tokenizers tiktoken huggingface_hub
python measure.py

Het script laadt de kamoo-tokenizer rechtstreeks uit de gepubliceerde model-repo (kamoo-ai/kamoo-one-135m), zodat de meting exact het uitgeleverde artefact test. Uitkomsten staan in resultaten.json.

Verantwoording

  • —Alleen tokenizers die scriptbaar en publiek beschikbaar zijn staan in de tabel. GPT-NL publiceert zijn tokenizer niet; in een eerdere handmeting via hun publieke tokenizer-demo (andere alinea, 629 tekens) speelde onze 32k-tokenizer gelijk met hun 128k-vocabulaire (110 om 109 tokens). Die meting is niet scriptbaar en staat daarom niet in de tabel hierboven.
  • —Eén alinea is een steekproef, geen corpus-studie. De verhouding is stabiel over normale Nederlandse prozateksten; probeer het met je eigen tekst.

Bestanden

  • —alinea.txt — de testalinea (bevroren)
  • —measure.py — het meetscript
  • —resultaten.json — machine-leesbare uitkomsten

kamoo · [kamoo.nl](https://kamoo.nl) · open tot op de laatste token