kamoo-ai/tokenizer-benchmark
kamoo tokenizer-benchmark Dezelfde Nederlandse alinea door meerdere tokenizers. Minder tokens = meer context in hetzelfde venster en lagere kosten per antwoord. Reken het na. Dit is het meetlog achter de tokenizer-claims van kamoo.nl. Alles in deze repo is genoeg om de meting zelf te herhalen: de testalinea, het script en de uitkomsten. Meting (2026-07-06) Testalinea: de eerste alinea van het Nederlandse Wikipedia-artikel Nederland (CC-BY-SA, opgehaald 2026-07-06)… See the full description on the dataset page: https://huggingface.co/datasets/kamoo-ai/tokenizer-benchmark.
kamoo tokenizer-benchmark
Dezelfde Nederlandse alinea door meerdere tokenizers. Minder tokens = meer context in hetzelfde venster en lagere kosten per antwoord. Reken het na.
Dit is het meetlog achter de tokenizer-claims van kamoo.nl. Alles in deze repo is genoeg om de meting zelf te herhalen: de testalinea, het script en de uitkomsten.
Meting (2026-07-06)
Testalinea: de eerste alinea van het Nederlandse Wikipedia-artikel Nederland (CC-BY-SA, opgehaald 2026-07-06), 388 tekens. Bewust een publieke, door niemand van ons gekozen tekst.
Dezelfde Nederlandse alinea kost bij kamoo 17% minder tokens dan bij ChatGPT (o200k_base, de tokenizer van de GPT-4o/GPT-5-familie) en 36% minder dan bij OLMo 2 — met een vocabulaire dat 6× kleiner is. Dat is het effect van een tokenizer die puur op Nederlands is getraind.
Zelf narekenen
pip install tokenizers tiktoken huggingface_hub
python measure.pyHet script laadt de kamoo-tokenizer rechtstreeks uit de gepubliceerde model-repo (kamoo-ai/kamoo-one-135m), zodat de meting exact het uitgeleverde artefact test. Uitkomsten staan in resultaten.json.
Verantwoording
- Alleen tokenizers die scriptbaar en publiek beschikbaar zijn staan in de tabel. GPT-NL publiceert zijn tokenizer niet; in een eerdere handmeting via hun publieke tokenizer-demo (andere alinea, 629 tekens) speelde onze 32k-tokenizer gelijk met hun 128k-vocabulaire (110 om 109 tokens). Die meting is niet scriptbaar en staat daarom niet in de tabel hierboven.
- Eén alinea is een steekproef, geen corpus-studie. De verhouding is stabiel over normale Nederlandse prozateksten; probeer het met je eigen tekst.
Bestanden
alinea.txt— de testalinea (bevroren)measure.py— het meetscriptresultaten.json— machine-leesbare uitkomsten
kamoo · [kamoo.nl](https://kamoo.nl) · open tot op de laatste token
