cd/sources/tokencontributions-auto-discoveredΒ· homeβ€Ί sourcesβ€Ί Tokencontributions (auto-discovered)
cat /sources/tokencontributions-auto-discovered.feed | wc -l β†’ 2

Tokencontributions (auto-discovered)

01:19
2026-09-14
tokencontributions.substack.com
large-language-models

The Biology of Claude's Tokenizer

A developer has reverse-engineered Anthropic's Claude tokenizer, finding it is not a standard byte-level BPE but instead uses a minimum-piece tokenization scheme similar to MinGram or PathPiece. The r…

20:55
2026-09-01
tokencontributions.substack.com
natural-language-processing

Small pre-tokenization bugs with a big multilingual price

A developer's analysis of pre-tokenization regexes shows that GPT-2's word-splitting pattern omitted Unicode's Mark category, a bug inherited by GPT-4, Llama 3, Qwen 3, and GLM-4/5, forcing BPE to tok…