Tokenization Bias: The Hidden Flaw Breaking Language Models

Papers: 2410.09303, 2503.20083
arXiv:2410.09303     arXiv:2503.20083
Tokenization Bias Pipeline Overview Tokenized Model Vocabulary: BPE / SentencePiece Outputs token probabilities Byte-level Model Vocabulary: Raw bytes (256) Outputs byte probabilities Input Prompt "def foo(aa" Mid-token boundary (FIM) Token Probabilities P('and')=0.4, P('aa')=0.0, ... Byte Probabilities P('a')=0.25, P('b')=0.1, ... Byte-Token Representation Lemma Marginalize token probs → byte probs Sum token probs by leading byte

References