以下依「研究問題 → 方法 → 結果 → 研究意義 → 限制」整理。數字均來自論文摘要、
project page 或正式 proceedings;不同 benchmark 與模型設定不可直接橫向比較。
NeurIPS 2024共同第一作者
Data Mixture Inference: What do BPE Tokenizers Reveal about their Training Data?
01
問題
開放權重模型通常仍不公開 pretraining corpus 的
語言、程式碼、書籍或資料來源比例;能否只從 tokenizer 反推全域資料組成?
方法
BPE 的早期 merge 對應當時最常見的 byte pair。
給定 tokenizer merge list 與各候選類別的樣本,建立線性規劃,估計各類別在 tokenizer
訓練資料中的相對比例。
- 在已知混合比例的自然語言、程式語言與資料來源上做 controlled recovery。
- 再套用到公開 tokenizer,推測多語、code 與 books 的 mixture。
意義
把 tokenizer 從 preprocessing artifact
重新定義成 可被攻擊與稽核的資料指紋,開啟 corpus transparency 與
privacy leakage 的交叉研究。
限制
直接推回的是 tokenizer-training mixture。
只有在 tokenizer corpus 能代表 LM pretraining corpus 時,才可間接推論後者;類別樣本、
tokenizer algorithm 與 identifiability 都會影響估計。
COLM 2025第一作者
Top 0.2%
SuperBPE: Space Travel for Language Models
02
問題
主流 BPE 幾乎都先用 whitespace pretokenization,
把 token 限制在 word boundary 內。但多詞片語、中文與跨語言差異顯示:
空白不一定是語意邊界。
方法
兩階段 curriculum:
先保留空白限制學 subwords,再取消限制,繼續 merge 出能跨越空白的
superwords。例如把常見多詞表達視為一個單元。
≤33%同 vocab 下更少 tokens
+4.0%30 tasks 平均絕對提升
−27%inference compute
實驗控制
從頭訓練 8B Transformer,固定 model size、
vocabulary size 與 training compute,只改 tokenizer vocabulary-learning algorithm;
MMLU 報告 +8.2 個百分點。
意義
證明 tokenizer design 在不改 Transformer
架構的情況下,也能同時改善表示效率、下游表現與部署成本。
限制
更長 token 可能提高 embedding/softmax 成本、
產生稀疏或 domain-specific superword;跨語言、code 與不同 compute scale
仍需更完整的 tokenizer selection 原則。
NeurIPS 2025 Spotlight
Broken Tokens? Your Language Model Can Secretly Handle Non-Canonical Tokenizations
03
問題
同一段文字其實可由許多 token sequence 表示,
但 tokenizer 永遠回傳唯一的 canonical segmentation。LM 是否只能理解訓練時看過的那一種?
方法
在 20 個 benchmark 中,以 random、
character-level 等 non-canonical tokenizations 重編碼同一文字,再比較 instruction-tuned
與 base models。
93.4%random segmentation 保留表現
90.8%character segmentation 保留表現
>33%大數算術提升
重要發現
character segmentation 對字串操作與 code
understanding 可提升約 15%;右對齊數字 grouping 對 large-number arithmetic 提升超過 33%。
robustness 主要在 instruction tuning 階段出現。
意義
canonical tokenizer 不是不可動的模型契約;
segmentation 可以成為 task-aware inference intervention。
限制
重編碼會改變序列長度、latency 與 KV-cache 使用;
並非所有任務都受益,且不同模型對 non-canonical distance 的容忍度不同。
ICML 2026
Sampling from Your Language Model One Byte at a Time
04
問題
token boundary 會扭曲 prompt continuation;
而不同 tokenizer 的 vocabulary 不同,使 ensemble、proxy-tuning 與模型組合難以直接進行。
方法
提出 inference-time algorithm,把任何
autoregressive BPE LM 轉換成 character/byte-level LM,並在文字層級
保持原模型的生成分布不變。
- 精確處理 prompt boundary problem。
- 把不同 tokenizer 的模型投影到共同 byte vocabulary。
- 因此可做 cross-tokenizer ensemble 與 proxy-tuning。
意義
byte 不只是一種替代 tokenizer,而可以成為
tokenizer-agnostic interoperability layer:保留既有模型,
但移除外部 API 對其 tokenizer vocabulary 的依賴。
限制
exact marginalization/conditional sampling
可能增加每輸出 byte 的運算與工程複雜度;實際部署需看 cache、batching、speculation
與高吞吐 serving 的整合。
2026 Preprint
Are You Going to Finish That? A Practical Study of the Partial Token Problem
05
問題
使用者輸入的是文字,但模型條件化在 token sequence。
若 prompt 結尾恰好位於「模型期待的下一個 token」內部,next-token distribution
會被嚴重扭曲。
情境
不使用空白的語言、複合詞豐富的語言與 code,
都會自然出現 word/syntax boundary 與 token boundary 不對齊;中文研究中,
最多約 25% 的 word boundaries 不與 token boundary 對齊。
≈25%中文邊界可能錯位
≈10³×正確 continuation 機率下降
不隨規模消失大模型有時更嚴重
意義
把原本常被視為「不要在空白後結束 prompt」的
小技巧,提升為多語與 code serving 的系統性 correctness 問題,並評估 exact
inference-time solutions。
限制
嚴重度依 tokenizer、prompt distribution 與 API
行為而異;production provider 仍需要低延遲檢測、fallback 與可觀測性。
2026 Preprint
Compute Optimal Tokenization
06
問題
既有 scaling laws 通常把「token 數」當作資料量,
但 token 的 bytes-per-token 會隨 tokenizer 改變;因此 token 並不是穩定的跨模型計量單位。
方法
訓練 988 個 BLT/latent-tokenized models,
規模從 50M 到 7B,系統性控制 compression rate,並檢查不同 compute budget、
tokenization family 與語言。
- compute-optimal parameter count 與資料的 bytes 成比例,而非 tokens。
- 最佳 compression rate 與常見 BPE 不同。
- compute 增加時,最佳 compression rate 反而下降。
意義
tokenization 不應在模型 scaling 前被固定;
model size、資料 bytes、compression rate 與 compute budget 應聯合設計。
限制
BLT 與 subword 的實作成本不同;理論上的
compute optimum 不一定等於特定 GPU、serving stack、context limit 與產品 latency
下的總成本 optimum。