Research Brief · Tokenization for Language Models

Alisa Liu 的 Tokenizer 研究主線

從 tokenizer 洩漏訓練資料、跨越空白的 SuperBPE、非標準切詞的推理介入, 到 byte-level 介面、partial-token failure 與 compute-optimal scaling laws。

繁體中文系統整理 6 篇核心論文 6 組開源資源 資料查核:2026-07-16

一、是否找到她的 job talk deck 或 video?

找到高度相關、可重建 job talk 主線的公開材料

最接近完整 job talk 的材料,是 Alisa Liu 與 Jonathan Hayase 於 Microsoft Translator 在 2025-04-16 發表的 82 頁 SuperBPE 投影片。 合作者 Sewoong Oh 的論文頁明確標示這份 slides 是由 Alisa 與 Jon 在 Microsoft 發表。

開啟 Microsoft SuperBPE deck Alisa 的 SlidesLive 頁面

?

但未找到明確標註為「她求職時使用的 job talk」

公開搜尋中,沒有發現標題或說明直接寫明 industry job talk、 且能確認就是她在 2025–2026 求職流程中使用的版本。因此不應把 Microsoft deck 直接斷言為求職 deck。

查無精確版本 有可信近似材料
最合理的推論:她在求職文章中說,job talk 主要講一篇第一作者工作, 再短暫串連數篇第二作者與進行中的研究。依她的公開 tokenization publication list, SuperBPE 是最可能的主論文;Microsoft 的 82 頁 deck 因此很可能是 job talk 的「內容近似版本」或重要前身。但這是高可信推論,不是她本人明確證實。

公開錄影:Data Mixture Inference

NeurIPS 2024 的 SlidesLive 頁面,主題是利用 BPE merge order 推回 tokenizer 訓練資料的語言、程式碼與資料來源比例。

觀看 SlidesLive

公開錄影:Future of Tokenization Panel

ICML 2025 TokShop panel,Alisa 與其他研究者討論 BPE tooling lock-in、 superword、byte/character models、dynamic hierarchy、跨語言與 scaling laws。

觀看 panel

其他可用影片入口

搜尋結果也找到 Cohere For AI 的 Alisa Liu community talk,以及 SuperBPE 的公開影片。它們適合搭配投影片理解口頭敘事。

Cohere talk · SuperBPE video

二、她的 tokenizer 研究究竟在研究什麼?

一句話總結:Tokenizer 不是中性的文字前處理工具,而是 控制資料可見性、模型表示、計算效率、推理行為與模型互通性的一層隱藏介面; 因此它既可以被稽核、重新設計,也可以在 inference time 被動態介入。
1
稽核Data Mixture
2
重新設計SuperBPE
3
鬆綁 canonicalBroken Tokens
4
統一介面Byte Sampler
5
修復邊界Partial Token
6
納入 scalingCompute Optimal

Tokenizer 作為資料指紋

詞彙表與 BPE merge 的順序不是無害 metadata;它們記錄了訓練語料中哪些 byte pair 常見,因而可能洩漏 corpus mixture。

Tokenizer 作為模型架構選擇

token 的資訊粒度會影響序列長度、embedding vocabulary、每一步預測難度、 訓練 scaling 與 inference cost,而不只是「切字方式」。

Tokenizer 作為推理控制面

模型不一定被 canonical tokenization 綁死。改變 segmentation、改用 byte-level sampling,可能修復 prompt boundary、提升特定任務,並讓不同 tokenizer 的模型互相組合。

三、六篇核心 tokenizer 論文

以下依「研究問題 → 方法 → 結果 → 研究意義 → 限制」整理。數字均來自論文摘要、 project page 或正式 proceedings;不同 benchmark 與模型設定不可直接橫向比較。

NeurIPS 2024共同第一作者

Data Mixture Inference: What do BPE Tokenizers Reveal about their Training Data?

01

問題
開放權重模型通常仍不公開 pretraining corpus 的 語言、程式碼、書籍或資料來源比例;能否只從 tokenizer 反推全域資料組成?

方法
BPE 的早期 merge 對應當時最常見的 byte pair。 給定 tokenizer merge list 與各候選類別的樣本,建立線性規劃,估計各類別在 tokenizer 訓練資料中的相對比例。

  • 在已知混合比例的自然語言、程式語言與資料來源上做 controlled recovery。
  • 再套用到公開 tokenizer,推測多語、code 與 books 的 mixture。

意義
把 tokenizer 從 preprocessing artifact 重新定義成 可被攻擊與稽核的資料指紋,開啟 corpus transparency 與 privacy leakage 的交叉研究。

限制
直接推回的是 tokenizer-training mixture。 只有在 tokenizer corpus 能代表 LM pretraining corpus 時,才可間接推論後者;類別樣本、 tokenizer algorithm 與 identifiability 都會影響估計。

COLM 2025第一作者 Top 0.2%

SuperBPE: Space Travel for Language Models

02

問題
主流 BPE 幾乎都先用 whitespace pretokenization, 把 token 限制在 word boundary 內。但多詞片語、中文與跨語言差異顯示: 空白不一定是語意邊界。

方法
兩階段 curriculum: 先保留空白限制學 subwords,再取消限制,繼續 merge 出能跨越空白的 superwords。例如把常見多詞表達視為一個單元。

≤33%同 vocab 下更少 tokens
+4.0%30 tasks 平均絕對提升
−27%inference compute

實驗控制
從頭訓練 8B Transformer,固定 model size、 vocabulary size 與 training compute,只改 tokenizer vocabulary-learning algorithm; MMLU 報告 +8.2 個百分點。

意義
證明 tokenizer design 在不改 Transformer 架構的情況下,也能同時改善表示效率、下游表現與部署成本。

限制
更長 token 可能提高 embedding/softmax 成本、 產生稀疏或 domain-specific superword;跨語言、code 與不同 compute scale 仍需更完整的 tokenizer selection 原則。

NeurIPS 2025 Spotlight

Broken Tokens? Your Language Model Can Secretly Handle Non-Canonical Tokenizations

03

問題
同一段文字其實可由許多 token sequence 表示, 但 tokenizer 永遠回傳唯一的 canonical segmentation。LM 是否只能理解訓練時看過的那一種?

方法
在 20 個 benchmark 中,以 random、 character-level 等 non-canonical tokenizations 重編碼同一文字,再比較 instruction-tuned 與 base models。

93.4%random segmentation 保留表現
90.8%character segmentation 保留表現
>33%大數算術提升

重要發現
character segmentation 對字串操作與 code understanding 可提升約 15%;右對齊數字 grouping 對 large-number arithmetic 提升超過 33%。 robustness 主要在 instruction tuning 階段出現。

意義
canonical tokenizer 不是不可動的模型契約; segmentation 可以成為 task-aware inference intervention。

限制
重編碼會改變序列長度、latency 與 KV-cache 使用; 並非所有任務都受益,且不同模型對 non-canonical distance 的容忍度不同。

ICML 2026

Sampling from Your Language Model One Byte at a Time

04

問題
token boundary 會扭曲 prompt continuation; 而不同 tokenizer 的 vocabulary 不同,使 ensemble、proxy-tuning 與模型組合難以直接進行。

方法
提出 inference-time algorithm,把任何 autoregressive BPE LM 轉換成 character/byte-level LM,並在文字層級 保持原模型的生成分布不變

  • 精確處理 prompt boundary problem。
  • 把不同 tokenizer 的模型投影到共同 byte vocabulary。
  • 因此可做 cross-tokenizer ensemble 與 proxy-tuning。

意義
byte 不只是一種替代 tokenizer,而可以成為 tokenizer-agnostic interoperability layer:保留既有模型, 但移除外部 API 對其 tokenizer vocabulary 的依賴。

限制
exact marginalization/conditional sampling 可能增加每輸出 byte 的運算與工程複雜度;實際部署需看 cache、batching、speculation 與高吞吐 serving 的整合。

2026 Preprint

Are You Going to Finish That? A Practical Study of the Partial Token Problem

05

問題
使用者輸入的是文字,但模型條件化在 token sequence。 若 prompt 結尾恰好位於「模型期待的下一個 token」內部,next-token distribution 會被嚴重扭曲。

情境
不使用空白的語言、複合詞豐富的語言與 code, 都會自然出現 word/syntax boundary 與 token boundary 不對齊;中文研究中, 最多約 25% 的 word boundaries 不與 token boundary 對齊。

≈25%中文邊界可能錯位
≈10³×正確 continuation 機率下降
不隨規模消失大模型有時更嚴重

意義
把原本常被視為「不要在空白後結束 prompt」的 小技巧,提升為多語與 code serving 的系統性 correctness 問題,並評估 exact inference-time solutions。

限制
嚴重度依 tokenizer、prompt distribution 與 API 行為而異;production provider 仍需要低延遲檢測、fallback 與可觀測性。

2026 Preprint

Compute Optimal Tokenization

06

問題
既有 scaling laws 通常把「token 數」當作資料量, 但 token 的 bytes-per-token 會隨 tokenizer 改變;因此 token 並不是穩定的跨模型計量單位。

方法
訓練 988 個 BLT/latent-tokenized models, 規模從 50M 到 7B,系統性控制 compression rate,並檢查不同 compute budget、 tokenization family 與語言。

  • compute-optimal parameter count 與資料的 bytes 成比例,而非 tokens。
  • 最佳 compression rate 與常見 BPE 不同。
  • compute 增加時,最佳 compression rate 反而下降。

意義
tokenization 不應在模型 scaling 前被固定; model size、資料 bytes、compression rate 與 compute budget 應聯合設計。

限制
BLT 與 subword 的實作成本不同;理論上的 compute optimum 不一定等於特定 GPU、serving stack、context limit 與產品 latency 下的總成本 optimum。

四、系統性比較:六篇工作各自改變哪一層?

工作主要層次核心 intervention主要價值主要風險/未解問題
Data Mixture Inference Tokenizer training / auditing 讀取 BPE merge order,以 LP 回推 mixture 透明度、forensics、資料治理 representativeness、identifiability、privacy leakage
SuperBPE Vocabulary learning / pretraining subword → superword curriculum 壓縮、accuracy、inference cost 跨 domain/語言泛化、vocab cost、tooling
Broken Tokens Inference input representation non-canonical / task-aware segmentation robustness 與特定任務提升 選擇策略、sequence inflation、模型差異
Byte Sampler Inference distribution / interoperability exact byte-level sampling interface 邊界正確性、cross-tokenizer composition serving overhead、cache 與 batching
Partial Token Prompt/API correctness 偵測 boundary mismatch,使用 backoff/exact mitigation 多語、code 與 autocomplete reliability 低延遲 provider integration、監控指標
Compute Optimal Scaling laws / system design 聯合搜尋 compression × model × bytes × compute 更正確的 compute allocation 硬體與 end-to-end cost model、跨 modality
整體脈絡非常一致:前兩篇回答「tokenizer 洩漏什麼、應該怎麼學」; 中間三篇回答「已訓練模型是否能擺脫固定 segmentation、如何在推理時修復與互通」; 最後一篇把 token granularity 提升到 scaling-law 與 compute allocation 的層次。

五、相關開源專案與可重現資源

git

alisawuffles/tokenizer-attack

Data Mixture Inference 的官方實作。適合研究 BPE merge statistics、建立候選資料類別樣本, 並重現 mixture recovery / tokenizer auditing 流程。

GitHub
rs

alisawuffles/tokenizers-superbpe

基於 Hugging Face tokenizers v0.20.1 的 patched Rust fork, 是 SuperBPE 能跳過 whitespace pretokenization、續訓 merges 的底層支援。

GitHub
py

PythonNut/superbpe

SuperBPE 官方 release:兩階段 tokenizer training scripts、analysis notebooks、 pretraining configs、tokenizer JSON 與 128K English tokenizer。README 明確將訓練拆成 「先 subword、再取消空白限制學 superword」。

GitHub · Project

Brianzhengca/Tokenizer-Robustness

Broken Tokens 的官方程式碼,用於產生 non-canonical tokenizations、 評估 random/character segmentations,以及測試字串、程式碼和數字任務。

GitHub
0x

SewoongLab/byte-sampler

把現有 BPE LM 包裝成 byte-level sampler,支援 prompt-boundary 修復, 並示範跨 tokenizer ensemble 與 proxy-tuning。

GitHub
Σ

facebookresearch/compute-optimal-tokenization

Compute Optimal Tokenization 的 raw results、scaling-law fitting 與 visualization code; 適合研究 bytes/token、模型規模和 compute budget 的聯合關係。

GitHub · Project

六、未來最有潛力的研究方向

以下是根據上述論文、開源專案與 ICML Tokenization panel 所做的研究推演, 不是 Alisa Liu 已公開宣布的個人 research agenda

1. Tokenizer-aware serving layer

近期可落地

在 serving gateway 自動偵測 partial-token endings、CJK/code boundary risk, 並依成本選擇 canonical decoding、token-aligned backoff 或 exact byte sampler。

研究問題:如何在不犧牲 batch throughput 的情況下做 exact correction? 哪些 prompt 需要修復?如何定義 production metrics,例如 boundary-risk rate、 probability recovery 與 latency overhead?

2. Adaptive / task-aware tokenization

高潛力

結合 SuperBPE 與 Broken Tokens:不再為整個模型固定唯一 segmentation, 而是按 span、語言、任務或 uncertainty 選擇 superword、subword、character 或 byte。

研究問題:selection policy 要由規則、small router 還是 LM 自己學? 動態長度如何配合 positional encoding、KV cache 與 speculative decoding? 可否用 reward 同時最佳化 accuracy、tokens/sec 與成本?

3. Cross-tokenizer model composition

基礎模型生態

以 byte-level distribution 作共同介面,進一步發展跨 tokenizer ensemble、 proxy-tuning、Mixture-of-Experts routing、verifier aggregation 與 model merging。

研究問題:如何減少 byte marginalization 成本? 不同 tokenizer 模型的 probability calibration 是否相容? 能否把各模型在特定語言或 domain 的 tokenizer 優勢轉化為可路由的專長?

4. Joint tokenizer–model–hardware scaling laws

高影響力

從「參數量 × token 數」升級為「參數 × 資料 bytes × compression × vocab × context × hardware」, 並加入 training 與 serving 的總生命週期成本。

研究問題:optimal compression 為何隨 compute 改變? embedding/softmax、attention、memory bandwidth 與 sequence length 如何共同決定 optimum? 針對 GPU、TPU、edge NPU 是否有不同 tokenizer frontier?

5. Multilingual fairness 與 tokenizer audit cards

社會與產品價值

建立標準化 tokenizer card:公開每種語言的 bytes/token、word-boundary mismatch、 canonical robustness、token cost、training-mixture inference uncertainty 與 code coverage。

研究問題:token-based billing 與 context budget 是否對某些語言不公平? 如何避免 tokenizer 洩漏資料組成,同時保有透明度?對台語、低資源語言與非空白語言, morphology、phonology 和 byte-level 方法應如何整合?

6. 從 static vocabulary 走向 learned hierarchy

長期方向

在固定 BPE 與純 byte models 之間,學習可變長度、內容依賴的 latent chunks: 底層保留 byte correctness,上層動態形成 reusable semantic/computational units。

研究問題:如何避免 sequence variability 破壞高效 kernel? hierarchical units 是否具可解釋性?能否同時處理文字、程式碼、數學與 multimodal streams? 何種 intrinsic evaluation 能預測 downstream 與 system-level gain?

七、對 tokenizer 研究者最重要的啟示

不要只用 fertility 評估 tokenizer

平均 token 數很重要,但還需評估 per-token difficulty、boundary alignment、 downstream accuracy、推理成本、跨語言公平性與 interoperability。

把 byte 當成共同「真實單位」

token 數會受 tokenizer 定義影響;資料 scaling、文字分布等價性與跨模型組合, 以 byte/character 層級推理通常更穩健。

訓練完成後仍可研究 tokenization

Broken Tokens 與 Byte Sampler 顯示,tokenization 不是 pretraining 前一次性決策; inference-time segmentation 和 distribution conversion 本身就是豐富的演算法空間。

一個可用於你自己 research talk 的敘事模板
  1. 破除假設:大家把 tokenizer 當固定 preprocessing,但它其實控制模型看到的世界。
  2. 證明它留下痕跡:Data Mixture Inference 顯示 tokenizer 洩漏 corpus composition。
  3. 證明它可以更好:SuperBPE 僅改 vocabulary learning 就改善效率與能力。
  4. 證明模型沒被綁死:Broken Tokens 顯示 post-trained LM 能理解多種 segmentation。
  5. 建立統一介面:Byte Sampler 移除 prompt boundary 與 vocabulary mismatch。
  6. 連到真實產品問題:Partial Token 在中文與 code 中造成嚴重 probability distortion。
  7. 提升到 scaling law:Compute Optimal 說明 token granularity 應與 model/data/compute 聯合設計。

八、參考資料

  1. BlogAlisa Liu, “Notes on the Industry Job Search,” 2026-06-20. alisawuffles.github.io/blog/job-search/
  2. ProfileAlisa Liu personal website and publication list. alisawuffles.github.io
  3. SlidesAlisa Liu & Jonathan Hayase, “SuperBPE: Space Travel for Language Models,” Microsoft Translator, 2025-04-16, 82 slides. PDF
  4. IndexSewoong Oh publication page, including the note “presented by Alisa and Jon at Microsoft.” papers.html
  5. VideoAlisa Liu speaker page, SlidesLive. Speaker page
  6. Video“Data Mixture Inference: What do BPE Tokenizers Reveal about their Training Data?” NeurIPS 2024. SlidesLive
  7. Panel“Panel: Future of Tokenization,” ICML 2025 Tokenization Workshop. SlidesLive
  8. PaperHayase et al., “Data Mixture Inference: What do BPE Tokenizers Reveal about their Training Data?” NeurIPS 2024. arXiv · Code
  9. PaperLiu et al., “SuperBPE: Space Travel for Language Models,” COLM 2025. arXiv · Project · Code
  10. PaperZheng et al., “Broken Tokens? Your Language Model Can Secretly Handle Non-Canonical Tokenizations,” NeurIPS 2025 Spotlight. arXiv · Code
  11. PaperHayase et al., “Sampling from Your Language Model One Byte at a Time,” ICML 2026. arXiv · Code
  12. PaperXu et al., “Are You Going to Finish That? A Practical Study of the Partial Token Problem,” 2026. arXiv
  13. PaperLimisiewicz et al., “Compute Optimal Tokenization,” 2026. arXiv · Project · Code
  14. RepoAlisa Liu, patched Hugging Face tokenizer fork for SuperBPE. GitHub
  15. VideoCohere For AI – Community Talks: Alisa Liu. YouTube
  16. Video“SuperBPE: Space Travel for Language Models.” YouTube