Research Summary · Taiwanese Hokkien NLP · 2026

台語 Tokenizer
研究、開源工具與未來方向

系統整理 Taiwanese Hokkien/Taigi 的文字斷詞、羅馬字處理、LLM subword tokenization、code-mixing 與語音模型相關工作,並比較現有方法的適用情境與研究缺口。

Word Segmentation BPE / SentencePiece Hanji・POJ・Tâi-lô・Hanlo Code-mixing Low-resource NLP

1. 執行摘要

答案是:有人做台語斷詞、轉寫、code-mixing 與台語 LLM,但目前尚未形成一個像日文 MeCab/Sudachi 那樣成熟、標準化且廣泛採用的台語 tokenizer 生態。

已有字典式斷詞、羅馬字轉換、語料與翻譯模型
不足大規模金標斷詞資料與統一評測
缺口專為台語 LLM 最佳化的公開 tokenizer
最重要的判斷:Taibun 是可直接使用的台語文字 tokeniser/transliterator;TW-Hokkien-LLM 是重要的台語 LLM 與多書寫系統資源;EMNLP 2022 的工作提出語言學規則導向的台語斷詞工具。這些資源都很有價值,但它們並不等於「經完整 benchmark 驗證、專為台語 LLM 設計的 tokenizer」。

此外,2026 年的 PangolinTokenizer 證明「依臺灣在地語料重新訓練 tokenizer」能顯著提升 token efficiency 與 downstream performance;然而該工作主要針對臺灣華語及中英 code-switching,不能直接視為台語專用 tokenizer。它比較像是台語 tokenizer 研究可以借鏡的方法論。

2. 先釐清:這裡的 Tokenizer 有三種

文字斷詞器

Linguistic tokenizer

將句子切成語言學上的「詞」或語素,類似中文斷詞、日文 MeCab。

伊咧食飯
→ 伊|咧|食飯

適合 POS tagging、dependency parsing、辭典查詢與語料標註。

LLM subword tokenizer

BPEUnigram

將文字轉成模型 vocabulary 裡的 token ID,不一定對應完整詞。

彼个囡仔真𠢕
→ [彼, 个, 囡, 仔, 真, ...]

目標是控制 vocabulary、降低 token 數、提升模型學習與推論效率。

語音模型 tokenizer

ASR / TTS

可能是文字 token、音素、音節、聲調或 acoustic codec token。

Whisper 的 multilingual tokenizer 屬文字端;神經 codec token 則是聲音端離散表示。

正規化與轉寫工具

Normalization

處理漢字、台羅、白話字、漢羅混寫、Unicode combining marks 與標點。

它不必然是 tokenizer,卻是台語 tokenizer pipeline 的必要前處理。

3. 相關論文與總結

3.1 Exploring Methods for Building Dialects-Mandarin Code-Mixing Corpora: A Case Study in Taiwanese Hokkien

Lu et al., Findings of EMNLP 2022

這篇是最直接與台語文字斷詞相關的研究之一。作者面對台語—華語 code-mixing 語料稀少、書寫系統不統一與形態切分困難等問題,建立 code-mixing corpus,並提出結合語言學知識、規則與語言標籤的 Hokkien word segmentation toolkit。後續再以 XLM 做翻譯實驗。

  • 貢獻:不只做模型,也處理斷詞與 code-mixing 資料建構。
  • 價值:說明台語 tokenizer 不能只照搬華語斷詞器,必須理解台語詞彙與混語現象。
  • 限制:重點是 corpus construction 與 translation,不是大規模 LLM tokenizer benchmark。

3.2 The Application of Chinese Word Segmentation to Less-Resourced Language Processing

Meng-Hsien Shih, CLSW 2023/LNCS 2024

研究探討如何把較成熟的華語斷詞方法遷移到低資源語言,案例包含 Taiwanese Hokkien。核心價值在於:利用既有中文斷詞技術與台語語言資源,可較低成本建立可用的台語斷詞 pipeline。

  • 貢獻:將高資源語言技術轉移至台語。
  • 價值:適合作為低成本 baseline。
  • 風險:華語與台語雖共享漢字,但詞彙邊界、功能詞、語法與語義不完全相同,容易造成負遷移。

3.3 Construction of Large Language Models for Taigi and Hakka Using Transfer Learning

Lai et al., O-COCOSDA 2024

研究以 transfer learning 建立台語與客語 LLM。論文的重要訊號是:低資源語言模型通常不會完全從零開始,而會從現有模型出發,加入語言特定字元或詞彙,再做持續預訓練與任務微調。

  • 貢獻:驗證 transfer learning 能建立具一定能力的台語/客語模型。
  • Tokenizer 關聯:顯示 vocabulary adaptation 是低資源語言模型建置的一環。
  • 限制:研究焦點是 LLM 建置,不是對多種 tokenizer 演算法做嚴格消融。

3.4 Enhancing Taiwanese Hokkien Dual Translation by Large Language Model

Lu et al., LREC-COLING 2024

此工作建立 Taigi-Llama-2 與台語雙向翻譯模型,涵蓋漢字、POJ、漢羅等多種台語書寫形式。作者以約 78MB 台語單語資料持續預訓練 Traditional Chinese LLaMA-2,再以平行資料訓練翻譯模型。

  • 貢獻:把多書寫系統納入同一個台語 LLM pipeline。
  • Tokenizer 意義:同一語音內容可能有不同字形表示,tokenizer coverage 與 normalization 會直接影響資料利用率。
  • 限制:沿用既有 LLaMA tokenizer/模型框架,並非從零探索台語最佳 tokenizer。

3.5 Breeze Taigi: Benchmarks and Models for Taiwanese Hokkien Speech Recognition and Synthesis

Lan et al., arXiv 2026

這篇聚焦台語 ASR/TTS benchmark、正規化與 baseline 模型。ASR 使用 Whisper 架構及其 multilingual tokenizer,並以大量合成台語語音微調。

  • 貢獻:提供可重現的語音評測流程與 baseline。
  • Tokenizer 意義:語音系統也需要穩定的文字正規化與 tokenization,否則 CER 比較不公平。
  • 限制:使用通用 Whisper tokenizer,不代表其對台語 token efficiency 最佳。

3.6 BlueMagpie-TTS 與 PangolinTokenizer

Chung et al., arXiv 2026

這不是台語專用研究,而是臺灣華語、繁體中文與中英 code-switching。研究提出以臺灣情境語料訓練的 byte-level BPE tokenizer,並在九種 tokenizer 中達到最低 token rate;其結果支持一個重要假說:在地語料導向的 tokenizer 重訓,可能同時改善效率與下游模型表現。

使用時要避免誤解:PangolinTokenizer 可作為台語研究的強力方法學參考,但它針對的是臺灣華語/在地用語與中英混用,不是 Taiwanese Hokkien tokenizer。

4. Open-source packages、模型與資料資源

資源類型主要功能優點注意事項
Taibun Python package 台語 transliteration、發音資訊與 word tokeniser 可直接安裝使用;支援台語文字處理流程 其 Tokeniser 類似 word/punctuation tokenization,不能直接等同 LLM BPE tokenizer
taibun on PyPI 套件發佈 提供 Python 安裝與 API 使用方式 容易整合資料清理與 preprocessing 需自行用真實台語 corpus 驗證斷詞品質
TW-Hokkien-LLM 模型+語料 pipeline Taigi-Llama-2、翻譯模型、多書寫系統資源 與台語 LLM 最直接相關的開源專案之一 重點是持續預訓練與翻譯,不是 tokenizer library
Taigi-Llama-2-Translator-7B Hugging Face 模型 繁中/英文與台語漢字、POJ、漢羅之間翻譯 適合檢驗多 script 輸入輸出 模型 tokenizer 仍承襲 base model 限制
Taiwanese Corpora 語料資源入口 台語語料與斷詞研究相關資源 適合建 tokenizer corpus 與字典 需逐一確認資料授權與格式
ChhoeTaigi 辭典整合平台 跨多部台語辭典查詢 可用於詞表建構、別名與多字形對齊 網站查詢資源不代表資料可任意重發佈
教育部臺灣台語常用詞辭典 官方辭典 詞條、讀音、釋義與例句 高品質詞彙與標準台羅來源 模型訓練前應確認下載方式與授權
Taiwanese Speech Recognition Recipe ASR recipe 台語語音辨識訓練流程 有助研究文字正規化與語音 tokenizer 主要不是文字斷詞器

Taibun 基本示意

from taibun import Tokeniser

tokeniser = Tokeniser()
tokens = tokeniser.tokenise("朋友,你好!")
print(tokens)

實際輸出與細節應以套件目前版本文件為準;不同寫法、罕見字及漢羅混寫仍需另外測試。

5. 系統性比較

方法核心單位需要資料優點缺點適合任務
字元級Unicode character零 OOV、簡單穩定序列長;組合附加符號與罕見漢字處理複雜小型 baseline、標註工具
字典最長匹配詞典可解釋、容易加入專有詞歧義與新詞能力弱辭典查詢、規則系統
統計/神經斷詞詞邊界金標斷詞 corpus能學上下文歧義台語金標資料少,annotation guideline 尚不統一POS、parsing、IR
Byte-level BPEbyte subword大型原始 corpus不會 OOV,適合混語與罕見字可能把羅馬字變音符號與台語常見詞切碎LLM、TTS text frontend
SentencePiece BPEsubword大型 corpus語言無關、成熟、易重訓正規化設定會影響 POJ/台羅LLM、MT
SentencePiece Unigramsubword probability大型 corpus可保留多種切分候選,常適合低資源語言訓練與分析較不直觀多 script LLM、MT
Morpheme-aware + subword詞/語素後再切 subword詞典+語料語言學邊界與 LLM efficiency 可兼顧pipeline error propagation;規則維護成本高研究型台語 LLM tokenizer
Vocabulary expansion新增 token台語詞表可沿用既有 LLM 權重,成本較低新增 embedding 初始品質與舊 tokenizer 相容性問題continual pretraining

建議評估指標

效率

tokens / character、tokens / word、平均序列長度、推論 latency、KV-cache 使用量。

覆蓋

漢字、台羅、POJ、漢羅、罕見字、Unicode combining mark 與 code-switching coverage。

語言品質

詞邊界 F1、morpheme boundary F1、fertility、完整詞保留率。

下游任務

perplexity、translation、ASR CER、QA、classification、instruction following。

6. 台語 Tokenization 的特有挑戰

6.1 多書寫系統對應同一語言

台語可能使用漢字、白話字(POJ)、臺羅(Tâi-lô)、漢羅混寫,甚至同一句中切換表示方式。若不先做 mapping 或 canonicalization,模型會把語義相同的形式視為完全不同 token。

6.2 Unicode 與聲調符號

羅馬字母加聲調可使用預組字元或 base letter+combining mark。視覺上相同的字串,Unicode code point sequence 可能不同。一般 NFKC/NFC 正規化也可能破壞語言所需差異,因此必須設計台語專屬 normalization tests。

6.3 漢字並不代表華語詞界

台語與華語共享大量漢字,但詞彙、讀音、語法功能和 lexicalization 不同。直接套華語 jieba 類斷詞器,可能把台語功能詞、慣用語與複合詞切錯。

6.4 漢羅與多語 code-switching

真實文本可能同時含台語漢字、羅馬字、華語、英文、數字與 emoji。Tokenizer 除了辨識語言邊界,也要避免在切換點產生過度碎片化。

6.5 資料分布與代表性

宗教文本、辭典例句、新聞字幕、社群文本與口語轉錄的風格差距很大。只用單一來源訓練 tokenizer,可能對其他 domain 失效。

7. 最有潛力的研究方向

方向 A:建立第一個公開、可重現的 Taigi Tokenizer Benchmark

建立涵蓋漢字、POJ、臺羅、漢羅、台華混語與台英混語的 evaluation suite。除了 token efficiency,也納入詞界、語素界、Unicode robustness 與 downstream task。

方向 B:多書寫系統共同 tokenizer

比較三種策略:

  • 所有書寫系統直接混合訓練。
  • 先轉為統一音韻表示,再 tokenize。
  • 共享 semantic token,同時保留 script-specific surface token。

方向 C:Morpheme-aware SentencePiece

先由辭典/斷詞模型提供候選詞界,再在邊界約束下訓練 Unigram 或 BPE。研究問題是:語言學約束是否能降低 token fertility,同時改善 perplexity 與翻譯品質。

方向 D:從現有 LLM 做 Vocabulary Adaptation

比較「完全重訓 tokenizer」與「保留 base tokenizer、加入台語 token」兩條路徑。後者可降低 continual pretraining 成本,但需要處理 embedding 初始化、token collision 與 checkpoint 相容性。

方向 E:Tokenizer 與資料配比共同最佳化

把 tokenizer vocabulary allocation 視為 optimization problem:在固定 vocabulary budget 下,決定漢字、羅馬字、英文、華語及台語 token 各占多少比例。

方向 F:Speech–Text Joint Tokenization

利用音節、聲調或音素作為中介表示,讓同一台語詞的漢字、POJ 與台羅共享 pronunciation-aware representation,特別適合 ASR、TTS 與 speech LLM。

方向 G:Code-switching-aware Boundary Model

明確預測 language ID 與切換邊界,再進行子詞切分;評估是否能減少中英、台華或台英切換處的錯誤發音與 token 爆炸。

8. 建議的研究實作藍圖

可投稿的核心題目:
Toward a Script-Aware and Morpheme-Aware Tokenizer for Taiwanese Hokkien Large Language Models

研究問題

  1. 通用 LLM tokenizer 對台語各書寫系統的 token fertility 有多差?
  2. 台語專用 BPE/Unigram 是否優於 vocabulary expansion?
  3. morpheme-aware 約束能否改善語言品質,而不犧牲通用字元 coverage?
  4. 多 script 對齊是否能讓模型共享更多語義表示?

Baseline

  • Llama/Qwen/Gemma 原生 tokenizer
  • Byte-level BPE
  • SentencePiece BPE
  • SentencePiece Unigram
  • Base tokenizer+台語 vocabulary expansion
  • Taibun/詞典斷詞+SentencePiece hybrid

資料切片

Slice內容主要測試
Hanji純台語漢字與華語 tokenizer 的混淆
POJ白話字與 combining marksUnicode robustness
Tâi-lô教育部臺羅音節與聲調完整性
Hanlo漢羅混寫script switching
Taigi–Mandarin台華混語language boundary
Taigi–English台英混語code-switch fertility
Speech transcripts口語轉錄、停頓詞ASR/TTS downstream

預期貢獻

  • 第一套多書寫系統台語 tokenizer benchmark。
  • 公開 tokenizer、訓練 recipe、normalization library 與 evaluation toolkit。
  • 系統證明 tokenizer efficiency 與模型品質之間的關係。
  • 可推廣至客語、粵語與其他漢語族低資源語言的方法。

9. 參考資料

  1. Sin-En Lu, Bo-Han Lu, Chao-Yi Lu, Richard Tzong-Han Tsai. Exploring Methods for Building Dialects-Mandarin Code-Mixing Corpora: A Case Study in Taiwanese Hokkien. Findings of EMNLP, 2022.
  2. Meng-Hsien Shih. The Application of Chinese Word Segmentation to Less-Resourced Language Processing. Chinese Lexical Semantics / LNCS 14515, 2024.
  3. Yen-Chun Lai et al. Construction of Large Language Models for Taigi and Hakka Using Transfer Learning. O-COCOSDA, 2024.
  4. Bo-Han Lu et al. Enhancing Taiwanese Hokkien Dual Translation by Large Language Model. LREC-COLING, 2024.
  5. Yu-Siang Lan et al. Breeze Taigi: Benchmarks and Models for Taiwanese Hokkien Speech Recognition and Synthesis. arXiv, 2026.
  6. Ho Lam Chung et al. BlueMagpie-TTS: A Token-Efficient Tokenizer, Language Model, and TTS for Taiwanese-Accent Code-Switching Speech. arXiv, 2026.
  7. Taibun: Taiwanese Hokkien Transliterator and Tokeniser. GitHub.
  8. taibun. Python Package Index.
  9. TW-Hokkien-LLM. GitHub.
  10. Taigi-Llama-2-Translator-7B. Hugging Face.
  11. Taiwanese Corpora. GitHub.
  12. ChhoeTaigi 台語辭典⁺.
  13. 教育部臺灣台語常用詞辭典.
  14. Yi-Hui Chou et al. Evaluating Self-supervised Speech Models on a Taiwanese Hokkien Corpus. arXiv, 2023.

資料核對日期:2026-07-16。部分 2026 論文仍為 arXiv preprint;套件功能、授權與模型連結可能持續更新,正式使用前應再次查看各專案 README 與 LICENSE。