1. 執行摘要
答案是:有人做台語斷詞、轉寫、code-mixing 與台語 LLM,但目前尚未形成一個像日文 MeCab/Sudachi 那樣成熟、標準化且廣泛採用的台語 tokenizer 生態。
此外,2026 年的 PangolinTokenizer 證明「依臺灣在地語料重新訓練 tokenizer」能顯著提升 token efficiency 與 downstream performance;然而該工作主要針對臺灣華語及中英 code-switching,不能直接視為台語專用 tokenizer。它比較像是台語 tokenizer 研究可以借鏡的方法論。
2. 先釐清:這裡的 Tokenizer 有三種
文字斷詞器
Linguistic tokenizer將句子切成語言學上的「詞」或語素,類似中文斷詞、日文 MeCab。
伊咧食飯 → 伊|咧|食飯
適合 POS tagging、dependency parsing、辭典查詢與語料標註。
LLM subword tokenizer
BPEUnigram將文字轉成模型 vocabulary 裡的 token ID,不一定對應完整詞。
彼个囡仔真𠢕 → [彼, 个, 囡, 仔, 真, ...]
目標是控制 vocabulary、降低 token 數、提升模型學習與推論效率。
語音模型 tokenizer
ASR / TTS可能是文字 token、音素、音節、聲調或 acoustic codec token。
Whisper 的 multilingual tokenizer 屬文字端;神經 codec token 則是聲音端離散表示。
正規化與轉寫工具
Normalization處理漢字、台羅、白話字、漢羅混寫、Unicode combining marks 與標點。
它不必然是 tokenizer,卻是台語 tokenizer pipeline 的必要前處理。
3. 相關論文與總結
3.1 Exploring Methods for Building Dialects-Mandarin Code-Mixing Corpora: A Case Study in Taiwanese Hokkien
Lu et al., Findings of EMNLP 2022
這篇是最直接與台語文字斷詞相關的研究之一。作者面對台語—華語 code-mixing 語料稀少、書寫系統不統一與形態切分困難等問題,建立 code-mixing corpus,並提出結合語言學知識、規則與語言標籤的 Hokkien word segmentation toolkit。後續再以 XLM 做翻譯實驗。
- 貢獻:不只做模型,也處理斷詞與 code-mixing 資料建構。
- 價值:說明台語 tokenizer 不能只照搬華語斷詞器,必須理解台語詞彙與混語現象。
- 限制:重點是 corpus construction 與 translation,不是大規模 LLM tokenizer benchmark。
3.2 The Application of Chinese Word Segmentation to Less-Resourced Language Processing
Meng-Hsien Shih, CLSW 2023/LNCS 2024
研究探討如何把較成熟的華語斷詞方法遷移到低資源語言,案例包含 Taiwanese Hokkien。核心價值在於:利用既有中文斷詞技術與台語語言資源,可較低成本建立可用的台語斷詞 pipeline。
- 貢獻:將高資源語言技術轉移至台語。
- 價值:適合作為低成本 baseline。
- 風險:華語與台語雖共享漢字,但詞彙邊界、功能詞、語法與語義不完全相同,容易造成負遷移。
3.3 Construction of Large Language Models for Taigi and Hakka Using Transfer Learning
Lai et al., O-COCOSDA 2024
研究以 transfer learning 建立台語與客語 LLM。論文的重要訊號是:低資源語言模型通常不會完全從零開始,而會從現有模型出發,加入語言特定字元或詞彙,再做持續預訓練與任務微調。
- 貢獻:驗證 transfer learning 能建立具一定能力的台語/客語模型。
- Tokenizer 關聯:顯示 vocabulary adaptation 是低資源語言模型建置的一環。
- 限制:研究焦點是 LLM 建置,不是對多種 tokenizer 演算法做嚴格消融。
3.4 Enhancing Taiwanese Hokkien Dual Translation by Large Language Model
Lu et al., LREC-COLING 2024
此工作建立 Taigi-Llama-2 與台語雙向翻譯模型,涵蓋漢字、POJ、漢羅等多種台語書寫形式。作者以約 78MB 台語單語資料持續預訓練 Traditional Chinese LLaMA-2,再以平行資料訓練翻譯模型。
- 貢獻:把多書寫系統納入同一個台語 LLM pipeline。
- Tokenizer 意義:同一語音內容可能有不同字形表示,tokenizer coverage 與 normalization 會直接影響資料利用率。
- 限制:沿用既有 LLaMA tokenizer/模型框架,並非從零探索台語最佳 tokenizer。
3.5 Breeze Taigi: Benchmarks and Models for Taiwanese Hokkien Speech Recognition and Synthesis
Lan et al., arXiv 2026
這篇聚焦台語 ASR/TTS benchmark、正規化與 baseline 模型。ASR 使用 Whisper 架構及其 multilingual tokenizer,並以大量合成台語語音微調。
- 貢獻:提供可重現的語音評測流程與 baseline。
- Tokenizer 意義:語音系統也需要穩定的文字正規化與 tokenization,否則 CER 比較不公平。
- 限制:使用通用 Whisper tokenizer,不代表其對台語 token efficiency 最佳。
3.6 BlueMagpie-TTS 與 PangolinTokenizer
Chung et al., arXiv 2026
這不是台語專用研究,而是臺灣華語、繁體中文與中英 code-switching。研究提出以臺灣情境語料訓練的 byte-level BPE tokenizer,並在九種 tokenizer 中達到最低 token rate;其結果支持一個重要假說:在地語料導向的 tokenizer 重訓,可能同時改善效率與下游模型表現。
4. Open-source packages、模型與資料資源
| 資源 | 類型 | 主要功能 | 優點 | 注意事項 |
|---|---|---|---|---|
| Taibun | Python package | 台語 transliteration、發音資訊與 word tokeniser | 可直接安裝使用;支援台語文字處理流程 | 其 Tokeniser 類似 word/punctuation tokenization,不能直接等同 LLM BPE tokenizer |
| taibun on PyPI | 套件發佈 | 提供 Python 安裝與 API 使用方式 | 容易整合資料清理與 preprocessing | 需自行用真實台語 corpus 驗證斷詞品質 |
| TW-Hokkien-LLM | 模型+語料 pipeline | Taigi-Llama-2、翻譯模型、多書寫系統資源 | 與台語 LLM 最直接相關的開源專案之一 | 重點是持續預訓練與翻譯,不是 tokenizer library |
| Taigi-Llama-2-Translator-7B | Hugging Face 模型 | 繁中/英文與台語漢字、POJ、漢羅之間翻譯 | 適合檢驗多 script 輸入輸出 | 模型 tokenizer 仍承襲 base model 限制 |
| Taiwanese Corpora | 語料資源入口 | 台語語料與斷詞研究相關資源 | 適合建 tokenizer corpus 與字典 | 需逐一確認資料授權與格式 |
| ChhoeTaigi | 辭典整合平台 | 跨多部台語辭典查詢 | 可用於詞表建構、別名與多字形對齊 | 網站查詢資源不代表資料可任意重發佈 |
| 教育部臺灣台語常用詞辭典 | 官方辭典 | 詞條、讀音、釋義與例句 | 高品質詞彙與標準台羅來源 | 模型訓練前應確認下載方式與授權 |
| Taiwanese Speech Recognition Recipe | ASR recipe | 台語語音辨識訓練流程 | 有助研究文字正規化與語音 tokenizer | 主要不是文字斷詞器 |
Taibun 基本示意
from taibun import Tokeniser
tokeniser = Tokeniser()
tokens = tokeniser.tokenise("朋友,你好!")
print(tokens)
實際輸出與細節應以套件目前版本文件為準;不同寫法、罕見字及漢羅混寫仍需另外測試。
5. 系統性比較
| 方法 | 核心單位 | 需要資料 | 優點 | 缺點 | 適合任務 |
|---|---|---|---|---|---|
| 字元級 | Unicode character | 低 | 零 OOV、簡單穩定 | 序列長;組合附加符號與罕見漢字處理複雜 | 小型 baseline、標註工具 |
| 字典最長匹配 | 詞 | 詞典 | 可解釋、容易加入專有詞 | 歧義與新詞能力弱 | 辭典查詢、規則系統 |
| 統計/神經斷詞 | 詞邊界 | 金標斷詞 corpus | 能學上下文歧義 | 台語金標資料少,annotation guideline 尚不統一 | POS、parsing、IR |
| Byte-level BPE | byte subword | 大型原始 corpus | 不會 OOV,適合混語與罕見字 | 可能把羅馬字變音符號與台語常見詞切碎 | LLM、TTS text frontend |
| SentencePiece BPE | subword | 大型 corpus | 語言無關、成熟、易重訓 | 正規化設定會影響 POJ/台羅 | LLM、MT |
| SentencePiece Unigram | subword probability | 大型 corpus | 可保留多種切分候選,常適合低資源語言 | 訓練與分析較不直觀 | 多 script LLM、MT |
| Morpheme-aware + subword | 詞/語素後再切 subword | 詞典+語料 | 語言學邊界與 LLM efficiency 可兼顧 | pipeline error propagation;規則維護成本高 | 研究型台語 LLM tokenizer |
| Vocabulary expansion | 新增 token | 台語詞表 | 可沿用既有 LLM 權重,成本較低 | 新增 embedding 初始品質與舊 tokenizer 相容性問題 | continual pretraining |
建議評估指標
效率
tokens / character、tokens / word、平均序列長度、推論 latency、KV-cache 使用量。
覆蓋
漢字、台羅、POJ、漢羅、罕見字、Unicode combining mark 與 code-switching coverage。
語言品質
詞邊界 F1、morpheme boundary F1、fertility、完整詞保留率。
下游任務
perplexity、translation、ASR CER、QA、classification、instruction following。
6. 台語 Tokenization 的特有挑戰
6.1 多書寫系統對應同一語言
台語可能使用漢字、白話字(POJ)、臺羅(Tâi-lô)、漢羅混寫,甚至同一句中切換表示方式。若不先做 mapping 或 canonicalization,模型會把語義相同的形式視為完全不同 token。
6.2 Unicode 與聲調符號
羅馬字母加聲調可使用預組字元或 base letter+combining mark。視覺上相同的字串,Unicode code point sequence 可能不同。一般 NFKC/NFC 正規化也可能破壞語言所需差異,因此必須設計台語專屬 normalization tests。
6.3 漢字並不代表華語詞界
台語與華語共享大量漢字,但詞彙、讀音、語法功能和 lexicalization 不同。直接套華語 jieba 類斷詞器,可能把台語功能詞、慣用語與複合詞切錯。
6.4 漢羅與多語 code-switching
真實文本可能同時含台語漢字、羅馬字、華語、英文、數字與 emoji。Tokenizer 除了辨識語言邊界,也要避免在切換點產生過度碎片化。
6.5 資料分布與代表性
宗教文本、辭典例句、新聞字幕、社群文本與口語轉錄的風格差距很大。只用單一來源訓練 tokenizer,可能對其他 domain 失效。
7. 最有潛力的研究方向
方向 A:建立第一個公開、可重現的 Taigi Tokenizer Benchmark
建立涵蓋漢字、POJ、臺羅、漢羅、台華混語與台英混語的 evaluation suite。除了 token efficiency,也納入詞界、語素界、Unicode robustness 與 downstream task。
方向 B:多書寫系統共同 tokenizer
比較三種策略:
- 所有書寫系統直接混合訓練。
- 先轉為統一音韻表示,再 tokenize。
- 共享 semantic token,同時保留 script-specific surface token。
方向 C:Morpheme-aware SentencePiece
先由辭典/斷詞模型提供候選詞界,再在邊界約束下訓練 Unigram 或 BPE。研究問題是:語言學約束是否能降低 token fertility,同時改善 perplexity 與翻譯品質。
方向 D:從現有 LLM 做 Vocabulary Adaptation
比較「完全重訓 tokenizer」與「保留 base tokenizer、加入台語 token」兩條路徑。後者可降低 continual pretraining 成本,但需要處理 embedding 初始化、token collision 與 checkpoint 相容性。
方向 E:Tokenizer 與資料配比共同最佳化
把 tokenizer vocabulary allocation 視為 optimization problem:在固定 vocabulary budget 下,決定漢字、羅馬字、英文、華語及台語 token 各占多少比例。
方向 F:Speech–Text Joint Tokenization
利用音節、聲調或音素作為中介表示,讓同一台語詞的漢字、POJ 與台羅共享 pronunciation-aware representation,特別適合 ASR、TTS 與 speech LLM。
方向 G:Code-switching-aware Boundary Model
明確預測 language ID 與切換邊界,再進行子詞切分;評估是否能減少中英、台華或台英切換處的錯誤發音與 token 爆炸。
8. 建議的研究實作藍圖
Toward a Script-Aware and Morpheme-Aware Tokenizer for Taiwanese Hokkien Large Language Models
研究問題
- 通用 LLM tokenizer 對台語各書寫系統的 token fertility 有多差?
- 台語專用 BPE/Unigram 是否優於 vocabulary expansion?
- morpheme-aware 約束能否改善語言品質,而不犧牲通用字元 coverage?
- 多 script 對齊是否能讓模型共享更多語義表示?
Baseline
- Llama/Qwen/Gemma 原生 tokenizer
- Byte-level BPE
- SentencePiece BPE
- SentencePiece Unigram
- Base tokenizer+台語 vocabulary expansion
- Taibun/詞典斷詞+SentencePiece hybrid
資料切片
| Slice | 內容 | 主要測試 |
|---|---|---|
| Hanji | 純台語漢字 | 與華語 tokenizer 的混淆 |
| POJ | 白話字與 combining marks | Unicode robustness |
| Tâi-lô | 教育部臺羅 | 音節與聲調完整性 |
| Hanlo | 漢羅混寫 | script switching |
| Taigi–Mandarin | 台華混語 | language boundary |
| Taigi–English | 台英混語 | code-switch fertility |
| Speech transcripts | 口語轉錄、停頓詞 | ASR/TTS downstream |
預期貢獻
- 第一套多書寫系統台語 tokenizer benchmark。
- 公開 tokenizer、訓練 recipe、normalization library 與 evaluation toolkit。
- 系統證明 tokenizer efficiency 與模型品質之間的關係。
- 可推廣至客語、粵語與其他漢語族低資源語言的方法。
9. 參考資料
- Sin-En Lu, Bo-Han Lu, Chao-Yi Lu, Richard Tzong-Han Tsai. Exploring Methods for Building Dialects-Mandarin Code-Mixing Corpora: A Case Study in Taiwanese Hokkien. Findings of EMNLP, 2022.
- Meng-Hsien Shih. The Application of Chinese Word Segmentation to Less-Resourced Language Processing. Chinese Lexical Semantics / LNCS 14515, 2024.
- Yen-Chun Lai et al. Construction of Large Language Models for Taigi and Hakka Using Transfer Learning. O-COCOSDA, 2024.
- Bo-Han Lu et al. Enhancing Taiwanese Hokkien Dual Translation by Large Language Model. LREC-COLING, 2024.
- Yu-Siang Lan et al. Breeze Taigi: Benchmarks and Models for Taiwanese Hokkien Speech Recognition and Synthesis. arXiv, 2026.
- Ho Lam Chung et al. BlueMagpie-TTS: A Token-Efficient Tokenizer, Language Model, and TTS for Taiwanese-Accent Code-Switching Speech. arXiv, 2026.
- Taibun: Taiwanese Hokkien Transliterator and Tokeniser. GitHub.
- taibun. Python Package Index.
- TW-Hokkien-LLM. GitHub.
- Taigi-Llama-2-Translator-7B. Hugging Face.
- Taiwanese Corpora. GitHub.
- ChhoeTaigi 台語辭典⁺.
- 教育部臺灣台語常用詞辭典.
- Yi-Hui Chou et al. Evaluating Self-supervised Speech Models on a Taiwanese Hokkien Corpus. arXiv, 2023.
資料核對日期:2026-07-16。部分 2026 論文仍為 arXiv preprint;套件功能、授權與模型連結可能持續更新,正式使用前應再次查看各專案 README 與 LICENSE。