Accepted Papers
Morning Poster Session
11:20 a.m. - 12:30 p.m. PDT, October 9, 2026
-
Dynamic Multi-Byte Prediction With Hierarchical Language Models
Abraham Owodunni 路 Chibuzor Okocha 路 Christan Grant 路 Tomasz Limisiewicz 路 Sachin Kumar -
What If Chinese Were Latinized? A Counterfactual Study of Script, Tokenization, and Language Modeling
Zijie Zheng 路 Ej Zhou -
Beyond Frequency: Output-Vocabulary Pruning by Log-Mass Maximization
Sergei Ivanov 路 Egor Krasheninnikov 路 Nikita Kozodoi 路 Natalia Tarasova 路 Aoyu Zhang -
Tokenisation via Convex Relaxations
Jan Tempus 路 Philip Whittington 路 Craig Schmidt 路 Dennis Komm 路 Tiago Pimentel -
Compute Optimal Tokenization
Tomasz Limisiewicz 路 Artidoro Pagnoni 路 Srini Iyer 路 Mike Lewis 路 Sachin Mehta 路 Alisa Liu 路 Margaret Li 路 Gargi Ghosh 路 Luke Zettlemoyer -
Writing-System-Level Tokenizer Adaptation for Byte-Level BPE
Bohdan Didenko -
Defragmenting Language Models: An Interpretability-based Approach for Vocabulary Expansion
Maitrey Mehta 路 Nishant Subramani 路 Zhichao Xu 路 Ashim Gupta 路 Vivek Srikumar -
Tokenizing Numerical and Embedding Features for LLM RecSys
Zhe Xu 路 Ankit Peshin 路 Chiyu Zhang 路 Feng Qi 路 TIK O LUI 路 Anil Ramakrishna 路 Justin Johnson 路 Carl Hu 路 Kaushik Rangadurai 路 Luke Simon -
Reading a Word Two Ways: A Learned Gate over Tokenization Layouts for Frozen Language Models
Anuja Dawane 路 Harsha Ponnada 路 V Subrahmany Raghu Ram Kishore Parupudi -
Byte-Level Tokenizer Transfer with Auxiliary Objectives
Gianluca Vico 路 Jind艡ich Libovick媒 -
Shorthand for Thought: Compressing LLM Reasoning via Entropy-Guided Supertokens
Zhenyu Zhao 路 Sander Land 路 Daniel M Bikel 路 Waseem Alshikh -
A Pilot Study of Autocompleting Tokenizers
Samuel Wexler 路 Mark Hopkins -
Reframing Language Segmentation: Generalizing Past Tokenizers
Jason Batson -
Model-Aware Tokenizer Transfer
Mykola Haltiuk 路 Aleksander Smywi艅ski-Pohl -
LangMAP: A Language-Adaptive Approach to Tokenization
Clara Meister 路 Suchir Salhan 路 Andrzej Szablewski 路 Pietro Lesci 路 Paula Buttery 路 Tiago Pimentel -
MinGram: A Minimalist Unigram Tokenizer with High Compression and Competitive Morphological Alignment
Sander Land -
MoirfEolas and Cr铆ochScore: Developing Resources for and the Evaluation of Tokenization Alignment with Irish Morphology
Jane Adkins 路 Abigail Walsh 路 Brian Davis 路 Elaine U铆 Dhonnchadha -
Transducing Language Models
V茅steinn Sn忙bjarnarson 路 Samuel Kiegeland 路 Tianyu Liu 路 Reda Boumasmoud 路 Ryan Cotterell 路 Tim Vieira -
Pretraining Language Models with Subword Regularization: An Empirical Study of BPE Dropout in Low-Resource NLP
Ruan Visser 路 Trienko L Grobler 路 Marcel Dunaiski -
Byte n-gram Encoding
Marius Tomek 路 Philip Whittington 路 Violeta Kastreva 路 Clara Meister 路 Dennis Komm 路 Tiago Pimentel -
Disentangling Language Modeling and Boundaries
Mykola Haltiuk -
BBT: BPE-Guided Byte Transformer
Hyunho Kim 路 SeungYeol Baek
Afternoon Poster Session
3:50 p.m. - 5:00 p.m. PDT, October 9, 2026
-
Is Tokenizer Cognitive Plausibility just Fertility?
Suchir Salhan -
Do Foundation Model Image Embeddings Capture Radiological Semantics in CT Lung Nodules?
Yiyang (Ian) Wang 路 Charmi Patel 路 Daniela Raicu -
Joint Optimization for Greedy Longest-match Tokenization
Adhiraj Singh 路 Deepanshu Mody 路 Ghina Al Shdaifat 路 Hamza Alshamy 路 Adam Wiemerslage 路 Varshini Reddy 路 Craig Schmidt -
Disentangling Tokenizer Confounds in Bilingual Transfer Estimates
Jiajun Shen 路 Clara Meister -
When Tokenization is Secretly Output Supervision
Tanja Baeumel 路 Josef v Genabith 路 Simon Ostermann -
What Tokens are Learned when Tokenization is Optimized Jointly with Language Modeling?
Saketh Reddy Vemula 路 Parameswari Krishnamurthy -
Objective vs. Search: Decomposing What Makes a Good Tokeniser
Ahmetcan Yavuz 路 Clara Meister 路 Tiago Pimentel -
Less Is More: Reducing Token Counts Without Compromising Performance
Gyeongje Cho 路 Yeonkyoung So 路 Sangmin Lee 路 Jaejin Lee -
What Do We Talk About When We Talk About Tokenization?
Gianluca Vico 路 Jind艡ich Libovick媒 -
Beyond Metric Stability: Interface-Preserving Token Halting and Fusion
Tyler Cody 路 Keyu Huang 路 Peter A Beling -
CortexMem: Brain-Guided Event Memory for Persistent Context in Language Models
Sarthak Tayal -
Fewer Transformer Positions, Same Subword Evidence: Word-Level Fusion for Multilingual Tokenization
Divyajot Singh -
Compression, Lexical Alignment, and Segmentation Similarity of Tokenizers Across Programming Languages
Sanghyeon R Joo -
Comparative Study of Tokenizer Replacement, Embedding Initialization, and Continued Pretraining for LLM Language Adaptation
Aleksandra Krasnod臋bska 路 Miko艂aj Pokrywka 路 Marek Jeli艅ski 路 Antoni Lasik 路 Marcin Bagnowski 路 Wojciech Kusa -
What Makes an Encoding Good for Language Modeling?
Eugene Jang 路 Catherine Arnett 路 Terra Blevins -
Tokenisers Matter: Evaluating Bias in Multilingual and Persian-Specific Language Models
Mohammad Soroush Bagheri 路 Zahra Rezaei -
Dynamic Image Tokenization for Efficient VLMs
Yusen Peng 路 Tejas Naik 路 Valentin Hofmann 路 Yuki M Asano 路 Sachin Kumar -
Whose Tokenizer? An Empirical Review of When and How Much Tokenizer Choice Matters for Multilingual Language Models
Clara Meister 路 Amit Moryossef 路 Tiago Pimentel 路 Antoine Bosselut -
Are Non-BPE Tokenizers Ready to Improve LLM Numeracy?
Yizhan Huang 路 HUANG Nianchen 路 Yunxiang Li 路 Siu P Wong 路 Michael R Lyu -
A Call for an Open Tokenizer Benchmark
Marco Cognetta -
Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content
Ingo Ziegler 路 Martin Krebs 路 Desmond Elliott