Broken Tokens? Your Language Model can Secretly Handle Non-Canonical Tokenizations

Brian Siyuan Zheng, Alisa Liu, Orevaoghene Ahia, Jonathan Hayase, Yejin Choi 0001, Noah A. Smith. Broken Tokens? Your Language Model can Secretly Handle Non-Canonical Tokenizations. In Danielle Belgrave, Cheng Zhang 0005, Laura N. Montoya, Hsuan-Tien Lin, Razvan Pascanu, Piotr Koniusz, Marzyeh Ghassemi, Nancy Chen, Iván Vladimir Meza Ruíz, Arturo Loaiza-Bonilla, editors, Advances in Neural Information Processing Systems 38: Annual Conference on Neural Information Processing Systems 2025, NeurIPS 2025, San Diago, CA, USA, December 2-7, 2025 / Mexico City, Mexico, November 30 - December 5, 2025. 2025. [doi]

@inproceedings{ZhengLAHCS25,
  title = {Broken Tokens? Your Language Model can Secretly Handle Non-Canonical Tokenizations},
  author = {Brian Siyuan Zheng and Alisa Liu and Orevaoghene Ahia and Jonathan Hayase and Yejin Choi 0001 and Noah A. Smith},
  year = {2025},
  url = {http://papers.nips.cc/paper_files/paper/2025/hash/2b5c5689fae6fa9a4883e73e511d52c8-Abstract-Conference.html},
  researchr = {https://researchr.org/publication/ZhengLAHCS25},
  cites = {0},
  citedby = {0},
  booktitle = {Advances in Neural Information Processing Systems 38: Annual Conference on Neural Information Processing Systems 2025, NeurIPS 2025, San Diago, CA, USA, December 2-7, 2025 / Mexico City, Mexico, November 30 - December 5, 2025},
  editor = {Danielle Belgrave and Cheng Zhang 0005 and Laura N. Montoya and Hsuan-Tien Lin and Razvan Pascanu and Piotr Koniusz and Marzyeh Ghassemi and Nancy Chen and Iván Vladimir Meza Ruíz and Arturo Loaiza-Bonilla},
}