Word Recovery in Large Language Models Enables Character-Level Tokenization Robustness
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yang, Zhipeng, Yang, Shu, Hu, Lijie, Wang, Di |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Understanding the Repeat Curse in Large Language Models from a Feature Perspective
par: Yao, Junchi, et autres
Publié: (2025)
par: Yao, Junchi, et autres
Publié: (2025)
Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images
par: You, Liangliang, et autres
Publié: (2025)
par: You, Liangliang, et autres
Publié: (2025)
The Compositional Architecture of Regret in Large Language Models
par: Cui, Xiangxiang, et autres
Publié: (2025)
par: Cui, Xiangxiang, et autres
Publié: (2025)
Character-Level Chinese Dependency Parsing via Modeling Latent Intra-Word Structure
par: Hou, Yang, et autres
Publié: (2024)
par: Hou, Yang, et autres
Publié: (2024)
Large Language Models Lack Understanding of Character Composition of Words
par: Shin, Andrew, et autres
Publié: (2024)
par: Shin, Andrew, et autres
Publié: (2024)
Chinese Word Boundary Recovery through Character Alignment Projection
par: Wang, Lusha, et autres
Publié: (2026)
par: Wang, Lusha, et autres
Publié: (2026)
CharacterBench: Benchmarking Character Customization of Large Language Models
par: Zhou, Jinfeng, et autres
Publié: (2024)
par: Zhou, Jinfeng, et autres
Publié: (2024)
Dissecting Fine-Tuning Unlearning in Large Language Models
par: Hong, Yihuai, et autres
Publié: (2024)
par: Hong, Yihuai, et autres
Publié: (2024)
Problematic Tokens: Tokenizer Bias in Large Language Models
par: Yang, Jin, et autres
Publié: (2024)
par: Yang, Jin, et autres
Publié: (2024)
MONAL: Model Autophagy Analysis for Modeling Human-AI Interactions
par: Yang, Shu, et autres
Publié: (2024)
par: Yang, Shu, et autres
Publié: (2024)
Can Large Language Models Identify Implicit Suicidal Ideation? An Empirical Evaluation
par: Li, Tong, et autres
Publié: (2025)
par: Li, Tong, et autres
Publié: (2025)
Rethinking Tokenization: Crafting Better Tokenizers for Large Language Models
par: Yang, Jinbiao
Publié: (2024)
par: Yang, Jinbiao
Publié: (2024)
Rethinking Personalization in Large Language Models at the Token Level
par: Zhang, Chenheng, et autres
Publié: (2026)
par: Zhang, Chenheng, et autres
Publié: (2026)
Evaluating Character Understanding of Large Language Models via Character Profiling from Fictional Works
par: Yuan, Xinfeng, et autres
Publié: (2024)
par: Yuan, Xinfeng, et autres
Publié: (2024)
Beyond Token-Level Policy Gradients for Complex Reasoning with Large Language Models
par: Xu, Mufan, et autres
Publié: (2026)
par: Xu, Mufan, et autres
Publié: (2026)
Understanding and Mitigating Cross-lingual Privacy Leakage via Language-specific and Universal Privacy Neurons
par: Dong, Wenshuo, et autres
Publié: (2025)
par: Dong, Wenshuo, et autres
Publié: (2025)
Private Language Models via Truncated Laplacian Mechanism
par: Huang, Tianhao, et autres
Publié: (2024)
par: Huang, Tianhao, et autres
Publié: (2024)
CharBench: Evaluating the Role of Tokenization in Character-Level Tasks
par: Uzan, Omri, et autres
Publié: (2025)
par: Uzan, Omri, et autres
Publié: (2025)
Token-Level Privacy in Large Language Models
par: Harel, Re'em, et autres
Publié: (2025)
par: Harel, Re'em, et autres
Publié: (2025)
Understanding How Value Neurons Shape the Generation of Specified Values in LLMs
par: Su, Yi, et autres
Publié: (2025)
par: Su, Yi, et autres
Publié: (2025)
Large Language Model as Token Compressor and Decompressor
par: Li, Wenbing, et autres
Publié: (2026)
par: Li, Wenbing, et autres
Publié: (2026)
From Language Models over Tokens to Language Models over Characters
par: Vieira, Tim, et autres
Publié: (2024)
par: Vieira, Tim, et autres
Publié: (2024)
The Strawberry Problem: Emergence of Character-level Understanding in Tokenized Language Models
par: Cosma, Adrian, et autres
Publié: (2025)
par: Cosma, Adrian, et autres
Publié: (2025)
When Truth Is Overridden: Uncovering the Internal Origins of Sycophancy in Large Language Models
par: Wang, Keyu, et autres
Publié: (2025)
par: Wang, Keyu, et autres
Publié: (2025)
CODEMENV: Benchmarking Large Language Models on Code Migration
par: Cheng, Keyuan, et autres
Publié: (2025)
par: Cheng, Keyuan, et autres
Publié: (2025)
Identifying and Analyzing Performance-Critical Tokens in Large Language Models
par: Bai, Yu, et autres
Publié: (2024)
par: Bai, Yu, et autres
Publié: (2024)
Faithful-Patchscopes: Understanding and Mitigating Model Bias in Hidden Representations Explanation of Large Language Models
par: Gong, Xilin, et autres
Publié: (2026)
par: Gong, Xilin, et autres
Publié: (2026)
Tokenization Falling Short: On Subword Robustness in Large Language Models
par: Chai, Yekun, et autres
Publié: (2024)
par: Chai, Yekun, et autres
Publié: (2024)
Vision-centric Token Compression in Large Language Model
par: Xing, Ling, et autres
Publié: (2025)
par: Xing, Ling, et autres
Publié: (2025)
On the Robustness of Document-Level Relation Extraction Models to Entity Name Variations
par: Meng, Shiao, et autres
Publié: (2024)
par: Meng, Shiao, et autres
Publié: (2024)
Enhancing Character-Level Understanding in LLMs through Token Internal Structure Learning
par: Xu, Zhu, et autres
Publié: (2024)
par: Xu, Zhu, et autres
Publié: (2024)
MoRAL: MoE Augmented LoRA for LLMs' Lifelong Learning
par: Yang, Shu, et autres
Publié: (2024)
par: Yang, Shu, et autres
Publié: (2024)
How Do Language Models Acquire Character-Level Information?
par: Sato, Soma, et autres
Publié: (2026)
par: Sato, Soma, et autres
Publié: (2026)
A Semantic Invariant Robust Watermark for Large Language Models
par: Liu, Aiwei, et autres
Publié: (2023)
par: Liu, Aiwei, et autres
Publié: (2023)
ResT: Reshaping Token-Level Policy Gradients for Tool-Use Large Language Models
par: Lin, Zihan, et autres
Publié: (2025)
par: Lin, Zihan, et autres
Publié: (2025)
Understanding and Mitigating Political Stance Cross-topic Generalization in Large Language Models
par: Zhang, Jiayi, et autres
Publié: (2025)
par: Zhang, Jiayi, et autres
Publié: (2025)
Tokenization Matters! Degrading Large Language Models through Challenging Their Tokenization
par: Wang, Dixuan, et autres
Publié: (2024)
par: Wang, Dixuan, et autres
Publié: (2024)
Exploring the Personality Traits of LLMs through Latent Features Steering
par: Yang, Shu, et autres
Publié: (2024)
par: Yang, Shu, et autres
Publié: (2024)
STARS: Synchronous Token Alignment for Robust Supervision in Large Language Models
par: Quamar, Mohammad Atif, et autres
Publié: (2025)
par: Quamar, Mohammad Atif, et autres
Publié: (2025)
TLDR: Token-Level Detective Reward Model for Large Vision Language Models
par: Fu, Deqing, et autres
Publié: (2024)
par: Fu, Deqing, et autres
Publié: (2024)
Documents similaires
-
Understanding the Repeat Curse in Large Language Models from a Feature Perspective
par: Yao, Junchi, et autres
Publié: (2025) -
Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images
par: You, Liangliang, et autres
Publié: (2025) -
The Compositional Architecture of Regret in Large Language Models
par: Cui, Xiangxiang, et autres
Publié: (2025) -
Character-Level Chinese Dependency Parsing via Modeling Latent Intra-Word Structure
par: Hou, Yang, et autres
Publié: (2024) -
Large Language Models Lack Understanding of Character Composition of Words
par: Shin, Andrew, et autres
Publié: (2024)