Guardado en:
| Autores principales: | Bao, Zishuo, Leng, Jiaqi, Wang, Junxiong, Peng, Bowen, Lu, Yucheng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2602.01007 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Understanding and Improving Length Generalization in Hierarchical Sparse Attention Models
por: Leng, Jiaqi, et al.
Publicado: (2025)
por: Leng, Jiaqi, et al.
Publicado: (2025)
Decoupling the Benefits of Subword Tokenization for Language Model Training via Byte-level Simulation
por: Gigant, Théo, et al.
Publicado: (2026)
por: Gigant, Théo, et al.
Publicado: (2026)
MambaByte: Token-free Selective State Space Model
por: Wang, Junxiong, et al.
Publicado: (2024)
por: Wang, Junxiong, et al.
Publicado: (2024)
Cross-Tokenizer LLM Distillation through a Byte-Level Interface
por: Singh, Avyav Kumar, et al.
Publicado: (2026)
por: Singh, Avyav Kumar, et al.
Publicado: (2026)
Sentence-Level or Token-Level? A Comprehensive Study on Knowledge Distillation
por: Wei, Jingxuan, et al.
Publicado: (2024)
por: Wei, Jingxuan, et al.
Publicado: (2024)
Improbable Bigrams Expose Vulnerabilities of Incomplete Tokens in Byte-Level Tokenizers
por: Jang, Eugene, et al.
Publicado: (2024)
por: Jang, Eugene, et al.
Publicado: (2024)
Efficient Pre-Training with Token Superposition
por: Peng, Bowen, et al.
Publicado: (2026)
por: Peng, Bowen, et al.
Publicado: (2026)
Exact Byte-Level Probabilities from Tokenized Language Models for FIM-Tasks and Model Ensembles
por: Phan, Buu, et al.
Publicado: (2024)
por: Phan, Buu, et al.
Publicado: (2024)
Bayesian Optimization for Enhanced Language Models: Optimizing Acquisition Functions
por: Bao, Zishuo, et al.
Publicado: (2025)
por: Bao, Zishuo, et al.
Publicado: (2025)
BanglaByT5: Byte-Level Modelling for Bangla
por: Bhattacharyya, Pramit, et al.
Publicado: (2025)
por: Bhattacharyya, Pramit, et al.
Publicado: (2025)
ByteFlow: Language Modeling through Adaptive Byte Compression without a Tokenizer
por: Deng, Chunyuan, et al.
Publicado: (2026)
por: Deng, Chunyuan, et al.
Publicado: (2026)
GPUTOK: GPU Accelerated Byte Level BPE Tokenization
por: Kadamba, Venu Gopal, et al.
Publicado: (2026)
por: Kadamba, Venu Gopal, et al.
Publicado: (2026)
Kathleen: Oscillator-Based Byte-Level Text Classification Without Tokenization or Attention
por: Fountzoulas, George
Publicado: (2026)
por: Fountzoulas, George
Publicado: (2026)
AlignDistil: Token-Level Language Model Alignment as Adaptive Policy Distillation
por: Zhang, Songming, et al.
Publicado: (2025)
por: Zhang, Songming, et al.
Publicado: (2025)
Kronecker Embeddings: Byte-Level Structured Token Representations for Parameter-Efficient Language Models
por: Shravan, Rohan
Publicado: (2026)
por: Shravan, Rohan
Publicado: (2026)
Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models
por: Cui, Xiao, et al.
Publicado: (2024)
por: Cui, Xiao, et al.
Publicado: (2024)
Rethinking Personalization in Large Language Models at the Token Level
por: Zhang, Chenheng, et al.
Publicado: (2026)
por: Zhang, Chenheng, et al.
Publicado: (2026)
Token-Level Policy Optimization: Linking Group-Level Rewards to Token-Level Aggregation via Markov Likelihood
por: Lin, Xingyu, et al.
Publicado: (2025)
por: Lin, Xingyu, et al.
Publicado: (2025)
Token-Level Policy Optimization: Linking Group-Level Rewards to Token-Level Aggregation via Sequence-Level Likelihood
por: Lin, Xingyu, et al.
Publicado: (2026)
por: Lin, Xingyu, et al.
Publicado: (2026)
Scaffold-BPE: Enhancing Byte Pair Encoding for Large Language Models with Simple and Effective Scaffold Token Removal
por: Lian, Haoran, et al.
Publicado: (2024)
por: Lian, Haoran, et al.
Publicado: (2024)
Byte BPE Tokenization as an Inverse string Homomorphism
por: Geng, Saibo, et al.
Publicado: (2024)
por: Geng, Saibo, et al.
Publicado: (2024)
CNMBERT: A Model for Converting Hanyu Pinyin Abbreviations to Chinese Characters
por: Feng, Zishuo, et al.
Publicado: (2024)
por: Feng, Zishuo, et al.
Publicado: (2024)
Token-Level Uncertainty-Aware Objective for Language Model Post-Training
por: Liu, Tingkai, et al.
Publicado: (2025)
por: Liu, Tingkai, et al.
Publicado: (2025)
SpaceByte: Towards Deleting Tokenization from Large Language Modeling
por: Slagle, Kevin
Publicado: (2024)
por: Slagle, Kevin
Publicado: (2024)
Entropy-Driven Pre-Tokenization for Byte-Pair Encoding
por: Hu, Yifan, et al.
Publicado: (2025)
por: Hu, Yifan, et al.
Publicado: (2025)
Back to Bytes: Revisiting Tokenization Through UTF-8
por: Moryossef, Amit, et al.
Publicado: (2025)
por: Moryossef, Amit, et al.
Publicado: (2025)
Predicting Rewards Alongside Tokens: Non-disruptive Parameter Insertion for Efficient Inference Intervention in Large Language Model
por: Yuan, Chenhan, et al.
Publicado: (2024)
por: Yuan, Chenhan, et al.
Publicado: (2024)
EGAD: Entropy-Guided Adaptive Distillation for Token-Level Knowledge Transfer
por: Zhang, Hao, et al.
Publicado: (2026)
por: Zhang, Hao, et al.
Publicado: (2026)
Hybrid Tokenization Strategy for DNA Language Model using Byte Pair Encoding and K-MER Methods
por: Sapkota, Ganesh, et al.
Publicado: (2025)
por: Sapkota, Ganesh, et al.
Publicado: (2025)
MrT5: Dynamic Token Merging for Efficient Byte-level Language Models
por: Kallini, Julie, et al.
Publicado: (2024)
por: Kallini, Julie, et al.
Publicado: (2024)
Byte Latent Transformer: Patches Scale Better Than Tokens
por: Pagnoni, Artidoro, et al.
Publicado: (2024)
por: Pagnoni, Artidoro, et al.
Publicado: (2024)
From Pixels to Tokens: Byte-Pair Encoding on Quantized Visual Modalities
por: Zhang, Wanpeng, et al.
Publicado: (2024)
por: Zhang, Wanpeng, et al.
Publicado: (2024)
Beyond Tokens: Concept-Level Training Objectives for LLMs
por: Iyer, Laya, et al.
Publicado: (2026)
por: Iyer, Laya, et al.
Publicado: (2026)
Reflection Pretraining Enables Token-Level Self-Correction in Biological Sequence Models
por: Zhang, Xiang, et al.
Publicado: (2025)
por: Zhang, Xiang, et al.
Publicado: (2025)
Entropy-Guided Token Dropout: Training Autoregressive Language Models with Limited Domain Data
por: Wang, Jiapeng, et al.
Publicado: (2025)
por: Wang, Jiapeng, et al.
Publicado: (2025)
Beyond Next Token Prediction: Patch-Level Training for Large Language Models
por: Shao, Chenze, et al.
Publicado: (2024)
por: Shao, Chenze, et al.
Publicado: (2024)
Multimodal Latent Language Modeling with Next-Token Diffusion
por: Sun, Yutao, et al.
Publicado: (2024)
por: Sun, Yutao, et al.
Publicado: (2024)
Training-Trajectory-Aware Token Selection
por: Shen, Zhanming, et al.
Publicado: (2026)
por: Shen, Zhanming, et al.
Publicado: (2026)
Large Language Models Struggle in Token-Level Clinical Named Entity Recognition
por: Lu, Qiuhao, et al.
Publicado: (2024)
por: Lu, Qiuhao, et al.
Publicado: (2024)
Length Value Model: Scalable Value Pretraining for Token-Level Length Modeling
por: Zhang, Zhen, et al.
Publicado: (2026)
por: Zhang, Zhen, et al.
Publicado: (2026)
Ejemplares similares
-
Understanding and Improving Length Generalization in Hierarchical Sparse Attention Models
por: Leng, Jiaqi, et al.
Publicado: (2025) -
Decoupling the Benefits of Subword Tokenization for Language Model Training via Byte-level Simulation
por: Gigant, Théo, et al.
Publicado: (2026) -
MambaByte: Token-free Selective State Space Model
por: Wang, Junxiong, et al.
Publicado: (2024) -
Cross-Tokenizer LLM Distillation through a Byte-Level Interface
por: Singh, Avyav Kumar, et al.
Publicado: (2026) -
Sentence-Level or Token-Level? A Comprehensive Study on Knowledge Distillation
por: Wei, Jingxuan, et al.
Publicado: (2024)