TokAlign: Efficient Vocabulary Adaptation via Token Alignment
Fuente:
arXiv
Saved in:
| Main Authors: | Li, Chong, Zhang, Jiajun, Zong, Chengqing |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
TokAlign++: Advancing Vocabulary Adaptation via Better Token Alignment
by: Li, Chong, et al.
Published: (2026)
by: Li, Chong, et al.
Published: (2026)
Improving In-context Learning of Multilingual Generative Language Models with Cross-lingual Alignment
by: Li, Chong, et al.
Published: (2023)
by: Li, Chong, et al.
Published: (2023)
Group then Scale: Dynamic Mixture-of-Experts Multilingual Language Model
by: Li, Chong, et al.
Published: (2025)
by: Li, Chong, et al.
Published: (2025)
Implicit Cross-Lingual Rewarding for Efficient Multilingual Preference Alignment
by: Yang, Wen, et al.
Published: (2025)
by: Yang, Wen, et al.
Published: (2025)
X-Instruction: Aligning Language Model in Low-resource Languages with Self-curated Cross-lingual Instructions
by: Li, Chong, et al.
Published: (2024)
by: Li, Chong, et al.
Published: (2024)
Decoding the Multimodal Mind: Generalizable Brain-to-Text Translation via Multimodal Alignment and Adaptive Routing
by: Ye, Chunyu, et al.
Published: (2025)
by: Ye, Chunyu, et al.
Published: (2025)
Parallel Scaling Law: Unveiling Reasoning Generalization through A Cross-Linguistic Perspective
by: Yang, Wen, et al.
Published: (2025)
by: Yang, Wen, et al.
Published: (2025)
From Generic Empathy to Personalized Emotional Support: A Self-Evolution Framework for User Preference Alignment
by: Ye, Jing, et al.
Published: (2025)
by: Ye, Jing, et al.
Published: (2025)
MulCogBench: A Multi-modal Cognitive Benchmark Dataset for Evaluating Chinese and English Computational Language Models
by: Zhang, Yunhao, et al.
Published: (2024)
by: Zhang, Yunhao, et al.
Published: (2024)
Navigating Brain Language Representations: A Comparative Analysis of Neural Language Models and Psychologically Plausible Models
by: Zhang, Yunhao, et al.
Published: (2024)
by: Zhang, Yunhao, et al.
Published: (2024)
BLSP: Bootstrapping Language-Speech Pre-training via Behavior Alignment of Continuation Writing
by: Wang, Chen, et al.
Published: (2023)
by: Wang, Chen, et al.
Published: (2023)
Language Imbalance Driven Rewarding for Multilingual Self-improving
by: Yang, Wen, et al.
Published: (2024)
by: Yang, Wen, et al.
Published: (2024)
Discovering Semantic Subdimensions through Disentangled Conceptual Representations
by: Zhang, Yunhao, et al.
Published: (2025)
by: Zhang, Yunhao, et al.
Published: (2025)
F-MALLOC: Feed-forward Memory Allocation for Continual Learning in Neural Machine Translation
by: Wu, Junhong, et al.
Published: (2024)
by: Wu, Junhong, et al.
Published: (2024)
SimulPL: Aligning Human Preferences in Simultaneous Machine Translation
by: Yu, Donglei, et al.
Published: (2025)
by: Yu, Donglei, et al.
Published: (2025)
DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding
by: Zhang, Hongzhi, et al.
Published: (2025)
by: Zhang, Hongzhi, et al.
Published: (2025)
Learning Faster with Better Tokens: Parameter-Efficient Vocabulary Adaptation for Specialized Text Summarization
by: Balde, Gunjan, et al.
Published: (2026)
by: Balde, Gunjan, et al.
Published: (2026)
A Survey of Large Language Models in Discipline-specific Research: Challenges, Methods and Opportunities
by: Xiang, Lu, et al.
Published: (2025)
by: Xiang, Lu, et al.
Published: (2025)
SweetieChat: A Strategy-Enhanced Role-playing Framework for Diverse Scenarios Handling Emotional Support Agent
by: Ye, Jing, et al.
Published: (2024)
by: Ye, Jing, et al.
Published: (2024)
Component-Level Lesioning of Language Models Reveals Clinically Aligned Aphasia Phenotypes
by: Wang, Yifan, et al.
Published: (2026)
by: Wang, Yifan, et al.
Published: (2026)
EmoHarbor: Evaluating Personalized Emotional Support by Simulating the User's Internal World
by: Ye, Jing, et al.
Published: (2026)
by: Ye, Jing, et al.
Published: (2026)
BLSP-Emo: Towards Empathetic Large Speech-Language Models
by: Wang, Chen, et al.
Published: (2024)
by: Wang, Chen, et al.
Published: (2024)
Adaptive BPE Tokenization for Enhanced Vocabulary Adaptation in Finetuning Pretrained Language Models
by: Balde, Gunjan, et al.
Published: (2024)
by: Balde, Gunjan, et al.
Published: (2024)
Boosting LLM Translation Skills without General Ability Loss via Rationale Distillation
by: Wu, Junhong, et al.
Published: (2024)
by: Wu, Junhong, et al.
Published: (2024)
ChineseWebText 2.0: Large-Scale High-quality Chinese Web Text with Multi-dimensional and fine-grained information
by: Zhang, Wanyue, et al.
Published: (2024)
by: Zhang, Wanyue, et al.
Published: (2024)
PairAlign: A Framework for Sequence Tokenization via Self-Alignment with Applications to Audio Tokenization
by: Banerjee, Adhiraj, et al.
Published: (2026)
by: Banerjee, Adhiraj, et al.
Published: (2026)
PreAlign: Boosting Cross-Lingual Transfer by Early Establishment of Multilingual Alignment
by: Li, Jiahuan, et al.
Published: (2024)
by: Li, Jiahuan, et al.
Published: (2024)
Optimizing LLMs for Italian: Reducing Token Fertility and Enhancing Efficiency Through Vocabulary Adaptation
by: Moroni, Luca, et al.
Published: (2025)
by: Moroni, Luca, et al.
Published: (2025)
Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation
by: Liang, Yupu, et al.
Published: (2025)
by: Liang, Yupu, et al.
Published: (2025)
ReTok: Replacing Tokenizer to Enhance Representation Efficiency in Large Language Model
by: Gu, Shuhao, et al.
Published: (2024)
by: Gu, Shuhao, et al.
Published: (2024)
MorphTok: Morphologically Grounded Tokenization for Indian Languages
by: Brahma, Maharaj, et al.
Published: (2025)
by: Brahma, Maharaj, et al.
Published: (2025)
BPE Gets Picky: Efficient Vocabulary Refinement During Tokenizer Training
by: Chizhov, Pavel, et al.
Published: (2024)
by: Chizhov, Pavel, et al.
Published: (2024)
Enhancing Knowledge Distillation of Large Language Models through Efficient Multi-Modal Distribution Alignment
by: Peng, Tianyu, et al.
Published: (2024)
by: Peng, Tianyu, et al.
Published: (2024)
Bridging the Gap between Different Vocabularies for LLM Ensemble
by: Xu, Yangyifan, et al.
Published: (2024)
by: Xu, Yangyifan, et al.
Published: (2024)
TROVE: A Challenge for Fine-Grained Text Provenance via Source Sentence Tracing and Relationship Classification
by: Zhu, Junnan, et al.
Published: (2025)
by: Zhu, Junnan, et al.
Published: (2025)
AlignDistil: Token-Level Language Model Alignment as Adaptive Policy Distillation
by: Zhang, Songming, et al.
Published: (2025)
by: Zhang, Songming, et al.
Published: (2025)
Self-Modifying State Modeling for Simultaneous Machine Translation
by: Yu, Donglei, et al.
Published: (2024)
by: Yu, Donglei, et al.
Published: (2024)
TokMem: One-Token Procedural Memory for Large Language Models
by: Wu, Zijun, et al.
Published: (2025)
by: Wu, Zijun, et al.
Published: (2025)
CoT2Align: Cross-Chain of Thought Distillation via Optimal Transport Alignment for Language Models with Different Tokenizers
by: Le, Anh Duc, et al.
Published: (2025)
by: Le, Anh Duc, et al.
Published: (2025)
Robust Reasoning via Dynamic Token Selection for Distribution-Aligned Self-Distillation
by: Zhang, Ruiqi, et al.
Published: (2026)
by: Zhang, Ruiqi, et al.
Published: (2026)
Similar Items
-
TokAlign++: Advancing Vocabulary Adaptation via Better Token Alignment
by: Li, Chong, et al.
Published: (2026) -
Improving In-context Learning of Multilingual Generative Language Models with Cross-lingual Alignment
by: Li, Chong, et al.
Published: (2023) -
Group then Scale: Dynamic Mixture-of-Experts Multilingual Language Model
by: Li, Chong, et al.
Published: (2025) -
Implicit Cross-Lingual Rewarding for Efficient Multilingual Preference Alignment
by: Yang, Wen, et al.
Published: (2025) -
X-Instruction: Aligning Language Model in Low-resource Languages with Self-curated Cross-lingual Instructions
by: Li, Chong, et al.
Published: (2024)