TokAlign++: Advancing Vocabulary Adaptation via Better Token Alignment
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Chong, Deng, Yingzhuo, Yang, Wen, Zhang, Jiajun, Zong, Chengqing |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
TokAlign: Efficient Vocabulary Adaptation via Token Alignment
par: Li, Chong, et autres
Publié: (2025)
par: Li, Chong, et autres
Publié: (2025)
Group then Scale: Dynamic Mixture-of-Experts Multilingual Language Model
par: Li, Chong, et autres
Publié: (2025)
par: Li, Chong, et autres
Publié: (2025)
Improving In-context Learning of Multilingual Generative Language Models with Cross-lingual Alignment
par: Li, Chong, et autres
Publié: (2023)
par: Li, Chong, et autres
Publié: (2023)
X-Instruction: Aligning Language Model in Low-resource Languages with Self-curated Cross-lingual Instructions
par: Li, Chong, et autres
Publié: (2024)
par: Li, Chong, et autres
Publié: (2024)
Parallel Scaling Law: Unveiling Reasoning Generalization through A Cross-Linguistic Perspective
par: Yang, Wen, et autres
Publié: (2025)
par: Yang, Wen, et autres
Publié: (2025)
Implicit Cross-Lingual Rewarding for Efficient Multilingual Preference Alignment
par: Yang, Wen, et autres
Publié: (2025)
par: Yang, Wen, et autres
Publié: (2025)
Decoding the Multimodal Mind: Generalizable Brain-to-Text Translation via Multimodal Alignment and Adaptive Routing
par: Ye, Chunyu, et autres
Publié: (2025)
par: Ye, Chunyu, et autres
Publié: (2025)
Language Imbalance Driven Rewarding for Multilingual Self-improving
par: Yang, Wen, et autres
Publié: (2024)
par: Yang, Wen, et autres
Publié: (2024)
From Generic Empathy to Personalized Emotional Support: A Self-Evolution Framework for User Preference Alignment
par: Ye, Jing, et autres
Publié: (2025)
par: Ye, Jing, et autres
Publié: (2025)
MulCogBench: A Multi-modal Cognitive Benchmark Dataset for Evaluating Chinese and English Computational Language Models
par: Zhang, Yunhao, et autres
Publié: (2024)
par: Zhang, Yunhao, et autres
Publié: (2024)
Navigating Brain Language Representations: A Comparative Analysis of Neural Language Models and Psychologically Plausible Models
par: Zhang, Yunhao, et autres
Publié: (2024)
par: Zhang, Yunhao, et autres
Publié: (2024)
Learning Faster with Better Tokens: Parameter-Efficient Vocabulary Adaptation for Specialized Text Summarization
par: Balde, Gunjan, et autres
Publié: (2026)
par: Balde, Gunjan, et autres
Publié: (2026)
BLSP: Bootstrapping Language-Speech Pre-training via Behavior Alignment of Continuation Writing
par: Wang, Chen, et autres
Publié: (2023)
par: Wang, Chen, et autres
Publié: (2023)
SimulPL: Aligning Human Preferences in Simultaneous Machine Translation
par: Yu, Donglei, et autres
Publié: (2025)
par: Yu, Donglei, et autres
Publié: (2025)
ChineseWebText 2.0: Large-Scale High-quality Chinese Web Text with Multi-dimensional and fine-grained information
par: Zhang, Wanyue, et autres
Publié: (2024)
par: Zhang, Wanyue, et autres
Publié: (2024)
Discovering Semantic Subdimensions through Disentangled Conceptual Representations
par: Zhang, Yunhao, et autres
Publié: (2025)
par: Zhang, Yunhao, et autres
Publié: (2025)
A Survey of Large Language Models in Discipline-specific Research: Challenges, Methods and Opportunities
par: Xiang, Lu, et autres
Publié: (2025)
par: Xiang, Lu, et autres
Publié: (2025)
F-MALLOC: Feed-forward Memory Allocation for Continual Learning in Neural Machine Translation
par: Wu, Junhong, et autres
Publié: (2024)
par: Wu, Junhong, et autres
Publié: (2024)
Boosting LLM Translation Skills without General Ability Loss via Rationale Distillation
par: Wu, Junhong, et autres
Publié: (2024)
par: Wu, Junhong, et autres
Publié: (2024)
SweetieChat: A Strategy-Enhanced Role-playing Framework for Diverse Scenarios Handling Emotional Support Agent
par: Ye, Jing, et autres
Publié: (2024)
par: Ye, Jing, et autres
Publié: (2024)
Component-Level Lesioning of Language Models Reveals Clinically Aligned Aphasia Phenotypes
par: Wang, Yifan, et autres
Publié: (2026)
par: Wang, Yifan, et autres
Publié: (2026)
Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation
par: Liang, Yupu, et autres
Publié: (2025)
par: Liang, Yupu, et autres
Publié: (2025)
EmoHarbor: Evaluating Personalized Emotional Support by Simulating the User's Internal World
par: Ye, Jing, et autres
Publié: (2026)
par: Ye, Jing, et autres
Publié: (2026)
BLSP-Emo: Towards Empathetic Large Speech-Language Models
par: Wang, Chen, et autres
Publié: (2024)
par: Wang, Chen, et autres
Publié: (2024)
Adaptive BPE Tokenization for Enhanced Vocabulary Adaptation in Finetuning Pretrained Language Models
par: Balde, Gunjan, et autres
Publié: (2024)
par: Balde, Gunjan, et autres
Publié: (2024)
AlignX: Advancing Multilingual Large Language Models with Multilingual Representation Alignment
par: Bu, Mengyu, et autres
Publié: (2025)
par: Bu, Mengyu, et autres
Publié: (2025)
PairAlign: A Framework for Sequence Tokenization via Self-Alignment with Applications to Audio Tokenization
par: Banerjee, Adhiraj, et autres
Publié: (2026)
par: Banerjee, Adhiraj, et autres
Publié: (2026)
PreAlign: Boosting Cross-Lingual Transfer by Early Establishment of Multilingual Alignment
par: Li, Jiahuan, et autres
Publié: (2024)
par: Li, Jiahuan, et autres
Publié: (2024)
Optimizing LLMs for Italian: Reducing Token Fertility and Enhancing Efficiency Through Vocabulary Adaptation
par: Moroni, Luca, et autres
Publié: (2025)
par: Moroni, Luca, et autres
Publié: (2025)
Rethinking Tokenization: Crafting Better Tokenizers for Large Language Models
par: Yang, Jinbiao
Publié: (2024)
par: Yang, Jinbiao
Publié: (2024)
ReTok: Replacing Tokenizer to Enhance Representation Efficiency in Large Language Model
par: Gu, Shuhao, et autres
Publié: (2024)
par: Gu, Shuhao, et autres
Publié: (2024)
OpenS2S: Advancing Fully Open-Source End-to-End Empathetic Large Speech Language Model
par: Wang, Chen, et autres
Publié: (2025)
par: Wang, Chen, et autres
Publié: (2025)
MorphTok: Morphologically Grounded Tokenization for Indian Languages
par: Brahma, Maharaj, et autres
Publié: (2025)
par: Brahma, Maharaj, et autres
Publié: (2025)
Token-level Ensembling of Models with Different Vocabularies
par: Wicks, Rachel, et autres
Publié: (2025)
par: Wicks, Rachel, et autres
Publié: (2025)
Panacea: Pareto Alignment via Preference Adaptation for LLMs
par: Zhong, Yifan, et autres
Publié: (2024)
par: Zhong, Yifan, et autres
Publié: (2024)
Bridging the Gap between Different Vocabularies for LLM Ensemble
par: Xu, Yangyifan, et autres
Publié: (2024)
par: Xu, Yangyifan, et autres
Publié: (2024)
Mix-CPT: A Domain Adaptation Framework via Decoupling Knowledge Learning and Format Alignment
par: Jiang, Jinhao, et autres
Publié: (2024)
par: Jiang, Jinhao, et autres
Publié: (2024)
TROVE: A Challenge for Fine-Grained Text Provenance via Source Sentence Tracing and Relationship Classification
par: Zhu, Junnan, et autres
Publié: (2025)
par: Zhu, Junnan, et autres
Publié: (2025)
DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding
par: Zhang, Hongzhi, et autres
Publié: (2025)
par: Zhang, Hongzhi, et autres
Publié: (2025)
AlignDistil: Token-Level Language Model Alignment as Adaptive Policy Distillation
par: Zhang, Songming, et autres
Publié: (2025)
par: Zhang, Songming, et autres
Publié: (2025)
Documents similaires
-
TokAlign: Efficient Vocabulary Adaptation via Token Alignment
par: Li, Chong, et autres
Publié: (2025) -
Group then Scale: Dynamic Mixture-of-Experts Multilingual Language Model
par: Li, Chong, et autres
Publié: (2025) -
Improving In-context Learning of Multilingual Generative Language Models with Cross-lingual Alignment
par: Li, Chong, et autres
Publié: (2023) -
X-Instruction: Aligning Language Model in Low-resource Languages with Self-curated Cross-lingual Instructions
par: Li, Chong, et autres
Publié: (2024) -
Parallel Scaling Law: Unveiling Reasoning Generalization through A Cross-Linguistic Perspective
par: Yang, Wen, et autres
Publié: (2025)