Enhancing Cross-Tokenizer Knowledge Distillation with Contextual Dynamical Mapping
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Yijie, Liu, Yijin, Meng, Fandong, Chen, Yufeng, Xu, Jinan, Zhou, Jie |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Warmup-Distill: Bridge the Distribution Mismatch between Teacher and Student before Knowledge Distillation
di: Sun, Zengkui, et al.
Pubblicazione: (2025)
di: Sun, Zengkui, et al.
Pubblicazione: (2025)
Beyond Binary Gender: Evaluating Gender-Inclusive Machine Translation with Ambiguous Attitude Words
di: Chen, Yijie, et al.
Pubblicazione: (2024)
di: Chen, Yijie, et al.
Pubblicazione: (2024)
Comments as Natural Logic Pivots: Improve Code Generation via Comment Perspective
di: Chen, Yijie, et al.
Pubblicazione: (2024)
di: Chen, Yijie, et al.
Pubblicazione: (2024)
Outdated Issue Aware Decoding for Reasoning Questions on Edited Knowledge
di: Sun, Zengkui, et al.
Pubblicazione: (2024)
di: Sun, Zengkui, et al.
Pubblicazione: (2024)
LCS: A Language Converter Strategy for Zero-Shot Neural Machine Translation
di: Sun, Zengkui, et al.
Pubblicazione: (2024)
di: Sun, Zengkui, et al.
Pubblicazione: (2024)
SED-SFT: Selectively Encouraging Diversity in Supervised Fine-Tuning
di: Chen, Yijie, et al.
Pubblicazione: (2026)
di: Chen, Yijie, et al.
Pubblicazione: (2026)
A Dual-Space Framework for General Knowledge Distillation of Large Language Models
di: Zhang, Xue, et al.
Pubblicazione: (2025)
di: Zhang, Xue, et al.
Pubblicazione: (2025)
Multilingual Knowledge Editing with Language-Agnostic Factual Neurons
di: Zhang, Xue, et al.
Pubblicazione: (2024)
di: Zhang, Xue, et al.
Pubblicazione: (2024)
Accelerating Inference in Large Language Models with a Unified Layer Skipping Strategy
di: Liu, Yijin, et al.
Pubblicazione: (2024)
di: Liu, Yijin, et al.
Pubblicazione: (2024)
Think Natively: Unlocking Multilingual Reasoning with Consistency-Enhanced Reinforcement Learning
di: Zhang, Xue, et al.
Pubblicazione: (2025)
di: Zhang, Xue, et al.
Pubblicazione: (2025)
Less, but Better: Efficient Multilingual Expansion for LLMs via Layer-wise Mixture-of-Experts
di: Zhang, Xue, et al.
Pubblicazione: (2025)
di: Zhang, Xue, et al.
Pubblicazione: (2025)
CM-Align: Consistency-based Multilingual Alignment for Large Language Models
di: Zhang, Xue, et al.
Pubblicazione: (2025)
di: Zhang, Xue, et al.
Pubblicazione: (2025)
Dual-Space Knowledge Distillation for Large Language Models
di: Zhang, Songming, et al.
Pubblicazione: (2024)
di: Zhang, Songming, et al.
Pubblicazione: (2024)
Language Generation with Strictly Proper Scoring Rules
di: Shao, Chenze, et al.
Pubblicazione: (2024)
di: Shao, Chenze, et al.
Pubblicazione: (2024)
AlignDistil: Token-Level Language Model Alignment as Adaptive Policy Distillation
di: Zhang, Songming, et al.
Pubblicazione: (2025)
di: Zhang, Songming, et al.
Pubblicazione: (2025)
MiniPLM: Knowledge Distillation for Pre-Training Language Models
di: Gu, Yuxian, et al.
Pubblicazione: (2024)
di: Gu, Yuxian, et al.
Pubblicazione: (2024)
D2C: Unlocking the Potential of Continuous Autoregressive Image Generation with Discrete Tokens
di: Wang, Panpan, et al.
Pubblicazione: (2025)
di: Wang, Panpan, et al.
Pubblicazione: (2025)
Towards Understanding and Improving Knowledge Distillation for Neural Machine Translation
di: Zhang, Songming, et al.
Pubblicazione: (2023)
di: Zhang, Songming, et al.
Pubblicazione: (2023)
KDFlow: A User-Friendly and Efficient Knowledge Distillation Framework for Large Language Models
di: Zhang, Songming, et al.
Pubblicazione: (2026)
di: Zhang, Songming, et al.
Pubblicazione: (2026)
Figure It Out: Improve the Frontier of Reasoning with Executable Visual States
di: Chen, Meiqi, et al.
Pubblicazione: (2025)
di: Chen, Meiqi, et al.
Pubblicazione: (2025)
Beyond Next Token Prediction: Patch-Level Training for Large Language Models
di: Shao, Chenze, et al.
Pubblicazione: (2024)
di: Shao, Chenze, et al.
Pubblicazione: (2024)
TEAL: Tokenize and Embed ALL for Multi-modal Large Language Models
di: Yang, Zhen, et al.
Pubblicazione: (2023)
di: Yang, Zhen, et al.
Pubblicazione: (2023)
ExTrans: Multilingual Deep Reasoning Translation via Exemplar-Enhanced Reinforcement Learning
di: Wang, Jiaan, et al.
Pubblicazione: (2025)
di: Wang, Jiaan, et al.
Pubblicazione: (2025)
Retrieval-Augmented Machine Translation with Unstructured Knowledge
di: Wang, Jiaan, et al.
Pubblicazione: (2024)
di: Wang, Jiaan, et al.
Pubblicazione: (2024)
CRAT: A Multi-Agent Framework for Causality-Enhanced Reflective and Retrieval-Augmented Translation with Large Language Models
di: Chen, Meiqi, et al.
Pubblicazione: (2024)
di: Chen, Meiqi, et al.
Pubblicazione: (2024)
Multi-Aspect Knowledge Distillation for Language Model with Low-rank Factorization
di: Liu, Zihe, et al.
Pubblicazione: (2026)
di: Liu, Zihe, et al.
Pubblicazione: (2026)
Towards Faster k-Nearest-Neighbor Machine Translation
di: Shi, Xiangyu, et al.
Pubblicazione: (2023)
di: Shi, Xiangyu, et al.
Pubblicazione: (2023)
THOR-MoE: Hierarchical Task-Guided and Context-Responsive Routing for Neural Machine Translation
di: Liang, Yunlong, et al.
Pubblicazione: (2025)
di: Liang, Yunlong, et al.
Pubblicazione: (2025)
TransportationGames: Benchmarking Transportation Knowledge of (Multimodal) Large Language Models
di: Zhang, Xue, et al.
Pubblicazione: (2024)
di: Zhang, Xue, et al.
Pubblicazione: (2024)
X-Token: Projection-Guided Cross-Tokenizer Knowledge Distillation
di: Sreenivas, Sharath Turuvekere, et al.
Pubblicazione: (2026)
di: Sreenivas, Sharath Turuvekere, et al.
Pubblicazione: (2026)
Cross-Lingual Knowledge Editing in Large Language Models
di: Wang, Jiaan, et al.
Pubblicazione: (2023)
di: Wang, Jiaan, et al.
Pubblicazione: (2023)
DeepTrans: Deep Reasoning Translation via Reinforcement Learning
di: Wang, Jiaan, et al.
Pubblicazione: (2025)
di: Wang, Jiaan, et al.
Pubblicazione: (2025)
CSCD-NS: a Chinese Spelling Check Dataset for Native Speakers
di: Hu, Yong, et al.
Pubblicazione: (2022)
di: Hu, Yong, et al.
Pubblicazione: (2022)
EAG: Extract and Generate Multi-way Aligned Corpus for Complete Multi-lingual Neural Machine Translation
di: Xu, Yulin, et al.
Pubblicazione: (2022)
di: Xu, Yulin, et al.
Pubblicazione: (2022)
Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models
di: Cui, Xiao, et al.
Pubblicazione: (2024)
di: Cui, Xiao, et al.
Pubblicazione: (2024)
Investigating Cross-Modal Skill Injection: Scenarios, Methods, and Hyperparameters
di: Xu, Zhiyu, et al.
Pubblicazione: (2026)
di: Xu, Zhiyu, et al.
Pubblicazione: (2026)
Contextualization Distillation from Large Language Model for Knowledge Graph Completion
di: Li, Dawei, et al.
Pubblicazione: (2024)
di: Li, Dawei, et al.
Pubblicazione: (2024)
SlangDIT: Benchmarking LLMs in Interpretative Slang Translation
di: Liang, Yunlong, et al.
Pubblicazione: (2025)
di: Liang, Yunlong, et al.
Pubblicazione: (2025)
TIM: Teaching Large Language Models to Translate with Comparison
di: Zeng, Jiali, et al.
Pubblicazione: (2023)
di: Zeng, Jiali, et al.
Pubblicazione: (2023)
Improving Machine Translation with Large Language Models: A Preliminary Study with Cooperative Decoding
di: Zeng, Jiali, et al.
Pubblicazione: (2023)
di: Zeng, Jiali, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Warmup-Distill: Bridge the Distribution Mismatch between Teacher and Student before Knowledge Distillation
di: Sun, Zengkui, et al.
Pubblicazione: (2025) -
Beyond Binary Gender: Evaluating Gender-Inclusive Machine Translation with Ambiguous Attitude Words
di: Chen, Yijie, et al.
Pubblicazione: (2024) -
Comments as Natural Logic Pivots: Improve Code Generation via Comment Perspective
di: Chen, Yijie, et al.
Pubblicazione: (2024) -
Outdated Issue Aware Decoding for Reasoning Questions on Edited Knowledge
di: Sun, Zengkui, et al.
Pubblicazione: (2024) -
LCS: A Language Converter Strategy for Zero-Shot Neural Machine Translation
di: Sun, Zengkui, et al.
Pubblicazione: (2024)