Beyond Next-Token Alignment: Distilling Multimodal Large Language Models via Token Interactions
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Lin, Zhao, Xiaoke, Ding, Kun, Feng, Weiwei, Miao, Changtao, Wang, Zili, Guo, Wenxuan, Wang, Ying, Zheng, Kaiyuan, Zhang, Bo, Li, Zhe, Xiang, Shiming |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Joint Training of Multi-Token Prediction in Reinforcement Learning via Optimal Coefficient Calibration
di: Wang, Zili, et al.
Pubblicazione: (2026)
di: Wang, Zili, et al.
Pubblicazione: (2026)
Beyond Sequential Distance: Inter-Modal Distance Invariant Position Encoding
di: Chen, Lin, et al.
Pubblicazione: (2026)
di: Chen, Lin, et al.
Pubblicazione: (2026)
TRACE: Distilling Where It Matters via Token-Routed Self On-Policy Alignment
di: Wang, Jiaxuan, et al.
Pubblicazione: (2026)
di: Wang, Jiaxuan, et al.
Pubblicazione: (2026)
EvoVLMA: Evolutionary Vision-Language Model Adaptation
di: Ding, Kun, et al.
Pubblicazione: (2025)
di: Ding, Kun, et al.
Pubblicazione: (2025)
Enhanced Graph Transformer with Serialized Graph Tokens
di: Wang, Ruixiang, et al.
Pubblicazione: (2026)
di: Wang, Ruixiang, et al.
Pubblicazione: (2026)
EM-KD: Distilling Efficient Multimodal Large Language Model with Unbalanced Vision Tokens
di: Feng, Ze, et al.
Pubblicazione: (2025)
di: Feng, Ze, et al.
Pubblicazione: (2025)
Multimodal Latent Language Modeling with Next-Token Diffusion
di: Sun, Yutao, et al.
Pubblicazione: (2024)
di: Sun, Yutao, et al.
Pubblicazione: (2024)
Continuous Speculative Decoding for Autoregressive Image Generation
di: Wang, Zili, et al.
Pubblicazione: (2024)
di: Wang, Zili, et al.
Pubblicazione: (2024)
QAPruner: Quantization-Aware Vision Token Pruning for Multimodal Large Language Models
di: Wang, Xinhao, et al.
Pubblicazione: (2026)
di: Wang, Xinhao, et al.
Pubblicazione: (2026)
Training LLMs Beyond Next Token Prediction -- Filling the Mutual Information Gap
di: Yang, Chun-Hao, et al.
Pubblicazione: (2025)
di: Yang, Chun-Hao, et al.
Pubblicazione: (2025)
A Survey of Low-shot Vision-Language Model Adaptation via Representer Theorem
di: Ding, Kun, et al.
Pubblicazione: (2024)
di: Ding, Kun, et al.
Pubblicazione: (2024)
Beyond the Next Token: Towards Prompt-Robust Zero-Shot Classification via Efficient Multi-Token Prediction
di: Qian, Junlang, et al.
Pubblicazione: (2025)
di: Qian, Junlang, et al.
Pubblicazione: (2025)
Next Token Is Enough: Realistic Image Quality and Aesthetic Scoring with Multimodal Large Language Model
di: Li, Mingxing, et al.
Pubblicazione: (2025)
di: Li, Mingxing, et al.
Pubblicazione: (2025)
Beyond Next-Token: Next-X Prediction for Autoregressive Visual Generation
di: Ren, Sucheng, et al.
Pubblicazione: (2025)
di: Ren, Sucheng, et al.
Pubblicazione: (2025)
Beyond Next Token Prediction: Patch-Level Training for Large Language Models
di: Shao, Chenze, et al.
Pubblicazione: (2024)
di: Shao, Chenze, et al.
Pubblicazione: (2024)
TokenCompose: Text-to-Image Diffusion with Token-level Supervision
di: Wang, Zirui, et al.
Pubblicazione: (2023)
di: Wang, Zirui, et al.
Pubblicazione: (2023)
SimCT: Recovering Lost Supervision for Cross-Tokenizer On-Policy Distillation
di: Sun, Jie, et al.
Pubblicazione: (2026)
di: Sun, Jie, et al.
Pubblicazione: (2026)
LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token
di: Zhang, Shaolei, et al.
Pubblicazione: (2025)
di: Zhang, Shaolei, et al.
Pubblicazione: (2025)
Cautious Next Token Prediction
di: Wang, Yizhou, et al.
Pubblicazione: (2025)
di: Wang, Yizhou, et al.
Pubblicazione: (2025)
Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction
di: Yang, Shu-wen, et al.
Pubblicazione: (2025)
di: Yang, Shu-wen, et al.
Pubblicazione: (2025)
ViRC: Enhancing Visual Interleaved Mathematical CoT with Reason Chunking
di: Wang, Lihong, et al.
Pubblicazione: (2025)
di: Wang, Lihong, et al.
Pubblicazione: (2025)
AlignDistil: Token-Level Language Model Alignment as Adaptive Policy Distillation
di: Zhang, Songming, et al.
Pubblicazione: (2025)
di: Zhang, Songming, et al.
Pubblicazione: (2025)
Grounding Everything in Tokens for Multimodal Large Language Models
di: Ren, Xiangxuan, et al.
Pubblicazione: (2025)
di: Ren, Xiangxuan, et al.
Pubblicazione: (2025)
Token Activation Map to Visually Explain Multimodal LLMs
di: Li, Yi, et al.
Pubblicazione: (2025)
di: Li, Yi, et al.
Pubblicazione: (2025)
DM-Codec: Distilling Multimodal Representations for Speech Tokenization
di: Ahasan, Md Mubtasim, et al.
Pubblicazione: (2024)
di: Ahasan, Md Mubtasim, et al.
Pubblicazione: (2024)
TrimTokenator-LC: Towards Adaptive Visual Token Pruning for Large Multimodal Models with Long Contexts
di: Zhang, Hao, et al.
Pubblicazione: (2025)
di: Zhang, Hao, et al.
Pubblicazione: (2025)
TokenHSI: Unified Synthesis of Physical Human-Scene Interactions through Task Tokenization
di: Pan, Liang, et al.
Pubblicazione: (2025)
di: Pan, Liang, et al.
Pubblicazione: (2025)
Diversity or Precision? A Deep Dive into Next Token Prediction
di: Wu, Haoyuan, et al.
Pubblicazione: (2025)
di: Wu, Haoyuan, et al.
Pubblicazione: (2025)
Beyond GSD-as-Token: Continuous Scale Conditioning for Remote Sensing VLMs
di: Zhang, Song, et al.
Pubblicazione: (2026)
di: Zhang, Song, et al.
Pubblicazione: (2026)
Visual-Guided Key-Token Regularization for Multimodal Large Language Model Unlearning
di: Cai, Chengyi, et al.
Pubblicazione: (2026)
di: Cai, Chengyi, et al.
Pubblicazione: (2026)
Tokenizing 3D Molecule Structure with Quantized Spherical Coordinates
di: Gao, Kaiyuan, et al.
Pubblicazione: (2024)
di: Gao, Kaiyuan, et al.
Pubblicazione: (2024)
Balanced Token Pruning: Accelerating Vision Language Models Beyond Local Optimization
di: Li, Kaiyuan, et al.
Pubblicazione: (2025)
di: Li, Kaiyuan, et al.
Pubblicazione: (2025)
Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey
di: Chen, Liang, et al.
Pubblicazione: (2024)
di: Chen, Liang, et al.
Pubblicazione: (2024)
Accelerating Multimodal Large Language Models by Searching Optimal Vision Token Reduction
di: Zhao, Shiyu, et al.
Pubblicazione: (2024)
di: Zhao, Shiyu, et al.
Pubblicazione: (2024)
Next Tokens Denoising for Speech Synthesis
di: Liu, Yanqing, et al.
Pubblicazione: (2025)
di: Liu, Yanqing, et al.
Pubblicazione: (2025)
InfEngine: A Self-Verifying and Self-Optimizing Intelligent Engine for Infrared Radiation Computing
di: Ding, Kun, et al.
Pubblicazione: (2026)
di: Ding, Kun, et al.
Pubblicazione: (2026)
Probabilistic Token Alignment for Large Language Model Fusion
di: Zeng, Runjia, et al.
Pubblicazione: (2025)
di: Zeng, Runjia, et al.
Pubblicazione: (2025)
Self-Distillation for Multi-Token Prediction
di: Zhao, Guoliang, et al.
Pubblicazione: (2026)
di: Zhao, Guoliang, et al.
Pubblicazione: (2026)
Tokenization Matters! Degrading Large Language Models through Challenging Their Tokenization
di: Wang, Dixuan, et al.
Pubblicazione: (2024)
di: Wang, Dixuan, et al.
Pubblicazione: (2024)
TIP: Token Importance in On-Policy Distillation
di: Xu, Yuanda, et al.
Pubblicazione: (2026)
di: Xu, Yuanda, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Joint Training of Multi-Token Prediction in Reinforcement Learning via Optimal Coefficient Calibration
di: Wang, Zili, et al.
Pubblicazione: (2026) -
Beyond Sequential Distance: Inter-Modal Distance Invariant Position Encoding
di: Chen, Lin, et al.
Pubblicazione: (2026) -
TRACE: Distilling Where It Matters via Token-Routed Self On-Policy Alignment
di: Wang, Jiaxuan, et al.
Pubblicazione: (2026) -
EvoVLMA: Evolutionary Vision-Language Model Adaptation
di: Ding, Kun, et al.
Pubblicazione: (2025) -
Enhanced Graph Transformer with Serialized Graph Tokens
di: Wang, Ruixiang, et al.
Pubblicazione: (2026)