Beyond Next-Token Alignment: Distilling Multimodal Large Language Models via Token Interactions
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Chen, Lin, Zhao, Xiaoke, Ding, Kun, Feng, Weiwei, Miao, Changtao, Wang, Zili, Guo, Wenxuan, Wang, Ying, Zheng, Kaiyuan, Zhang, Bo, Li, Zhe, Xiang, Shiming |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Joint Training of Multi-Token Prediction in Reinforcement Learning via Optimal Coefficient Calibration
von: Wang, Zili, et al.
Veröffentlicht: (2026)
von: Wang, Zili, et al.
Veröffentlicht: (2026)
Beyond Sequential Distance: Inter-Modal Distance Invariant Position Encoding
von: Chen, Lin, et al.
Veröffentlicht: (2026)
von: Chen, Lin, et al.
Veröffentlicht: (2026)
TRACE: Distilling Where It Matters via Token-Routed Self On-Policy Alignment
von: Wang, Jiaxuan, et al.
Veröffentlicht: (2026)
von: Wang, Jiaxuan, et al.
Veröffentlicht: (2026)
EvoVLMA: Evolutionary Vision-Language Model Adaptation
von: Ding, Kun, et al.
Veröffentlicht: (2025)
von: Ding, Kun, et al.
Veröffentlicht: (2025)
Enhanced Graph Transformer with Serialized Graph Tokens
von: Wang, Ruixiang, et al.
Veröffentlicht: (2026)
von: Wang, Ruixiang, et al.
Veröffentlicht: (2026)
EM-KD: Distilling Efficient Multimodal Large Language Model with Unbalanced Vision Tokens
von: Feng, Ze, et al.
Veröffentlicht: (2025)
von: Feng, Ze, et al.
Veröffentlicht: (2025)
Multimodal Latent Language Modeling with Next-Token Diffusion
von: Sun, Yutao, et al.
Veröffentlicht: (2024)
von: Sun, Yutao, et al.
Veröffentlicht: (2024)
Continuous Speculative Decoding for Autoregressive Image Generation
von: Wang, Zili, et al.
Veröffentlicht: (2024)
von: Wang, Zili, et al.
Veröffentlicht: (2024)
QAPruner: Quantization-Aware Vision Token Pruning for Multimodal Large Language Models
von: Wang, Xinhao, et al.
Veröffentlicht: (2026)
von: Wang, Xinhao, et al.
Veröffentlicht: (2026)
Training LLMs Beyond Next Token Prediction -- Filling the Mutual Information Gap
von: Yang, Chun-Hao, et al.
Veröffentlicht: (2025)
von: Yang, Chun-Hao, et al.
Veröffentlicht: (2025)
A Survey of Low-shot Vision-Language Model Adaptation via Representer Theorem
von: Ding, Kun, et al.
Veröffentlicht: (2024)
von: Ding, Kun, et al.
Veröffentlicht: (2024)
Beyond the Next Token: Towards Prompt-Robust Zero-Shot Classification via Efficient Multi-Token Prediction
von: Qian, Junlang, et al.
Veröffentlicht: (2025)
von: Qian, Junlang, et al.
Veröffentlicht: (2025)
Next Token Is Enough: Realistic Image Quality and Aesthetic Scoring with Multimodal Large Language Model
von: Li, Mingxing, et al.
Veröffentlicht: (2025)
von: Li, Mingxing, et al.
Veröffentlicht: (2025)
Beyond Next-Token: Next-X Prediction for Autoregressive Visual Generation
von: Ren, Sucheng, et al.
Veröffentlicht: (2025)
von: Ren, Sucheng, et al.
Veröffentlicht: (2025)
Beyond Next Token Prediction: Patch-Level Training for Large Language Models
von: Shao, Chenze, et al.
Veröffentlicht: (2024)
von: Shao, Chenze, et al.
Veröffentlicht: (2024)
TokenCompose: Text-to-Image Diffusion with Token-level Supervision
von: Wang, Zirui, et al.
Veröffentlicht: (2023)
von: Wang, Zirui, et al.
Veröffentlicht: (2023)
SimCT: Recovering Lost Supervision for Cross-Tokenizer On-Policy Distillation
von: Sun, Jie, et al.
Veröffentlicht: (2026)
von: Sun, Jie, et al.
Veröffentlicht: (2026)
LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token
von: Zhang, Shaolei, et al.
Veröffentlicht: (2025)
von: Zhang, Shaolei, et al.
Veröffentlicht: (2025)
Cautious Next Token Prediction
von: Wang, Yizhou, et al.
Veröffentlicht: (2025)
von: Wang, Yizhou, et al.
Veröffentlicht: (2025)
Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction
von: Yang, Shu-wen, et al.
Veröffentlicht: (2025)
von: Yang, Shu-wen, et al.
Veröffentlicht: (2025)
ViRC: Enhancing Visual Interleaved Mathematical CoT with Reason Chunking
von: Wang, Lihong, et al.
Veröffentlicht: (2025)
von: Wang, Lihong, et al.
Veröffentlicht: (2025)
AlignDistil: Token-Level Language Model Alignment as Adaptive Policy Distillation
von: Zhang, Songming, et al.
Veröffentlicht: (2025)
von: Zhang, Songming, et al.
Veröffentlicht: (2025)
Grounding Everything in Tokens for Multimodal Large Language Models
von: Ren, Xiangxuan, et al.
Veröffentlicht: (2025)
von: Ren, Xiangxuan, et al.
Veröffentlicht: (2025)
Token Activation Map to Visually Explain Multimodal LLMs
von: Li, Yi, et al.
Veröffentlicht: (2025)
von: Li, Yi, et al.
Veröffentlicht: (2025)
DM-Codec: Distilling Multimodal Representations for Speech Tokenization
von: Ahasan, Md Mubtasim, et al.
Veröffentlicht: (2024)
von: Ahasan, Md Mubtasim, et al.
Veröffentlicht: (2024)
TrimTokenator-LC: Towards Adaptive Visual Token Pruning for Large Multimodal Models with Long Contexts
von: Zhang, Hao, et al.
Veröffentlicht: (2025)
von: Zhang, Hao, et al.
Veröffentlicht: (2025)
TokenHSI: Unified Synthesis of Physical Human-Scene Interactions through Task Tokenization
von: Pan, Liang, et al.
Veröffentlicht: (2025)
von: Pan, Liang, et al.
Veröffentlicht: (2025)
Diversity or Precision? A Deep Dive into Next Token Prediction
von: Wu, Haoyuan, et al.
Veröffentlicht: (2025)
von: Wu, Haoyuan, et al.
Veröffentlicht: (2025)
Beyond GSD-as-Token: Continuous Scale Conditioning for Remote Sensing VLMs
von: Zhang, Song, et al.
Veröffentlicht: (2026)
von: Zhang, Song, et al.
Veröffentlicht: (2026)
Visual-Guided Key-Token Regularization for Multimodal Large Language Model Unlearning
von: Cai, Chengyi, et al.
Veröffentlicht: (2026)
von: Cai, Chengyi, et al.
Veröffentlicht: (2026)
Tokenizing 3D Molecule Structure with Quantized Spherical Coordinates
von: Gao, Kaiyuan, et al.
Veröffentlicht: (2024)
von: Gao, Kaiyuan, et al.
Veröffentlicht: (2024)
Balanced Token Pruning: Accelerating Vision Language Models Beyond Local Optimization
von: Li, Kaiyuan, et al.
Veröffentlicht: (2025)
von: Li, Kaiyuan, et al.
Veröffentlicht: (2025)
Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey
von: Chen, Liang, et al.
Veröffentlicht: (2024)
von: Chen, Liang, et al.
Veröffentlicht: (2024)
Accelerating Multimodal Large Language Models by Searching Optimal Vision Token Reduction
von: Zhao, Shiyu, et al.
Veröffentlicht: (2024)
von: Zhao, Shiyu, et al.
Veröffentlicht: (2024)
Next Tokens Denoising for Speech Synthesis
von: Liu, Yanqing, et al.
Veröffentlicht: (2025)
von: Liu, Yanqing, et al.
Veröffentlicht: (2025)
InfEngine: A Self-Verifying and Self-Optimizing Intelligent Engine for Infrared Radiation Computing
von: Ding, Kun, et al.
Veröffentlicht: (2026)
von: Ding, Kun, et al.
Veröffentlicht: (2026)
Probabilistic Token Alignment for Large Language Model Fusion
von: Zeng, Runjia, et al.
Veröffentlicht: (2025)
von: Zeng, Runjia, et al.
Veröffentlicht: (2025)
Self-Distillation for Multi-Token Prediction
von: Zhao, Guoliang, et al.
Veröffentlicht: (2026)
von: Zhao, Guoliang, et al.
Veröffentlicht: (2026)
Tokenization Matters! Degrading Large Language Models through Challenging Their Tokenization
von: Wang, Dixuan, et al.
Veröffentlicht: (2024)
von: Wang, Dixuan, et al.
Veröffentlicht: (2024)
TIP: Token Importance in On-Policy Distillation
von: Xu, Yuanda, et al.
Veröffentlicht: (2026)
von: Xu, Yuanda, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Joint Training of Multi-Token Prediction in Reinforcement Learning via Optimal Coefficient Calibration
von: Wang, Zili, et al.
Veröffentlicht: (2026) -
Beyond Sequential Distance: Inter-Modal Distance Invariant Position Encoding
von: Chen, Lin, et al.
Veröffentlicht: (2026) -
TRACE: Distilling Where It Matters via Token-Routed Self On-Policy Alignment
von: Wang, Jiaxuan, et al.
Veröffentlicht: (2026) -
EvoVLMA: Evolutionary Vision-Language Model Adaptation
von: Ding, Kun, et al.
Veröffentlicht: (2025) -
Enhanced Graph Transformer with Serialized Graph Tokens
von: Wang, Ruixiang, et al.
Veröffentlicht: (2026)