DREAM: Drafting with Refined Target Features and Entropy-Adaptive Cross-Attention Fusion for Multimodal Speculative Decoding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Hu, Yunhai, Xia, Tianhua, Liu, Zining, Raman, Rahul, Liu, Xingyu, Bao, Bo, Sather, Eric, Thangarasa, Vithursan, Zhang, Sai Qian |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DREAM-S: Speculative Decoding with Searchable Drafting and Target-Aware Refinement for Multimodal Generation
par: Liu, Zining, et autres
Publié: (2026)
par: Liu, Zining, et autres
Publié: (2026)
DREAM-R: Multimodal Speculative Reasoning with RL-Based Refined Drafting, Precise Verification, and Fully Parallel Execution
par: Hu, Yunhai, et autres
Publié: (2026)
par: Hu, Yunhai, et autres
Publié: (2026)
CodeQuant: Unified Clustering and Quantization for Enhanced Outlier Smoothing in Low-Precision Mixture-of-Experts
par: Yin, Xiangyang, et autres
Publié: (2026)
par: Yin, Xiangyang, et autres
Publié: (2026)
TapOut: A Bandit-Based Approach to Dynamic Speculative Decoding
par: Sridhar, Aditya, et autres
Publié: (2025)
par: Sridhar, Aditya, et autres
Publié: (2025)
MASSV: Multimodal Adaptation and Self-Data Distillation for Speculative Decoding of Vision-Language Models
par: Ganesan, Mugilan, et autres
Publié: (2025)
par: Ganesan, Mugilan, et autres
Publié: (2025)
Speculative Decoding and Beyond: An In-Depth Survey of Techniques
par: Hu, Yunhai, et autres
Publié: (2025)
par: Hu, Yunhai, et autres
Publié: (2025)
PEARL: Parallel Speculative Decoding with Adaptive Draft Length
par: Liu, Tianyu, et autres
Publié: (2024)
par: Liu, Tianyu, et autres
Publié: (2024)
PipeSpec: Breaking Stage Dependencies in Hierarchical LLM Decoding
par: McDanel, Bradley, et autres
Publié: (2025)
par: McDanel, Bradley, et autres
Publié: (2025)
OPT-Tree: Speculative Decoding with Adaptive Draft Tree Structure
par: Wang, Jikai, et autres
Publié: (2024)
par: Wang, Jikai, et autres
Publié: (2024)
PARD-2: Target-Aligned Parallel Draft Model for Dual-Mode Speculative Decoding
par: An, Zihao, et autres
Publié: (2026)
par: An, Zihao, et autres
Publié: (2026)
Learning to Draft: Adaptive Speculative Decoding with Reinforcement Learning
par: Zhang, Jiebin, et autres
Publié: (2026)
par: Zhang, Jiebin, et autres
Publié: (2026)
Sparse-IFT: Sparse Iso-FLOP Transformations for Maximizing Training Efficiency
par: Thangarasa, Vithursan, et autres
Publié: (2023)
par: Thangarasa, Vithursan, et autres
Publié: (2023)
Draft on the Fly: Adaptive Self-Speculative Decoding using Cosine Similarity
par: Metel, Michael R., et autres
Publié: (2024)
par: Metel, Michael R., et autres
Publié: (2024)
TAPS: Target-Aware Prefix Tree Selection for Diffusion-Drafted Speculative Decoding
par: Wang, Zhuoyu, et autres
Publié: (2026)
par: Wang, Zhuoyu, et autres
Publié: (2026)
Self-Data Distillation for Recovering Quality in Pruned Large Language Models
par: Thangarasa, Vithursan, et autres
Publié: (2024)
par: Thangarasa, Vithursan, et autres
Publié: (2024)
TABED: Test-Time Adaptive Ensemble Drafting for Robust Speculative Decoding in LVLMs
par: Lee, Minjae, et autres
Publié: (2026)
par: Lee, Minjae, et autres
Publié: (2026)
FlexDraft: Flexible Speculative Decoding via Attention Tuning and Bonus-Guided Calibration
par: Zhang, Yaojie, et autres
Publié: (2026)
par: Zhang, Yaojie, et autres
Publié: (2026)
Draft Model Knows When to Stop: Self-Verification Speculative Decoding for Long-Form Generation
par: Zhang, Ziyin, et autres
Publié: (2024)
par: Zhang, Ziyin, et autres
Publié: (2024)
FastEagle: Cascaded Drafting for Accelerating Speculative Decoding
par: Huang, Haiduo, et autres
Publié: (2025)
par: Huang, Haiduo, et autres
Publié: (2025)
Cost-Aware Diffusion Draft Trees for Speculative Decoding
par: Zhang, Shuai, et autres
Publié: (2026)
par: Zhang, Shuai, et autres
Publié: (2026)
Accelerating Speculative Decoding with Block Diffusion Draft Trees
par: Ringel, Liran, et autres
Publié: (2026)
par: Ringel, Liran, et autres
Publié: (2026)
AHASD: Asynchronous Heterogeneous Architecture for LLM Adaptive Drafting Speculative Decoding on Mobile Devices
par: Zirui, Ma, et autres
Publié: (2026)
par: Zirui, Ma, et autres
Publié: (2026)
SJD-PAC: Accelerating Speculative Jacobi Decoding via Proactive Drafting and Adaptive Continuation
par: Kang, Jialiang, et autres
Publié: (2026)
par: Kang, Jialiang, et autres
Publié: (2026)
AdaEAGLE: Optimizing Speculative Decoding via Explicit Modeling of Adaptive Draft Structures
par: Zhang, Situo, et autres
Publié: (2024)
par: Zhang, Situo, et autres
Publié: (2024)
OmniDraft: A Cross-vocabulary, Online Adaptive Drafter for On-device Speculative Decoding
par: Ramakrishnan, Ramchalam Kinattinkara, et autres
Publié: (2025)
par: Ramakrishnan, Ramchalam Kinattinkara, et autres
Publié: (2025)
Ouroboros: Generating Longer Drafts Phrase by Phrase for Faster Speculative Decoding
par: Zhao, Weilin, et autres
Publié: (2024)
par: Zhao, Weilin, et autres
Publié: (2024)
Draft Less, Retrieve More: Hybrid Tree Construction for Speculative Decoding
par: Shen, Yuhao, et autres
Publié: (2026)
par: Shen, Yuhao, et autres
Publié: (2026)
SpecBlock: Block-Iterative Speculative Decoding with Dynamic Tree Drafting
par: Shi, Weijie, et autres
Publié: (2026)
par: Shi, Weijie, et autres
Publié: (2026)
DFlare: Scaling Up Draft Capacity for Block Diffusion Speculative Decoding
par: Zhang, Jiebin, et autres
Publié: (2026)
par: Zhang, Jiebin, et autres
Publié: (2026)
TETRIS: Optimal Draft Token Selection for Batch Speculative Decoding
par: Wu, Zhaoxuan, et autres
Publié: (2025)
par: Wu, Zhaoxuan, et autres
Publié: (2025)
MineDraft: A Framework for Batch Parallel Speculative Decoding
par: Tang, Zhenwei, et autres
Publié: (2026)
par: Tang, Zhenwei, et autres
Publié: (2026)
When Drafts Evolve: Speculative Decoding Meets Online Learning
par: Qian, Yu-Yang, et autres
Publié: (2026)
par: Qian, Yu-Yang, et autres
Publié: (2026)
SpecHub: Provable Acceleration to Multi-Draft Speculative Decoding
par: Sun, Ryan, et autres
Publié: (2024)
par: Sun, Ryan, et autres
Publié: (2024)
Draft, Verify, and Improve: Toward Training-Aware Speculative Decoding
par: Bhansali, Shrenik, et autres
Publié: (2025)
par: Bhansali, Shrenik, et autres
Publié: (2025)
POSS: Position Specialist Generates Better Draft for Speculative Decoding
par: Huang, Langlin, et autres
Publié: (2025)
par: Huang, Langlin, et autres
Publié: (2025)
REAP the Experts: Why Pruning Prevails for One-Shot MoE compression
par: Lasby, Mike, et autres
Publié: (2025)
par: Lasby, Mike, et autres
Publié: (2025)
SD$^2$: Self-Distilled Sparse Drafters
par: Lasby, Mike, et autres
Publié: (2025)
par: Lasby, Mike, et autres
Publié: (2025)
MediSwift: Efficient Sparse Pre-trained Biomedical Language Models
par: Thangarasa, Vithursan, et autres
Publié: (2024)
par: Thangarasa, Vithursan, et autres
Publié: (2024)
FlexSpec: Frozen Drafts Meet Evolving Targets in Edge-Cloud Collaborative LLM Speculative Decoding
par: Li, Yuchen, et autres
Publié: (2026)
par: Li, Yuchen, et autres
Publié: (2026)
SpecBranch: Speculative Decoding via Hybrid Drafting and Rollback-Aware Branch Parallelism
par: Shen, Yuhao, et autres
Publié: (2025)
par: Shen, Yuhao, et autres
Publié: (2025)
Documents similaires
-
DREAM-S: Speculative Decoding with Searchable Drafting and Target-Aware Refinement for Multimodal Generation
par: Liu, Zining, et autres
Publié: (2026) -
DREAM-R: Multimodal Speculative Reasoning with RL-Based Refined Drafting, Precise Verification, and Fully Parallel Execution
par: Hu, Yunhai, et autres
Publié: (2026) -
CodeQuant: Unified Clustering and Quantization for Enhanced Outlier Smoothing in Low-Precision Mixture-of-Experts
par: Yin, Xiangyang, et autres
Publié: (2026) -
TapOut: A Bandit-Based Approach to Dynamic Speculative Decoding
par: Sridhar, Aditya, et autres
Publié: (2025) -
MASSV: Multimodal Adaptation and Self-Data Distillation for Speculative Decoding of Vision-Language Models
par: Ganesan, Mugilan, et autres
Publié: (2025)