Optimized Multi-Token Joint Decoding with Auxiliary Model for LLM Inference
Fuente:
arXiv
Salvato in:
| Autori principali: | Qin, Zongyue, Hu, Ziniu, He, Zifan, Prakriya, Neha, Cong, Jason, Sun, Yizhou |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
HMT: Hierarchical Memory Transformer for Efficient Long Context Language Processing
di: He, Zifan, et al.
Pubblicazione: (2024)
di: He, Zifan, et al.
Pubblicazione: (2024)
Dynamic-Width Speculative Beam Decoding for Efficient LLM Inference
di: Qin, Zongyue, et al.
Pubblicazione: (2024)
di: Qin, Zongyue, et al.
Pubblicazione: (2024)
LIFT: LLM-Based Pragma Insertion for HLS via GNN Supervised Fine-Tuning
di: Prakriya, Neha, et al.
Pubblicazione: (2025)
di: Prakriya, Neha, et al.
Pubblicazione: (2025)
ConFu: Contemplate the Future for Better Speculative Sampling
di: Qin, Zongyue, et al.
Pubblicazione: (2026)
di: Qin, Zongyue, et al.
Pubblicazione: (2026)
TDRM: Smooth Reward Models with Temporal Difference for LLM RL and Inference
di: Zhang, Dan, et al.
Pubblicazione: (2025)
di: Zhang, Dan, et al.
Pubblicazione: (2025)
Cross-Modality Program Representation Learning for Electronic Design Automation with High-Level Synthesis
di: Qin, Zongyue, et al.
Pubblicazione: (2024)
di: Qin, Zongyue, et al.
Pubblicazione: (2024)
Speculative Streaming: Fast LLM Inference without Auxiliary Models
di: Bhendawade, Nikhil, et al.
Pubblicazione: (2024)
di: Bhendawade, Nikhil, et al.
Pubblicazione: (2024)
Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads
di: Cai, Tianle, et al.
Pubblicazione: (2024)
di: Cai, Tianle, et al.
Pubblicazione: (2024)
Improving Diffusion Language Model Decoding through Joint Search in Generation Order and Token Space
di: Shen, Yangyi, et al.
Pubblicazione: (2026)
di: Shen, Yangyi, et al.
Pubblicazione: (2026)
H$^{2}$MT: Semantic Hierarchy-Aware Hierarchical Memory Transformer
di: Haghifam, Maryam, et al.
Pubblicazione: (2026)
di: Haghifam, Maryam, et al.
Pubblicazione: (2026)
Accelerating Large Language Model Pretraining via LFR Pedagogy: Learn, Focus, and Review
di: Prakriya, Neha, et al.
Pubblicazione: (2024)
di: Prakriya, Neha, et al.
Pubblicazione: (2024)
Progressive Mixed-Precision Decoding for Efficient LLM Inference
di: Chen, Hao Mark, et al.
Pubblicazione: (2024)
di: Chen, Hao Mark, et al.
Pubblicazione: (2024)
TIDE: Token-Informed Depth Execution for Per-Token Early Exit in LLM Inference
di: Jaber, Jaber, et al.
Pubblicazione: (2026)
di: Jaber, Jaber, et al.
Pubblicazione: (2026)
CHESS: Optimizing LLM Inference via Channel-Wise Thresholding and Selective Sparsification
di: He, Junhui, et al.
Pubblicazione: (2024)
di: He, Junhui, et al.
Pubblicazione: (2024)
ProPD: Dynamic Token Tree Pruning and Generation for LLM Parallel Decoding
di: Zhong, Shuzhang, et al.
Pubblicazione: (2024)
di: Zhong, Shuzhang, et al.
Pubblicazione: (2024)
Hierarchical Token Prepending: Enhancing Information Flow in Decoder-based LLM Embeddings
di: Ding, Xueying, et al.
Pubblicazione: (2025)
di: Ding, Xueying, et al.
Pubblicazione: (2025)
Break the Sequential Dependency of LLM Inference Using Lookahead Decoding
di: Fu, Yichao, et al.
Pubblicazione: (2024)
di: Fu, Yichao, et al.
Pubblicazione: (2024)
TreeRL: LLM Reinforcement Learning with On-Policy Tree Search
di: Hou, Zhenyu, et al.
Pubblicazione: (2025)
di: Hou, Zhenyu, et al.
Pubblicazione: (2025)
Research on Multi-hop Inference Optimization of LLM Based on MQUAKE Framework
di: Liang, Zucheng, et al.
Pubblicazione: (2025)
di: Liang, Zucheng, et al.
Pubblicazione: (2025)
Circuit Fingerprints: How Answer Tokens Encode Their Geometrical Path
di: Saurez, Andres, et al.
Pubblicazione: (2026)
di: Saurez, Andres, et al.
Pubblicazione: (2026)
ADOPT: Adaptive Dependency-Guided Joint Prompt Optimization for Multi-Step LLM Pipelines
di: Zhao, Minjun, et al.
Pubblicazione: (2025)
di: Zhao, Minjun, et al.
Pubblicazione: (2025)
Speculative Decoding with CTC-based Draft Model for LLM Inference Acceleration
di: Wen, Zhuofan, et al.
Pubblicazione: (2024)
di: Wen, Zhuofan, et al.
Pubblicazione: (2024)
HELIOS: Adaptive Model And Early-Exit Selection for Efficient LLM Inference Serving
di: Kumar, Avinash, et al.
Pubblicazione: (2025)
di: Kumar, Avinash, et al.
Pubblicazione: (2025)
CITER: Collaborative Inference for Efficient Large Language Model Decoding with Token-Level Routing
di: Zheng, Wenhao, et al.
Pubblicazione: (2025)
di: Zheng, Wenhao, et al.
Pubblicazione: (2025)
Hardware-Aware Parallel Prompt Decoding for Memory-Efficient Acceleration of LLM Inference
di: Chen, Hao Mark, et al.
Pubblicazione: (2024)
di: Chen, Hao Mark, et al.
Pubblicazione: (2024)
Rep2Text: Decoding Full Text from a Single LLM Token Representation
di: Zhao, Haiyan, et al.
Pubblicazione: (2025)
di: Zhao, Haiyan, et al.
Pubblicazione: (2025)
Lossless Token Sequence Compression via Meta-Tokens
di: Harvill, John, et al.
Pubblicazione: (2025)
di: Harvill, John, et al.
Pubblicazione: (2025)
Probe and Skip: Self-Predictive Token Skipping for Efficient Long-Context LLM Inference
di: Wu, Zimeng, et al.
Pubblicazione: (2026)
di: Wu, Zimeng, et al.
Pubblicazione: (2026)
LazyLLM: Dynamic Token Pruning for Efficient Long Context LLM Inference
di: Fu, Qichen, et al.
Pubblicazione: (2024)
di: Fu, Qichen, et al.
Pubblicazione: (2024)
ONTO: A Token-Efficient Columnar Notation for LLM Input Optimization
di: Deekeswar, Harshavardhanan
Pubblicazione: (2026)
di: Deekeswar, Harshavardhanan
Pubblicazione: (2026)
SciBench: Evaluating College-Level Scientific Problem-Solving Abilities of Large Language Models
di: Wang, Xiaoxuan, et al.
Pubblicazione: (2023)
di: Wang, Xiaoxuan, et al.
Pubblicazione: (2023)
TreePO: Bridging the Gap of Policy Optimization and Efficacy and Inference Efficiency with Heuristic Tree-based Modeling
di: Li, Yizhi, et al.
Pubblicazione: (2025)
di: Li, Yizhi, et al.
Pubblicazione: (2025)
FlashDecoding++: Faster Large Language Model Inference on GPUs
di: Hong, Ke, et al.
Pubblicazione: (2023)
di: Hong, Ke, et al.
Pubblicazione: (2023)
Efficient Task Transfer for HLS DSE
di: Ding, Zijian, et al.
Pubblicazione: (2024)
di: Ding, Zijian, et al.
Pubblicazione: (2024)
Calibrated Speculative Decoding: Frequency-Guided Candidate Selection for Efficient Inference
di: Zhou, Xuwen, et al.
Pubblicazione: (2026)
di: Zhou, Xuwen, et al.
Pubblicazione: (2026)
Token Sparse Attention: Efficient Long-Context Inference with Interleaved Token Selection
di: Jo, Dongwon, et al.
Pubblicazione: (2026)
di: Jo, Dongwon, et al.
Pubblicazione: (2026)
Adaptive Layer Selection for Layer-Wise Token Pruning in LLM Inference
di: Taniguchi, Rei, et al.
Pubblicazione: (2026)
di: Taniguchi, Rei, et al.
Pubblicazione: (2026)
Are More Tokens Rational? Inference-Time Scaling in Language Models as Adaptive Resource Rationality
di: Hu, Zhimin, et al.
Pubblicazione: (2026)
di: Hu, Zhimin, et al.
Pubblicazione: (2026)
Stopping Computation for Converged Tokens in Masked Diffusion-LM Decoding
di: Oba, Daisuke, et al.
Pubblicazione: (2026)
di: Oba, Daisuke, et al.
Pubblicazione: (2026)
Reject Only Critical Tokens: Pivot-Aware Speculative Decoding
di: Ziashahabi, Amir, et al.
Pubblicazione: (2025)
di: Ziashahabi, Amir, et al.
Pubblicazione: (2025)
Documenti analoghi
-
HMT: Hierarchical Memory Transformer for Efficient Long Context Language Processing
di: He, Zifan, et al.
Pubblicazione: (2024) -
Dynamic-Width Speculative Beam Decoding for Efficient LLM Inference
di: Qin, Zongyue, et al.
Pubblicazione: (2024) -
LIFT: LLM-Based Pragma Insertion for HLS via GNN Supervised Fine-Tuning
di: Prakriya, Neha, et al.
Pubblicazione: (2025) -
ConFu: Contemplate the Future for Better Speculative Sampling
di: Qin, Zongyue, et al.
Pubblicazione: (2026) -
TDRM: Smooth Reward Models with Temporal Difference for LLM RL and Inference
di: Zhang, Dan, et al.
Pubblicazione: (2025)