FastMTP: Accelerating LLM Inference with Enhanced Multi-Token Prediction
Fuente:
arXiv
Saved in:
| Main Authors: | Cai, Yuxuan, Liang, Xiaozhuan, Wang, Xinghua, Ma, Jin, Liang, Haijin, Luo, Jinwen, Zuo, Xinyu, Duan, Lisheng, Yin, Yuyang, Chen, Xi |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Omni IIE Bench: Benchmarking the Practical Capabilities of Image Editing Models
by: Yang, Yujia, et al.
Published: (2026)
by: Yang, Yujia, et al.
Published: (2026)
L-MTP: Leap Multi-Token Prediction Beyond Adjacent Context for Large Language Models
by: Liu, Xiaohao, et al.
Published: (2025)
by: Liu, Xiaohao, et al.
Published: (2025)
ChineseHarm-Bench: A Chinese Harmful Content Detection Benchmark
by: Liu, Kangwei, et al.
Published: (2025)
by: Liu, Kangwei, et al.
Published: (2025)
EARN: Efficient Inference Acceleration for LLM-based Generative Recommendation by Register Tokens
by: Yang, Chaoqun, et al.
Published: (2025)
by: Yang, Chaoqun, et al.
Published: (2025)
Co-MTP: A Cooperative Trajectory Prediction Framework with Multi-Temporal Fusion for Autonomous Driving
by: Zhang, Xinyu, et al.
Published: (2025)
by: Zhang, Xinyu, et al.
Published: (2025)
L nc RNA asCsMTP6 ‐ CsMTP6 module regulates mitochondrial manganese homeostasis in cucumber
by: Shengjun Feng, et al.
Published: (2026)
by: Shengjun Feng, et al.
Published: (2026)
Adaptive Layer Selection for Layer-Wise Token Pruning in LLM Inference
by: Taniguchi, Rei, et al.
Published: (2026)
by: Taniguchi, Rei, et al.
Published: (2026)
LLM-Guided Strategy Synthesis for Scalable Equality Saturation
by: Yin, Chenyun, et al.
Published: (2026)
by: Yin, Chenyun, et al.
Published: (2026)
Masked Auto-Regressive Variational Acceleration: Fast Inference Makes Practical Reinforcement Learning
by: Gu, Yuxuan, et al.
Published: (2025)
by: Gu, Yuxuan, et al.
Published: (2025)
MTP-S2UT: Enhancing Speech-to-Speech Translation Quality with Multi-token Prediction
by: Wang, Jianjin, et al.
Published: (2025)
by: Wang, Jianjin, et al.
Published: (2025)
HAMburger: Accelerating LLM Inference via Token Smashing
by: Liu, Jingyu, et al.
Published: (2025)
by: Liu, Jingyu, et al.
Published: (2025)
SpeedLLM: An FPGA Co-design of Large Language Model Inference Accelerator
by: Wang, Peipei, et al.
Published: (2025)
by: Wang, Peipei, et al.
Published: (2025)
Imputed quantile vector autoregressive model for multivariate spatial–temporal data
by: Liang Jinwen, et al.
Published: (2024)
by: Liang Jinwen, et al.
Published: (2024)
WebForge: Breaking the Realism-Reproducibility-Scalability Trilemma in Browser Agent Benchmark
by: Yuan, Peng, et al.
Published: (2026)
by: Yuan, Peng, et al.
Published: (2026)
Critical Tokens Matter: Token-Level Contrastive Estimation Enhances LLM's Reasoning Capability
by: Lin, Zicheng, et al.
Published: (2024)
by: Lin, Zicheng, et al.
Published: (2024)
Probe and Skip: Self-Predictive Token Skipping for Efficient Long-Context LLM Inference
by: Wu, Zimeng, et al.
Published: (2026)
by: Wu, Zimeng, et al.
Published: (2026)
A Task Decomposition and Planning Framework for Efficient LLM Inference in AI-Enabled WiFi-Offload Networks
by: Han, Mingqi, et al.
Published: (2026)
by: Han, Mingqi, et al.
Published: (2026)
AccLLM: Accelerating Long-Context LLM Inference Via Algorithm-Hardware Co-Design
by: Liang, Yanbiao, et al.
Published: (2025)
by: Liang, Yanbiao, et al.
Published: (2025)
Window-Diffusion: Accelerating Diffusion Language Model Inference with Windowed Token Pruning and Caching
by: Zuo, Fengrui, et al.
Published: (2026)
by: Zuo, Fengrui, et al.
Published: (2026)
SDSAT: Accelerating LLM Inference through Speculative Decoding with Semantic Adaptive Tokens
by: Liu, Chengbo, et al.
Published: (2024)
by: Liu, Chengbo, et al.
Published: (2024)
Towards Consumer-Grade Cybersickness Prediction: Multi-Model Alignment for Real-Time Vision-Only Inference
by: Zhu, Yitong, et al.
Published: (2025)
by: Zhu, Yitong, et al.
Published: (2025)
Statistical Inference for High-dimensional Matrix-variate Factor Models with Missing Observations
by: Zhang, Yongxia, et al.
Published: (2025)
by: Zhang, Yongxia, et al.
Published: (2025)
TokenPowerBench: Benchmarking the Power Consumption of LLM Inference
by: Niu, Chenxu, et al.
Published: (2025)
by: Niu, Chenxu, et al.
Published: (2025)
Synergistic Acceleration of Adsorbent Material Development by DFT and ML for CO2 Capture
by: Jianjun Cai, et al.
Published: (2025)
by: Jianjun Cai, et al.
Published: (2025)
MemoSight: Unifying Context Compression and Multi Token Prediction for Reasoning Acceleration
by: Liu, Xinyu, et al.
Published: (2026)
by: Liu, Xinyu, et al.
Published: (2026)
TokenStack: A Heterogeneous HBM-PIM Architecture and Runtime for Efficient LLM Inference
by: Li, Zhuoran, et al.
Published: (2026)
by: Li, Zhuoran, et al.
Published: (2026)
SlimInfer: Accelerating Long-Context LLM Inference via Dynamic Token Pruning
by: Long, Lingkun, et al.
Published: (2025)
by: Long, Lingkun, et al.
Published: (2025)
Carbon Emission Prediction in China Considering New Quality Productive Forces Using a Deep & Corss Learning Modeling Framework
by: Xie, Haijin, et al.
Published: (2025)
by: Xie, Haijin, et al.
Published: (2025)
Mol-Instructions: A Large-Scale Biomolecular Instruction Dataset for Large Language Models
by: Fang, Yin, et al.
Published: (2023)
by: Fang, Yin, et al.
Published: (2023)
AdaFuse: Accelerating Dynamic Adapter Inference via Token-Level Pre-Gating and Fused Kernel Optimization
by: Li, Qiyang, et al.
Published: (2026)
by: Li, Qiyang, et al.
Published: (2026)
Photon transport and blockade based on non-Markovian interactions between a microring resonator and waveguide
by: Ding, Haijin
Published: (2025)
by: Ding, Haijin
Published: (2025)
FastTTS: Accelerating Test-Time Scaling for Edge LLM Reasoning
by: Chen, Hao Mark, et al.
Published: (2025)
by: Chen, Hao Mark, et al.
Published: (2025)
Fast Forward: Accelerating LLM Prefill with Predictive FFN Sparsity
by: Gautam, Aayush, et al.
Published: (2026)
by: Gautam, Aayush, et al.
Published: (2026)
Maize‐Tripsacum‐Teosinte allopolyploid (MTP), a novel dwarf mutant inducer tool in maize
by: Yang Zhou, et al.
Published: (2024)
by: Yang Zhou, et al.
Published: (2024)
SpaMTP: Multi-Omics Mouse Brain dataset
by: Causer, Andrew
Published: (2025)
by: Causer, Andrew
Published: (2025)
Prediction of Mechanical Properties and Thermodynamic Stability of Ti-N system using MTP Interatomic Potential
by: Rana, Pradeep Kumar, et al.
Published: (2025)
by: Rana, Pradeep Kumar, et al.
Published: (2025)
SpecFed: Accelerating Federated LLM Inference with Speculative Decoding and Compressed Transmission
by: Zheng, Ce, et al.
Published: (2026)
by: Zheng, Ce, et al.
Published: (2026)
GELATO: Generative Entropy- and Lyapunov-based Adaptive Token Offloading for Device-Edge Speculative LLM Inference
by: Tang, Zengzipeng, et al.
Published: (2026)
by: Tang, Zengzipeng, et al.
Published: (2026)
Turning Trash into Treasure: Accelerating Inference of Large Language Models with Token Recycling
by: Luo, Xianzhen, et al.
Published: (2024)
by: Luo, Xianzhen, et al.
Published: (2024)
Enhanced Graph Transformer with Serialized Graph Tokens
by: Wang, Ruixiang, et al.
Published: (2026)
by: Wang, Ruixiang, et al.
Published: (2026)
Similar Items
-
Omni IIE Bench: Benchmarking the Practical Capabilities of Image Editing Models
by: Yang, Yujia, et al.
Published: (2026) -
L-MTP: Leap Multi-Token Prediction Beyond Adjacent Context for Large Language Models
by: Liu, Xiaohao, et al.
Published: (2025) -
ChineseHarm-Bench: A Chinese Harmful Content Detection Benchmark
by: Liu, Kangwei, et al.
Published: (2025) -
EARN: Efficient Inference Acceleration for LLM-based Generative Recommendation by Register Tokens
by: Yang, Chaoqun, et al.
Published: (2025) -
Co-MTP: A Cooperative Trajectory Prediction Framework with Multi-Temporal Fusion for Autonomous Driving
by: Zhang, Xinyu, et al.
Published: (2025)