Slow-Fast Inference: Training-Free Inference Acceleration via Within-Sentence Support Stability
Fuente:
arXiv
Saved in:
| Main Authors: | Xie, Xingyu, Yu, Zhaochen, Liao, Yue, Wang, Tao, Toh, Kim-Chuan, Yan, Shuicheng |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Thinking Slow, Fast: Scaling Inference Compute with Distilled Reasoners
by: Paliotta, Daniele, et al.
Published: (2025)
by: Paliotta, Daniele, et al.
Published: (2025)
Stochastic Subgradient Methods with Guaranteed Global Stability in Nonsmooth Nonconvex Optimization
by: Xiao, Nachuan, et al.
Published: (2023)
by: Xiao, Nachuan, et al.
Published: (2023)
Predictive Inference With Fast Feature Conformal Prediction
by: Tang, Zihao, et al.
Published: (2024)
by: Tang, Zihao, et al.
Published: (2024)
GRIFFIN: Effective Token Alignment for Faster Speculative Decoding
by: Hu, Shijing, et al.
Published: (2025)
by: Hu, Shijing, et al.
Published: (2025)
SentenceKV: Efficient LLM Inference via Sentence-Level Semantic KV Caching
by: Zhu, Yuxuan, et al.
Published: (2025)
by: Zhu, Yuxuan, et al.
Published: (2025)
Fate: Fast Edge Inference of Mixture-of-Experts Models via Cross-Layer Gate
by: Fang, Zhiyuan, et al.
Published: (2025)
by: Fang, Zhiyuan, et al.
Published: (2025)
FastMTP: Accelerating LLM Inference with Enhanced Multi-Token Prediction
by: Cai, Yuxuan, et al.
Published: (2025)
by: Cai, Yuxuan, et al.
Published: (2025)
Accelerating Transformer Inference and Training with 2:4 Activation Sparsity
by: Haziza, Daniel, et al.
Published: (2025)
by: Haziza, Daniel, et al.
Published: (2025)
DSADF: Thinking Fast and Slow for Decision Making
by: Dou, Zhihao, et al.
Published: (2025)
by: Dou, Zhihao, et al.
Published: (2025)
Accelerated AI Inference via Dynamic Execution Methods
by: Barad, Haim, et al.
Published: (2024)
by: Barad, Haim, et al.
Published: (2024)
AdaptFuse: Training-Free Sequential Preference Learning via Externalized Bayesian Inference
by: Lin, Fangzhou, et al.
Published: (2026)
by: Lin, Fangzhou, et al.
Published: (2026)
Fast On-device LLM Inference with NPUs
by: Xu, Daliang, et al.
Published: (2024)
by: Xu, Daliang, et al.
Published: (2024)
Similarity-based Label Inference Attack against Training and Inference of Split Learning
by: Liu, Junlin, et al.
Published: (2022)
by: Liu, Junlin, et al.
Published: (2022)
MoE++: Accelerating Mixture-of-Experts Methods with Zero-Computation Experts
by: Jin, Peng, et al.
Published: (2024)
by: Jin, Peng, et al.
Published: (2024)
Masked Auto-Regressive Variational Acceleration: Fast Inference Makes Practical Reinforcement Learning
by: Gu, Yuxuan, et al.
Published: (2025)
by: Gu, Yuxuan, et al.
Published: (2025)
Optimization Hyper-parameter Laws for Large Language Models
by: Xie, Xingyu, et al.
Published: (2024)
by: Xie, Xingyu, et al.
Published: (2024)
Fast Inference for Augmented Large Language Models
by: Shahout, Rana, et al.
Published: (2024)
by: Shahout, Rana, et al.
Published: (2024)
Accelerating Mixture-of-Expert Inference with Adaptive Expert Split Mechanism
by: Yan, Jiaming, et al.
Published: (2025)
by: Yan, Jiaming, et al.
Published: (2025)
Towards Anonymous Neural Network Inference
by: Peiyuan, Liao
Published: (2025)
by: Peiyuan, Liao
Published: (2025)
Grokfast: Accelerated Grokking by Amplifying Slow Gradients
by: Lee, Jaerin, et al.
Published: (2024)
by: Lee, Jaerin, et al.
Published: (2024)
Accelerating Transformer Inference for Translation via Parallel Decoding
by: Santilli, Andrea, et al.
Published: (2023)
by: Santilli, Andrea, et al.
Published: (2023)
LLM Inference Acceleration via Efficient Operation Fusion
by: Salmani, Mahsa, et al.
Published: (2025)
by: Salmani, Mahsa, et al.
Published: (2025)
Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding
by: Lin, Zijian, et al.
Published: (2025)
by: Lin, Zijian, et al.
Published: (2025)
OThink-R1: Intrinsic Fast/Slow Thinking Mode Switching for Over-Reasoning Mitigation
by: Zhang, Shengjia, et al.
Published: (2025)
by: Zhang, Shengjia, et al.
Published: (2025)
MobileExplorer: Accelerating On-Device Inference for Mobile GUI Agents via Online Exploration
by: Huang, Runxi, et al.
Published: (2026)
by: Huang, Runxi, et al.
Published: (2026)
Optimism Stabilizes Thompson Sampling for Adaptive Inference
by: Yan, Shunxing, et al.
Published: (2026)
by: Yan, Shunxing, et al.
Published: (2026)
Flash Communication: Reducing Tensor Parallelization Bottleneck for Fast Large Language Model Inference
by: Li, Qingyuan, et al.
Published: (2024)
by: Li, Qingyuan, et al.
Published: (2024)
Stabilizing MoE Reinforcement Learning by Aligning Training and Inference Routers
by: Ma, Wenhan, et al.
Published: (2025)
by: Ma, Wenhan, et al.
Published: (2025)
GenEOL: Harnessing the Generative Power of LLMs for Training-Free Sentence Embeddings
by: Thirukovalluru, Raghuveer, et al.
Published: (2024)
by: Thirukovalluru, Raghuveer, et al.
Published: (2024)
QaRL: Rollout-Aligned Quantization-Aware RL for Fast and Stable Training under Training--Inference Mismatch
by: Gu, Hao, et al.
Published: (2026)
by: Gu, Hao, et al.
Published: (2026)
Accelerating LLM Inference via Dynamic KV Cache Placement in Heterogeneous Memory System
by: Fang, Yunhua, et al.
Published: (2025)
by: Fang, Yunhua, et al.
Published: (2025)
No Free Lunch Theorem for Privacy-Preserving LLM Inference
by: Zhang, Xiaojin, et al.
Published: (2024)
by: Zhang, Xiaojin, et al.
Published: (2024)
SRDiffusion: Accelerate Video Diffusion Inference via Sketching-Rendering Cooperation
by: Cheng, Shenggan, et al.
Published: (2025)
by: Cheng, Shenggan, et al.
Published: (2025)
Accelerating LLM Inference Throughput via Asynchronous KV Cache Prefetching
by: Dong, Yanhao, et al.
Published: (2025)
by: Dong, Yanhao, et al.
Published: (2025)
A Control Architecture for Training-Free Memory Use
by: Lu, Yanzhen, et al.
Published: (2026)
by: Lu, Yanzhen, et al.
Published: (2026)
Fast-Slow Co-advancing Optimizer: Toward Harmonious Adversarial Training of GAN
by: Wang, Lin, et al.
Published: (2025)
by: Wang, Lin, et al.
Published: (2025)
BigMac: A Communication-Efficient Mixture-of-Experts Model Structure for Fast Training and Inference
by: Jin, Zewen, et al.
Published: (2025)
by: Jin, Zewen, et al.
Published: (2025)
MMEdge: Accelerating On-device Multimodal Inference via Pipelined Sensing and Encoding
by: Huang, Runxi, et al.
Published: (2025)
by: Huang, Runxi, et al.
Published: (2025)
Block Transformer: Global-to-Local Language Modeling for Fast Inference
by: Ho, Namgyu, et al.
Published: (2024)
by: Ho, Namgyu, et al.
Published: (2024)
Inference Optimization of Foundation Models on AI Accelerators
by: Park, Youngsuk, et al.
Published: (2024)
by: Park, Youngsuk, et al.
Published: (2024)
Similar Items
-
Thinking Slow, Fast: Scaling Inference Compute with Distilled Reasoners
by: Paliotta, Daniele, et al.
Published: (2025) -
Stochastic Subgradient Methods with Guaranteed Global Stability in Nonsmooth Nonconvex Optimization
by: Xiao, Nachuan, et al.
Published: (2023) -
Predictive Inference With Fast Feature Conformal Prediction
by: Tang, Zihao, et al.
Published: (2024) -
GRIFFIN: Effective Token Alignment for Faster Speculative Decoding
by: Hu, Shijing, et al.
Published: (2025) -
SentenceKV: Efficient LLM Inference via Sentence-Level Semantic KV Caching
by: Zhu, Yuxuan, et al.
Published: (2025)