Slow-Fast Inference: Training-Free Inference Acceleration via Within-Sentence Support Stability
Fuente:
arXiv
Salvato in:
| Autori principali: | Xie, Xingyu, Yu, Zhaochen, Liao, Yue, Wang, Tao, Toh, Kim-Chuan, Yan, Shuicheng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Thinking Slow, Fast: Scaling Inference Compute with Distilled Reasoners
di: Paliotta, Daniele, et al.
Pubblicazione: (2025)
di: Paliotta, Daniele, et al.
Pubblicazione: (2025)
Stochastic Subgradient Methods with Guaranteed Global Stability in Nonsmooth Nonconvex Optimization
di: Xiao, Nachuan, et al.
Pubblicazione: (2023)
di: Xiao, Nachuan, et al.
Pubblicazione: (2023)
Predictive Inference With Fast Feature Conformal Prediction
di: Tang, Zihao, et al.
Pubblicazione: (2024)
di: Tang, Zihao, et al.
Pubblicazione: (2024)
GRIFFIN: Effective Token Alignment for Faster Speculative Decoding
di: Hu, Shijing, et al.
Pubblicazione: (2025)
di: Hu, Shijing, et al.
Pubblicazione: (2025)
SentenceKV: Efficient LLM Inference via Sentence-Level Semantic KV Caching
di: Zhu, Yuxuan, et al.
Pubblicazione: (2025)
di: Zhu, Yuxuan, et al.
Pubblicazione: (2025)
Fate: Fast Edge Inference of Mixture-of-Experts Models via Cross-Layer Gate
di: Fang, Zhiyuan, et al.
Pubblicazione: (2025)
di: Fang, Zhiyuan, et al.
Pubblicazione: (2025)
FastMTP: Accelerating LLM Inference with Enhanced Multi-Token Prediction
di: Cai, Yuxuan, et al.
Pubblicazione: (2025)
di: Cai, Yuxuan, et al.
Pubblicazione: (2025)
Accelerating Transformer Inference and Training with 2:4 Activation Sparsity
di: Haziza, Daniel, et al.
Pubblicazione: (2025)
di: Haziza, Daniel, et al.
Pubblicazione: (2025)
DSADF: Thinking Fast and Slow for Decision Making
di: Dou, Zhihao, et al.
Pubblicazione: (2025)
di: Dou, Zhihao, et al.
Pubblicazione: (2025)
Accelerated AI Inference via Dynamic Execution Methods
di: Barad, Haim, et al.
Pubblicazione: (2024)
di: Barad, Haim, et al.
Pubblicazione: (2024)
AdaptFuse: Training-Free Sequential Preference Learning via Externalized Bayesian Inference
di: Lin, Fangzhou, et al.
Pubblicazione: (2026)
di: Lin, Fangzhou, et al.
Pubblicazione: (2026)
Fast On-device LLM Inference with NPUs
di: Xu, Daliang, et al.
Pubblicazione: (2024)
di: Xu, Daliang, et al.
Pubblicazione: (2024)
Similarity-based Label Inference Attack against Training and Inference of Split Learning
di: Liu, Junlin, et al.
Pubblicazione: (2022)
di: Liu, Junlin, et al.
Pubblicazione: (2022)
MoE++: Accelerating Mixture-of-Experts Methods with Zero-Computation Experts
di: Jin, Peng, et al.
Pubblicazione: (2024)
di: Jin, Peng, et al.
Pubblicazione: (2024)
Masked Auto-Regressive Variational Acceleration: Fast Inference Makes Practical Reinforcement Learning
di: Gu, Yuxuan, et al.
Pubblicazione: (2025)
di: Gu, Yuxuan, et al.
Pubblicazione: (2025)
Optimization Hyper-parameter Laws for Large Language Models
di: Xie, Xingyu, et al.
Pubblicazione: (2024)
di: Xie, Xingyu, et al.
Pubblicazione: (2024)
Fast Inference for Augmented Large Language Models
di: Shahout, Rana, et al.
Pubblicazione: (2024)
di: Shahout, Rana, et al.
Pubblicazione: (2024)
Accelerating Mixture-of-Expert Inference with Adaptive Expert Split Mechanism
di: Yan, Jiaming, et al.
Pubblicazione: (2025)
di: Yan, Jiaming, et al.
Pubblicazione: (2025)
Towards Anonymous Neural Network Inference
di: Peiyuan, Liao
Pubblicazione: (2025)
di: Peiyuan, Liao
Pubblicazione: (2025)
Grokfast: Accelerated Grokking by Amplifying Slow Gradients
di: Lee, Jaerin, et al.
Pubblicazione: (2024)
di: Lee, Jaerin, et al.
Pubblicazione: (2024)
Accelerating Transformer Inference for Translation via Parallel Decoding
di: Santilli, Andrea, et al.
Pubblicazione: (2023)
di: Santilli, Andrea, et al.
Pubblicazione: (2023)
LLM Inference Acceleration via Efficient Operation Fusion
di: Salmani, Mahsa, et al.
Pubblicazione: (2025)
di: Salmani, Mahsa, et al.
Pubblicazione: (2025)
Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding
di: Lin, Zijian, et al.
Pubblicazione: (2025)
di: Lin, Zijian, et al.
Pubblicazione: (2025)
OThink-R1: Intrinsic Fast/Slow Thinking Mode Switching for Over-Reasoning Mitigation
di: Zhang, Shengjia, et al.
Pubblicazione: (2025)
di: Zhang, Shengjia, et al.
Pubblicazione: (2025)
MobileExplorer: Accelerating On-Device Inference for Mobile GUI Agents via Online Exploration
di: Huang, Runxi, et al.
Pubblicazione: (2026)
di: Huang, Runxi, et al.
Pubblicazione: (2026)
Optimism Stabilizes Thompson Sampling for Adaptive Inference
di: Yan, Shunxing, et al.
Pubblicazione: (2026)
di: Yan, Shunxing, et al.
Pubblicazione: (2026)
Flash Communication: Reducing Tensor Parallelization Bottleneck for Fast Large Language Model Inference
di: Li, Qingyuan, et al.
Pubblicazione: (2024)
di: Li, Qingyuan, et al.
Pubblicazione: (2024)
Stabilizing MoE Reinforcement Learning by Aligning Training and Inference Routers
di: Ma, Wenhan, et al.
Pubblicazione: (2025)
di: Ma, Wenhan, et al.
Pubblicazione: (2025)
GenEOL: Harnessing the Generative Power of LLMs for Training-Free Sentence Embeddings
di: Thirukovalluru, Raghuveer, et al.
Pubblicazione: (2024)
di: Thirukovalluru, Raghuveer, et al.
Pubblicazione: (2024)
QaRL: Rollout-Aligned Quantization-Aware RL for Fast and Stable Training under Training--Inference Mismatch
di: Gu, Hao, et al.
Pubblicazione: (2026)
di: Gu, Hao, et al.
Pubblicazione: (2026)
Accelerating LLM Inference via Dynamic KV Cache Placement in Heterogeneous Memory System
di: Fang, Yunhua, et al.
Pubblicazione: (2025)
di: Fang, Yunhua, et al.
Pubblicazione: (2025)
No Free Lunch Theorem for Privacy-Preserving LLM Inference
di: Zhang, Xiaojin, et al.
Pubblicazione: (2024)
di: Zhang, Xiaojin, et al.
Pubblicazione: (2024)
SRDiffusion: Accelerate Video Diffusion Inference via Sketching-Rendering Cooperation
di: Cheng, Shenggan, et al.
Pubblicazione: (2025)
di: Cheng, Shenggan, et al.
Pubblicazione: (2025)
Accelerating LLM Inference Throughput via Asynchronous KV Cache Prefetching
di: Dong, Yanhao, et al.
Pubblicazione: (2025)
di: Dong, Yanhao, et al.
Pubblicazione: (2025)
A Control Architecture for Training-Free Memory Use
di: Lu, Yanzhen, et al.
Pubblicazione: (2026)
di: Lu, Yanzhen, et al.
Pubblicazione: (2026)
Fast-Slow Co-advancing Optimizer: Toward Harmonious Adversarial Training of GAN
di: Wang, Lin, et al.
Pubblicazione: (2025)
di: Wang, Lin, et al.
Pubblicazione: (2025)
BigMac: A Communication-Efficient Mixture-of-Experts Model Structure for Fast Training and Inference
di: Jin, Zewen, et al.
Pubblicazione: (2025)
di: Jin, Zewen, et al.
Pubblicazione: (2025)
MMEdge: Accelerating On-device Multimodal Inference via Pipelined Sensing and Encoding
di: Huang, Runxi, et al.
Pubblicazione: (2025)
di: Huang, Runxi, et al.
Pubblicazione: (2025)
Block Transformer: Global-to-Local Language Modeling for Fast Inference
di: Ho, Namgyu, et al.
Pubblicazione: (2024)
di: Ho, Namgyu, et al.
Pubblicazione: (2024)
Inference Optimization of Foundation Models on AI Accelerators
di: Park, Youngsuk, et al.
Pubblicazione: (2024)
di: Park, Youngsuk, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Thinking Slow, Fast: Scaling Inference Compute with Distilled Reasoners
di: Paliotta, Daniele, et al.
Pubblicazione: (2025) -
Stochastic Subgradient Methods with Guaranteed Global Stability in Nonsmooth Nonconvex Optimization
di: Xiao, Nachuan, et al.
Pubblicazione: (2023) -
Predictive Inference With Fast Feature Conformal Prediction
di: Tang, Zihao, et al.
Pubblicazione: (2024) -
GRIFFIN: Effective Token Alignment for Faster Speculative Decoding
di: Hu, Shijing, et al.
Pubblicazione: (2025) -
SentenceKV: Efficient LLM Inference via Sentence-Level Semantic KV Caching
di: Zhu, Yuxuan, et al.
Pubblicazione: (2025)