Thinking Short and Right Over Thinking Long: Serving LLM Reasoning Efficiently and Accurately
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Yuhang, Jiang, Youhe, Cui, Bin, Fu, Fangcheng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling
di: Ji, Xiaodong, et al.
Pubblicazione: (2025)
di: Ji, Xiaodong, et al.
Pubblicazione: (2025)
BOute: Cost-Efficient LLM Serving with Heterogeneous LLMs and GPUs via Multi-Objective Bayesian Optimization
di: Jiang, Youhe, et al.
Pubblicazione: (2026)
di: Jiang, Youhe, et al.
Pubblicazione: (2026)
ThinkEdit: Interpretable Weight Editing to Mitigate Overly Short Thinking in Reasoning Models
di: Sun, Chung-En, et al.
Pubblicazione: (2025)
di: Sun, Chung-En, et al.
Pubblicazione: (2025)
Train Long, Think Short: Curriculum Learning for Efficient Reasoning
di: Hammoud, Hasan Abed Al Kader, et al.
Pubblicazione: (2025)
di: Hammoud, Hasan Abed Al Kader, et al.
Pubblicazione: (2025)
Efficient Multi-round LLM Inference over Disaggregated Serving
di: He, Wenhao, et al.
Pubblicazione: (2026)
di: He, Wenhao, et al.
Pubblicazione: (2026)
ThunderServe: High-performance and Cost-efficient LLM Serving in Cloud Environments
di: Jiang, Youhe, et al.
Pubblicazione: (2025)
di: Jiang, Youhe, et al.
Pubblicazione: (2025)
Think Right: Learning to Mitigate Under-Over Thinking via Adaptive, Attentive Compression
di: Singh, Joykirat, et al.
Pubblicazione: (2025)
di: Singh, Joykirat, et al.
Pubblicazione: (2025)
OverThink: Slowdown Attacks on Reasoning LLMs
di: Kumar, Abhinav, et al.
Pubblicazione: (2025)
di: Kumar, Abhinav, et al.
Pubblicazione: (2025)
Improving Automatic Parallel Training via Balanced Memory Workload Optimization
di: Wang, Yujie, et al.
Pubblicazione: (2023)
di: Wang, Yujie, et al.
Pubblicazione: (2023)
Efficient Reasoning with Hidden Thinking
di: Shen, Xuan, et al.
Pubblicazione: (2025)
di: Shen, Xuan, et al.
Pubblicazione: (2025)
Efficient Reasoning with Balanced Thinking
di: Li, Yulin, et al.
Pubblicazione: (2026)
di: Li, Yulin, et al.
Pubblicazione: (2026)
OServe: Accelerating LLM Serving via Spatial-Temporal Workload Orchestration
di: Jiang, Youhe, et al.
Pubblicazione: (2026)
di: Jiang, Youhe, et al.
Pubblicazione: (2026)
Accordion-Thinking: Self-Regulated Step Summaries for Efficient and Readable LLM Reasoning
di: Yang, Zhicheng, et al.
Pubblicazione: (2026)
di: Yang, Zhicheng, et al.
Pubblicazione: (2026)
Think Dense, Not Long: Dynamic Decoupled Conditional Advantage for Efficient Reasoning
di: Peng, Keqin, et al.
Pubblicazione: (2026)
di: Peng, Keqin, et al.
Pubblicazione: (2026)
Efficient Serving for Dynamic Agent Workflows with Prediction-based KV-Cache Management
di: Zheng, Haoyu, et al.
Pubblicazione: (2026)
di: Zheng, Haoyu, et al.
Pubblicazione: (2026)
Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models
di: Hong, Ilgee, et al.
Pubblicazione: (2025)
di: Hong, Ilgee, et al.
Pubblicazione: (2025)
Atom: Low-bit Quantization for Efficient and Accurate LLM Serving
di: Zhao, Yilong, et al.
Pubblicazione: (2023)
di: Zhao, Yilong, et al.
Pubblicazione: (2023)
Quantized Reasoning Models Think They Need to Think Longer, but They Do Not
di: Lotfi, Sanae, et al.
Pubblicazione: (2026)
di: Lotfi, Sanae, et al.
Pubblicazione: (2026)
ThinkRouter: Efficient Reasoning via Routing Thinking between Latent and Discrete Spaces
di: Xu, Xin, et al.
Pubblicazione: (2026)
di: Xu, Xin, et al.
Pubblicazione: (2026)
Think-Augmented Function Calling: Improving LLM Parameter Accuracy Through Embedded Reasoning
di: Wei, Lei, et al.
Pubblicazione: (2026)
di: Wei, Lei, et al.
Pubblicazione: (2026)
Deep Think with Confidence
di: Fu, Yichao, et al.
Pubblicazione: (2025)
di: Fu, Yichao, et al.
Pubblicazione: (2025)
K2-Think: A Parameter-Efficient Reasoning System
di: Cheng, Zhoujun, et al.
Pubblicazione: (2025)
di: Cheng, Zhoujun, et al.
Pubblicazione: (2025)
Good Learners Think Their Thinking: Generative PRM Makes Large Reasoning Model More Efficient Math Learner
di: He, Tao, et al.
Pubblicazione: (2025)
di: He, Tao, et al.
Pubblicazione: (2025)
PQCache: Product Quantization-based KVCache for Long Context LLM Inference
di: Zhang, Hailin, et al.
Pubblicazione: (2024)
di: Zhang, Hailin, et al.
Pubblicazione: (2024)
How Much Thinking is Enough? Quantifying and Understanding Redundancy in LLM Reasoning
di: Zhai, Zhiyuan, et al.
Pubblicazione: (2026)
di: Zhai, Zhiyuan, et al.
Pubblicazione: (2026)
To Think or Not to Think: Exploring the Unthinking Vulnerability in Large Reasoning Models
di: Zhu, Zihao, et al.
Pubblicazione: (2025)
di: Zhu, Zihao, et al.
Pubblicazione: (2025)
AdapThink: Adaptive Thinking Preferences for Reasoning Language Model
di: Wan, Xu, et al.
Pubblicazione: (2025)
di: Wan, Xu, et al.
Pubblicazione: (2025)
Think Consistently, Reason Efficiently: Energy-Based Calibration for Implicit Chain-of-Thought
di: Chen, Zhikang, et al.
Pubblicazione: (2025)
di: Chen, Zhikang, et al.
Pubblicazione: (2025)
Demystifying Cost-Efficiency in LLM Serving over Heterogeneous GPUs
di: Jiang, Youhe, et al.
Pubblicazione: (2025)
di: Jiang, Youhe, et al.
Pubblicazione: (2025)
DARTS: Distribution-Aware Active Rollout Trajectory Shaping for Accelerating LLM Reinforcement Learning
di: Wang, Yujie, et al.
Pubblicazione: (2026)
di: Wang, Yujie, et al.
Pubblicazione: (2026)
Learn to Think: Bootstrapping LLM Reasoning Capability Through Graph Representation Learning
di: Gao, Hang, et al.
Pubblicazione: (2025)
di: Gao, Hang, et al.
Pubblicazione: (2025)
AdaptThink: Reasoning Models Can Learn When to Think
di: Zhang, Jiajie, et al.
Pubblicazione: (2025)
di: Zhang, Jiajie, et al.
Pubblicazione: (2025)
MeTHanol: Modularized Thinking Language Models with Intermediate Layer Thinking, Decoding and Bootstrapping Reasoning
di: Xi, Ningyuan, et al.
Pubblicazione: (2024)
di: Xi, Ningyuan, et al.
Pubblicazione: (2024)
SCORPIO: Serving the Right Requests at the Right Time for Heterogeneous SLOs in LLM Inference
di: Tang, Yinghao, et al.
Pubblicazione: (2025)
di: Tang, Yinghao, et al.
Pubblicazione: (2025)
Thinking with Knowledge Graphs: Enhancing LLM Reasoning Through Structured Data
di: Wu, Xue, et al.
Pubblicazione: (2024)
di: Wu, Xue, et al.
Pubblicazione: (2024)
OptimalThinkingBench: Evaluating Over and Underthinking in LLMs
di: Aggarwal, Pranjal, et al.
Pubblicazione: (2025)
di: Aggarwal, Pranjal, et al.
Pubblicazione: (2025)
Think2SQL: Reinforce LLM Reasoning Capabilities for Text2SQL
di: Papicchio, Simone, et al.
Pubblicazione: (2025)
di: Papicchio, Simone, et al.
Pubblicazione: (2025)
Dynamic Thinking-Token Selection for Efficient Reasoning in Large Reasoning Models
di: Guo, Zhenyuan, et al.
Pubblicazione: (2026)
di: Guo, Zhenyuan, et al.
Pubblicazione: (2026)
Mitigating Think-Answer Mismatch in LLM Reasoning Through Noise-Aware Advantage Reweighting
di: Shen, Si, et al.
Pubblicazione: (2025)
di: Shen, Si, et al.
Pubblicazione: (2025)
Thinking-Free Policy Initialization Makes Distilled Reasoning Models More Effective and Efficient Reasoners
di: Xu, Xin, et al.
Pubblicazione: (2025)
di: Xu, Xin, et al.
Pubblicazione: (2025)
Documenti analoghi
-
SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling
di: Ji, Xiaodong, et al.
Pubblicazione: (2025) -
BOute: Cost-Efficient LLM Serving with Heterogeneous LLMs and GPUs via Multi-Objective Bayesian Optimization
di: Jiang, Youhe, et al.
Pubblicazione: (2026) -
ThinkEdit: Interpretable Weight Editing to Mitigate Overly Short Thinking in Reasoning Models
di: Sun, Chung-En, et al.
Pubblicazione: (2025) -
Train Long, Think Short: Curriculum Learning for Efficient Reasoning
di: Hammoud, Hasan Abed Al Kader, et al.
Pubblicazione: (2025) -
Efficient Multi-round LLM Inference over Disaggregated Serving
di: He, Wenhao, et al.
Pubblicazione: (2026)