Stepwise Penalization for Length-Efficient Chain-of-Thought Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Xintong, Li, Sha, Lin, Rongmei, Jin, Hongye, Li, Linwei, Cui, Hejie, Zhang, Sarah, Chang, Chia-Yuan, Cheng, Kewei, Fetahu, Besnik, Nigam, Priyanka, Shang, Jingbo, Yin, Bing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Alternating Reinforcement Learning with Contextual Rubric Rewards: Beyond the Scalarization Strategy
di: Lan, Guangchen, et al.
Pubblicazione: (2026)
di: Lan, Guangchen, et al.
Pubblicazione: (2026)
Explainable Chain-of-Thought Reasoning: An Empirical Analysis on State-Aware Reasoning Dynamics
di: Yu, Sheldon, et al.
Pubblicazione: (2025)
di: Yu, Sheldon, et al.
Pubblicazione: (2025)
Controllable Decontextualization of Yes/No Question and Answers into Factual Statements
di: Mo, Lingbo, et al.
Pubblicazione: (2024)
di: Mo, Lingbo, et al.
Pubblicazione: (2024)
Identifying High Consideration E-Commerce Search Queries
di: Chen, Zhiyu, et al.
Pubblicazione: (2024)
di: Chen, Zhiyu, et al.
Pubblicazione: (2024)
CTRLS: Chain-of-Thought Reasoning via Latent State-Transition
di: Wu, Junda, et al.
Pubblicazione: (2025)
di: Wu, Junda, et al.
Pubblicazione: (2025)
ByteFlow: Language Modeling through Adaptive Byte Compression without a Tokenizer
di: Deng, Chunyuan, et al.
Pubblicazione: (2026)
di: Deng, Chunyuan, et al.
Pubblicazione: (2026)
Teaching AI Stepwise Diagnostic Reasoning with Report-Guided Chain-of-Thought Learning
di: Luo, Yihong, et al.
Pubblicazione: (2025)
di: Luo, Yihong, et al.
Pubblicazione: (2025)
Stepwise Perplexity-Guided Refinement for Efficient Chain-of-Thought Reasoning in Large Language Models
di: Cui, Yingqian, et al.
Pubblicazione: (2025)
di: Cui, Yingqian, et al.
Pubblicazione: (2025)
Instant Answering in E-Commerce Buyer-Seller Messaging using Message-to-Question Reformulation
di: Fetahu, Besnik, et al.
Pubblicazione: (2024)
di: Fetahu, Besnik, et al.
Pubblicazione: (2024)
Wizard of Shopping: Target-Oriented E-commerce Dialogue Generation with Decision Tree Branching
di: Li, Xiangci, et al.
Pubblicazione: (2025)
di: Li, Xiangci, et al.
Pubblicazione: (2025)
Rethinking Chain-of-Thought Reasoning for Videos
di: Zhong, Yiwu, et al.
Pubblicazione: (2025)
di: Zhong, Yiwu, et al.
Pubblicazione: (2025)
Toward Multi-Session Personalized Conversation: A Large-Scale Dataset and Hierarchical Tree Framework for Implicit Reasoning
di: Li, Xintong, et al.
Pubblicazione: (2025)
di: Li, Xintong, et al.
Pubblicazione: (2025)
Identifying Shopping Intent in Product QA for Proactive Recommendations
di: Fetahu, Besnik, et al.
Pubblicazione: (2024)
di: Fetahu, Besnik, et al.
Pubblicazione: (2024)
Controllable Data Augmentation for Few-Shot Text Mining with Chain-of-Thought Attribute Manipulation
di: Peng, Letian, et al.
Pubblicazione: (2023)
di: Peng, Letian, et al.
Pubblicazione: (2023)
Enhancing Adversarial Attacks through Chain of Thought
di: Su, Jingbo
Pubblicazione: (2024)
di: Su, Jingbo
Pubblicazione: (2024)
Dissecting Long-Chain-of-Thought Reasoning Models: An Empirical Study
di: Mu, Yongyu, et al.
Pubblicazione: (2025)
di: Mu, Yongyu, et al.
Pubblicazione: (2025)
CoMem: Context Management with A Decoupled Long-Context Model
di: Zhang, Yuwei, et al.
Pubblicazione: (2026)
di: Zhang, Yuwei, et al.
Pubblicazione: (2026)
StepCodeReasoner: Aligning Code Reasoning with Stepwise Execution Traces via Reinforcement Learning
di: Wang, Hao, et al.
Pubblicazione: (2026)
di: Wang, Hao, et al.
Pubblicazione: (2026)
Transformers Provably Learn Chain-of-Thought Reasoning with Length Generalization
di: Huang, Yu, et al.
Pubblicazione: (2025)
di: Huang, Yu, et al.
Pubblicazione: (2025)
Parallel Continuous Chain-of-Thought with Jacobi Iteration
di: Wu, Haoyi, et al.
Pubblicazione: (2025)
di: Wu, Haoyi, et al.
Pubblicazione: (2025)
Step-CoT: Stepwise Visual Chain-of-Thought for Medical Visual Question Answering
di: Fan, Lin, et al.
Pubblicazione: (2026)
di: Fan, Lin, et al.
Pubblicazione: (2026)
Leveraging Noisy Manual Labels as Useful Information: An Information Fusion Approach for Enhanced Variable Selection in Penalized Logistic Regression
di: Wu, Xiaofei, et al.
Pubblicazione: (2025)
di: Wu, Xiaofei, et al.
Pubblicazione: (2025)
WebCoach: Self-Evolving Web Agents with Cross-Session Memory Guidance
di: Liu, Genglin, et al.
Pubblicazione: (2025)
di: Liu, Genglin, et al.
Pubblicazione: (2025)
SmartThinker: Progressive Chain-of-Thought Length Calibration for Efficient Large Language Model Reasoning
di: Hu, Chenzhi, et al.
Pubblicazione: (2026)
di: Hu, Chenzhi, et al.
Pubblicazione: (2026)
Fractured Chain-of-Thought Reasoning
di: Liao, Baohao, et al.
Pubblicazione: (2025)
di: Liao, Baohao, et al.
Pubblicazione: (2025)
Breaking Thought Patterns: A Multi-Dimensional Reasoning Framework for LLMs
di: Tang, Xintong, et al.
Pubblicazione: (2025)
di: Tang, Xintong, et al.
Pubblicazione: (2025)
Beyond Chain-of-Thought, Effective Graph-of-Thought Reasoning in Language Models
di: Yao, Yao, et al.
Pubblicazione: (2023)
di: Yao, Yao, et al.
Pubblicazione: (2023)
Render-of-Thought: Rendering Textual Chain-of-Thought as Images for Visual Latent Reasoning
di: Wang, Yifan, et al.
Pubblicazione: (2026)
di: Wang, Yifan, et al.
Pubblicazione: (2026)
Learning with Rare Success but Rich Feedback via Reflection-Enhanced Self-Distillation
di: Zhang, Yuwei, et al.
Pubblicazione: (2026)
di: Zhang, Yuwei, et al.
Pubblicazione: (2026)
Unveiling Confirmation Bias in Chain-of-Thought Reasoning
di: Wan, Yue, et al.
Pubblicazione: (2025)
di: Wan, Yue, et al.
Pubblicazione: (2025)
HeaPA: Difficulty-Aware Heap Sampling and On-Policy Query Augmentation for LLM Reinforcement Learning
di: Wang, Weiqi, et al.
Pubblicazione: (2026)
di: Wang, Weiqi, et al.
Pubblicazione: (2026)
On Learning Verifiers and Implications to Chain-of-Thought Reasoning
di: Balcan, Maria-Florina, et al.
Pubblicazione: (2025)
di: Balcan, Maria-Florina, et al.
Pubblicazione: (2025)
Generative Explore-Exploit: Training-free Optimization of Generative Recommender Systems using LLM Optimizers
di: Senel, Lütfi Kerem, et al.
Pubblicazione: (2024)
di: Senel, Lütfi Kerem, et al.
Pubblicazione: (2024)
Long Chain-of-Thought Reasoning Across Languages
di: Barua, Josh, et al.
Pubblicazione: (2025)
di: Barua, Josh, et al.
Pubblicazione: (2025)
CoRGI: Verified Chain-of-Thought Reasoning with Post-hoc Visual Grounding
di: Yi, Shixin, et al.
Pubblicazione: (2025)
di: Yi, Shixin, et al.
Pubblicazione: (2025)
Multimodal Chain-of-Thought Reasoning in Language Models
di: Zhang, Zhuosheng, et al.
Pubblicazione: (2023)
di: Zhang, Zhuosheng, et al.
Pubblicazione: (2023)
Scalable Chain of Thoughts via Elastic Reasoning
di: Xu, Yuhui, et al.
Pubblicazione: (2025)
di: Xu, Yuhui, et al.
Pubblicazione: (2025)
Synergy-of-Thoughts: Eliciting Efficient Reasoning in Hybrid Language Models
di: Shang, Yu, et al.
Pubblicazione: (2024)
di: Shang, Yu, et al.
Pubblicazione: (2024)
ReCUT: Balancing Reasoning Length and Accuracy in LLMs via Stepwise Trails and Preference Optimization
di: Jin, Zhensheng, et al.
Pubblicazione: (2025)
di: Jin, Zhensheng, et al.
Pubblicazione: (2025)
SafeChain: Safety of Language Models with Long Chain-of-Thought Reasoning Capabilities
di: Jiang, Fengqing, et al.
Pubblicazione: (2025)
di: Jiang, Fengqing, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Alternating Reinforcement Learning with Contextual Rubric Rewards: Beyond the Scalarization Strategy
di: Lan, Guangchen, et al.
Pubblicazione: (2026) -
Explainable Chain-of-Thought Reasoning: An Empirical Analysis on State-Aware Reasoning Dynamics
di: Yu, Sheldon, et al.
Pubblicazione: (2025) -
Controllable Decontextualization of Yes/No Question and Answers into Factual Statements
di: Mo, Lingbo, et al.
Pubblicazione: (2024) -
Identifying High Consideration E-Commerce Search Queries
di: Chen, Zhiyu, et al.
Pubblicazione: (2024) -
CTRLS: Chain-of-Thought Reasoning via Latent State-Transition
di: Wu, Junda, et al.
Pubblicazione: (2025)