Stepwise Penalization for Length-Efficient Chain-of-Thought Reasoning
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Xintong, Li, Sha, Lin, Rongmei, Jin, Hongye, Li, Linwei, Cui, Hejie, Zhang, Sarah, Chang, Chia-Yuan, Cheng, Kewei, Fetahu, Besnik, Nigam, Priyanka, Shang, Jingbo, Yin, Bing |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Alternating Reinforcement Learning with Contextual Rubric Rewards: Beyond the Scalarization Strategy
por: Lan, Guangchen, et al.
Publicado: (2026)
por: Lan, Guangchen, et al.
Publicado: (2026)
Explainable Chain-of-Thought Reasoning: An Empirical Analysis on State-Aware Reasoning Dynamics
por: Yu, Sheldon, et al.
Publicado: (2025)
por: Yu, Sheldon, et al.
Publicado: (2025)
Controllable Decontextualization of Yes/No Question and Answers into Factual Statements
por: Mo, Lingbo, et al.
Publicado: (2024)
por: Mo, Lingbo, et al.
Publicado: (2024)
Identifying High Consideration E-Commerce Search Queries
por: Chen, Zhiyu, et al.
Publicado: (2024)
por: Chen, Zhiyu, et al.
Publicado: (2024)
CTRLS: Chain-of-Thought Reasoning via Latent State-Transition
por: Wu, Junda, et al.
Publicado: (2025)
por: Wu, Junda, et al.
Publicado: (2025)
ByteFlow: Language Modeling through Adaptive Byte Compression without a Tokenizer
por: Deng, Chunyuan, et al.
Publicado: (2026)
por: Deng, Chunyuan, et al.
Publicado: (2026)
Teaching AI Stepwise Diagnostic Reasoning with Report-Guided Chain-of-Thought Learning
por: Luo, Yihong, et al.
Publicado: (2025)
por: Luo, Yihong, et al.
Publicado: (2025)
Stepwise Perplexity-Guided Refinement for Efficient Chain-of-Thought Reasoning in Large Language Models
por: Cui, Yingqian, et al.
Publicado: (2025)
por: Cui, Yingqian, et al.
Publicado: (2025)
Instant Answering in E-Commerce Buyer-Seller Messaging using Message-to-Question Reformulation
por: Fetahu, Besnik, et al.
Publicado: (2024)
por: Fetahu, Besnik, et al.
Publicado: (2024)
Wizard of Shopping: Target-Oriented E-commerce Dialogue Generation with Decision Tree Branching
por: Li, Xiangci, et al.
Publicado: (2025)
por: Li, Xiangci, et al.
Publicado: (2025)
Rethinking Chain-of-Thought Reasoning for Videos
por: Zhong, Yiwu, et al.
Publicado: (2025)
por: Zhong, Yiwu, et al.
Publicado: (2025)
Toward Multi-Session Personalized Conversation: A Large-Scale Dataset and Hierarchical Tree Framework for Implicit Reasoning
por: Li, Xintong, et al.
Publicado: (2025)
por: Li, Xintong, et al.
Publicado: (2025)
Identifying Shopping Intent in Product QA for Proactive Recommendations
por: Fetahu, Besnik, et al.
Publicado: (2024)
por: Fetahu, Besnik, et al.
Publicado: (2024)
Controllable Data Augmentation for Few-Shot Text Mining with Chain-of-Thought Attribute Manipulation
por: Peng, Letian, et al.
Publicado: (2023)
por: Peng, Letian, et al.
Publicado: (2023)
Enhancing Adversarial Attacks through Chain of Thought
por: Su, Jingbo
Publicado: (2024)
por: Su, Jingbo
Publicado: (2024)
Dissecting Long-Chain-of-Thought Reasoning Models: An Empirical Study
por: Mu, Yongyu, et al.
Publicado: (2025)
por: Mu, Yongyu, et al.
Publicado: (2025)
CoMem: Context Management with A Decoupled Long-Context Model
por: Zhang, Yuwei, et al.
Publicado: (2026)
por: Zhang, Yuwei, et al.
Publicado: (2026)
StepCodeReasoner: Aligning Code Reasoning with Stepwise Execution Traces via Reinforcement Learning
por: Wang, Hao, et al.
Publicado: (2026)
por: Wang, Hao, et al.
Publicado: (2026)
Transformers Provably Learn Chain-of-Thought Reasoning with Length Generalization
por: Huang, Yu, et al.
Publicado: (2025)
por: Huang, Yu, et al.
Publicado: (2025)
Parallel Continuous Chain-of-Thought with Jacobi Iteration
por: Wu, Haoyi, et al.
Publicado: (2025)
por: Wu, Haoyi, et al.
Publicado: (2025)
Step-CoT: Stepwise Visual Chain-of-Thought for Medical Visual Question Answering
por: Fan, Lin, et al.
Publicado: (2026)
por: Fan, Lin, et al.
Publicado: (2026)
Leveraging Noisy Manual Labels as Useful Information: An Information Fusion Approach for Enhanced Variable Selection in Penalized Logistic Regression
por: Wu, Xiaofei, et al.
Publicado: (2025)
por: Wu, Xiaofei, et al.
Publicado: (2025)
WebCoach: Self-Evolving Web Agents with Cross-Session Memory Guidance
por: Liu, Genglin, et al.
Publicado: (2025)
por: Liu, Genglin, et al.
Publicado: (2025)
SmartThinker: Progressive Chain-of-Thought Length Calibration for Efficient Large Language Model Reasoning
por: Hu, Chenzhi, et al.
Publicado: (2026)
por: Hu, Chenzhi, et al.
Publicado: (2026)
Fractured Chain-of-Thought Reasoning
por: Liao, Baohao, et al.
Publicado: (2025)
por: Liao, Baohao, et al.
Publicado: (2025)
Breaking Thought Patterns: A Multi-Dimensional Reasoning Framework for LLMs
por: Tang, Xintong, et al.
Publicado: (2025)
por: Tang, Xintong, et al.
Publicado: (2025)
Beyond Chain-of-Thought, Effective Graph-of-Thought Reasoning in Language Models
por: Yao, Yao, et al.
Publicado: (2023)
por: Yao, Yao, et al.
Publicado: (2023)
Render-of-Thought: Rendering Textual Chain-of-Thought as Images for Visual Latent Reasoning
por: Wang, Yifan, et al.
Publicado: (2026)
por: Wang, Yifan, et al.
Publicado: (2026)
Learning with Rare Success but Rich Feedback via Reflection-Enhanced Self-Distillation
por: Zhang, Yuwei, et al.
Publicado: (2026)
por: Zhang, Yuwei, et al.
Publicado: (2026)
Unveiling Confirmation Bias in Chain-of-Thought Reasoning
por: Wan, Yue, et al.
Publicado: (2025)
por: Wan, Yue, et al.
Publicado: (2025)
HeaPA: Difficulty-Aware Heap Sampling and On-Policy Query Augmentation for LLM Reinforcement Learning
por: Wang, Weiqi, et al.
Publicado: (2026)
por: Wang, Weiqi, et al.
Publicado: (2026)
On Learning Verifiers and Implications to Chain-of-Thought Reasoning
por: Balcan, Maria-Florina, et al.
Publicado: (2025)
por: Balcan, Maria-Florina, et al.
Publicado: (2025)
Generative Explore-Exploit: Training-free Optimization of Generative Recommender Systems using LLM Optimizers
por: Senel, Lütfi Kerem, et al.
Publicado: (2024)
por: Senel, Lütfi Kerem, et al.
Publicado: (2024)
Long Chain-of-Thought Reasoning Across Languages
por: Barua, Josh, et al.
Publicado: (2025)
por: Barua, Josh, et al.
Publicado: (2025)
CoRGI: Verified Chain-of-Thought Reasoning with Post-hoc Visual Grounding
por: Yi, Shixin, et al.
Publicado: (2025)
por: Yi, Shixin, et al.
Publicado: (2025)
Multimodal Chain-of-Thought Reasoning in Language Models
por: Zhang, Zhuosheng, et al.
Publicado: (2023)
por: Zhang, Zhuosheng, et al.
Publicado: (2023)
Scalable Chain of Thoughts via Elastic Reasoning
por: Xu, Yuhui, et al.
Publicado: (2025)
por: Xu, Yuhui, et al.
Publicado: (2025)
Synergy-of-Thoughts: Eliciting Efficient Reasoning in Hybrid Language Models
por: Shang, Yu, et al.
Publicado: (2024)
por: Shang, Yu, et al.
Publicado: (2024)
ReCUT: Balancing Reasoning Length and Accuracy in LLMs via Stepwise Trails and Preference Optimization
por: Jin, Zhensheng, et al.
Publicado: (2025)
por: Jin, Zhensheng, et al.
Publicado: (2025)
SafeChain: Safety of Language Models with Long Chain-of-Thought Reasoning Capabilities
por: Jiang, Fengqing, et al.
Publicado: (2025)
por: Jiang, Fengqing, et al.
Publicado: (2025)
Ejemplares similares
-
Alternating Reinforcement Learning with Contextual Rubric Rewards: Beyond the Scalarization Strategy
por: Lan, Guangchen, et al.
Publicado: (2026) -
Explainable Chain-of-Thought Reasoning: An Empirical Analysis on State-Aware Reasoning Dynamics
por: Yu, Sheldon, et al.
Publicado: (2025) -
Controllable Decontextualization of Yes/No Question and Answers into Factual Statements
por: Mo, Lingbo, et al.
Publicado: (2024) -
Identifying High Consideration E-Commerce Search Queries
por: Chen, Zhiyu, et al.
Publicado: (2024) -
CTRLS: Chain-of-Thought Reasoning via Latent State-Transition
por: Wu, Junda, et al.
Publicado: (2025)