L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Aggarwal, Pranjal, Welleck, Sean |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Agentic-R1: Distilled Dual-Strategy Reasoning
di: Du, Weihua, et al.
Pubblicazione: (2025)
di: Du, Weihua, et al.
Pubblicazione: (2025)
AlphaVerus: Bootstrapping Formally Verified Code Generation through Self-Improving Translation and Treefinement
di: Aggarwal, Pranjal, et al.
Pubblicazione: (2024)
di: Aggarwal, Pranjal, et al.
Pubblicazione: (2024)
Gym-Anything: Turn any Software into an Agent Environment
di: Aggarwal, Pranjal, et al.
Pubblicazione: (2026)
di: Aggarwal, Pranjal, et al.
Pubblicazione: (2026)
miniCTX: Neural Theorem Proving with (Long-)Contexts
di: Hu, Jiewen, et al.
Pubblicazione: (2024)
di: Hu, Jiewen, et al.
Pubblicazione: (2024)
GradAlign: Gradient-Aligned Data Selection for LLM Reinforcement Learning
di: Yang, Ningyuan, et al.
Pubblicazione: (2026)
di: Yang, Ningyuan, et al.
Pubblicazione: (2026)
Optimizing Temperature for Language Models with Multi-Sample Inference
di: Du, Weihua, et al.
Pubblicazione: (2025)
di: Du, Weihua, et al.
Pubblicazione: (2025)
OptimalThinkingBench: Evaluating Over and Underthinking in LLMs
di: Aggarwal, Pranjal, et al.
Pubblicazione: (2025)
di: Aggarwal, Pranjal, et al.
Pubblicazione: (2025)
RLHF Deciphered: A Critical Analysis of Reinforcement Learning from Human Feedback for LLMs
di: Chaudhari, Shreyas, et al.
Pubblicazione: (2024)
di: Chaudhari, Shreyas, et al.
Pubblicazione: (2024)
Train Long, Think Short: Curriculum Learning for Efficient Reasoning
di: Hammoud, Hasan Abed Al Kader, et al.
Pubblicazione: (2025)
di: Hammoud, Hasan Abed Al Kader, et al.
Pubblicazione: (2025)
Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models
di: Nath, Vaskar, et al.
Pubblicazione: (2025)
di: Nath, Vaskar, et al.
Pubblicazione: (2025)
AdaptThink: Reasoning Models Can Learn When to Think
di: Zhang, Jiajie, et al.
Pubblicazione: (2025)
di: Zhang, Jiajie, et al.
Pubblicazione: (2025)
Effectively Controlling Reasoning Models through Thinking Intervention
di: Wu, Tong, et al.
Pubblicazione: (2025)
di: Wu, Tong, et al.
Pubblicazione: (2025)
BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning
di: Zhong, Han, et al.
Pubblicazione: (2025)
di: Zhong, Han, et al.
Pubblicazione: (2025)
Think Before You Lie: How Reasoning Leads to Honesty
di: Yuan, Ann, et al.
Pubblicazione: (2026)
di: Yuan, Ann, et al.
Pubblicazione: (2026)
ImProver 2: Iteratively Self-Improving LMs for Neurosymbolic Proof Optimization
di: Ahuja, Riyaz, et al.
Pubblicazione: (2026)
di: Ahuja, Riyaz, et al.
Pubblicazione: (2026)
To Think or Not to Think: Exploring the Unthinking Vulnerability in Large Reasoning Models
di: Zhu, Zihao, et al.
Pubblicazione: (2025)
di: Zhu, Zihao, et al.
Pubblicazione: (2025)
AdapThink: Adaptive Thinking Preferences for Reasoning Language Model
di: Wan, Xu, et al.
Pubblicazione: (2025)
di: Wan, Xu, et al.
Pubblicazione: (2025)
Programming with Pixels: Can Computer-Use Agents do Software Engineering?
di: Aggarwal, Pranjal, et al.
Pubblicazione: (2025)
di: Aggarwal, Pranjal, et al.
Pubblicazione: (2025)
Longer Context, Deeper Thinking: Uncovering the Role of Long-Context Ability in Reasoning
di: Yang, Wang, et al.
Pubblicazione: (2025)
di: Yang, Wang, et al.
Pubblicazione: (2025)
A Survey of Reinforcement Learning for Large Reasoning Models
di: Zhang, Kaiyan, et al.
Pubblicazione: (2025)
di: Zhang, Kaiyan, et al.
Pubblicazione: (2025)
J1: Incentivizing Thinking in LLM-as-a-Judge via Reinforcement Learning
di: Whitehouse, Chenxi, et al.
Pubblicazione: (2025)
di: Whitehouse, Chenxi, et al.
Pubblicazione: (2025)
Dynamic Thinking-Token Selection for Efficient Reasoning in Large Reasoning Models
di: Guo, Zhenyuan, et al.
Pubblicazione: (2026)
di: Guo, Zhenyuan, et al.
Pubblicazione: (2026)
Easy-to-Hard Generalization: Scalable Alignment Beyond Human Supervision
di: Sun, Zhiqing, et al.
Pubblicazione: (2024)
di: Sun, Zhiqing, et al.
Pubblicazione: (2024)
Thinking About Thinking: SAGE-nano's Inverse Reasoning for Self-Aware Language Models
di: Jha, Basab, et al.
Pubblicazione: (2025)
di: Jha, Basab, et al.
Pubblicazione: (2025)
Reasoning Models Don't Always Say What They Think
di: Chen, Yanda, et al.
Pubblicazione: (2025)
di: Chen, Yanda, et al.
Pubblicazione: (2025)
The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models
di: Cui, Ganqu, et al.
Pubblicazione: (2025)
di: Cui, Ganqu, et al.
Pubblicazione: (2025)
Revisiting Entropy in Reinforcement Learning for Large Reasoning Models
di: Jin, Renren, et al.
Pubblicazione: (2025)
di: Jin, Renren, et al.
Pubblicazione: (2025)
MeTHanol: Modularized Thinking Language Models with Intermediate Layer Thinking, Decoding and Bootstrapping Reasoning
di: Xi, Ningyuan, et al.
Pubblicazione: (2024)
di: Xi, Ningyuan, et al.
Pubblicazione: (2024)
Efficient Reasoning with Hidden Thinking
di: Shen, Xuan, et al.
Pubblicazione: (2025)
di: Shen, Xuan, et al.
Pubblicazione: (2025)
Efficient Reasoning with Balanced Thinking
di: Li, Yulin, et al.
Pubblicazione: (2026)
di: Li, Yulin, et al.
Pubblicazione: (2026)
ORION: Teaching Language Models to Reason Efficiently in the Language of Thought
di: Tanmay, Kumar, et al.
Pubblicazione: (2025)
di: Tanmay, Kumar, et al.
Pubblicazione: (2025)
Training Proactive and Personalized LLM Agents
di: Sun, Weiwei, et al.
Pubblicazione: (2025)
di: Sun, Weiwei, et al.
Pubblicazione: (2025)
PCL-Reasoner-V1.5: Advancing Math Reasoning with Offline Reinforcement Learning
di: Lu, Yao, et al.
Pubblicazione: (2026)
di: Lu, Yao, et al.
Pubblicazione: (2026)
Learning How Hard to Think: Input-Adaptive Allocation of LM Computation
di: Damani, Mehul, et al.
Pubblicazione: (2024)
di: Damani, Mehul, et al.
Pubblicazione: (2024)
Reasoning with Sampling: Your Base Model is Smarter Than You Think
di: Karan, Aayush, et al.
Pubblicazione: (2025)
di: Karan, Aayush, et al.
Pubblicazione: (2025)
PoPE: Legendre Orthogonal Polynomials Based Position Encoding for Large Language Models
di: Aggarwal, Arpit
Pubblicazione: (2024)
di: Aggarwal, Arpit
Pubblicazione: (2024)
Reinforcement Learning for Reasoning in Large Language Models with One Training Example
di: Wang, Yiping, et al.
Pubblicazione: (2025)
di: Wang, Yiping, et al.
Pubblicazione: (2025)
Understanding the Thinking Process of Reasoning Models: A Perspective from Schoenfeld's Episode Theory
di: Li, Ming, et al.
Pubblicazione: (2025)
di: Li, Ming, et al.
Pubblicazione: (2025)
Group-Aware Reinforcement Learning for Output Diversity in Large Language Models
di: Anschel, Oron, et al.
Pubblicazione: (2025)
di: Anschel, Oron, et al.
Pubblicazione: (2025)
The CoT Encyclopedia: Analyzing, Predicting, and Controlling how a Reasoning Model will Think
di: Lee, Seongyun, et al.
Pubblicazione: (2025)
di: Lee, Seongyun, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Agentic-R1: Distilled Dual-Strategy Reasoning
di: Du, Weihua, et al.
Pubblicazione: (2025) -
AlphaVerus: Bootstrapping Formally Verified Code Generation through Self-Improving Translation and Treefinement
di: Aggarwal, Pranjal, et al.
Pubblicazione: (2024) -
Gym-Anything: Turn any Software into an Agent Environment
di: Aggarwal, Pranjal, et al.
Pubblicazione: (2026) -
miniCTX: Neural Theorem Proving with (Long-)Contexts
di: Hu, Jiewen, et al.
Pubblicazione: (2024) -
GradAlign: Gradient-Aligned Data Selection for LLM Reinforcement Learning
di: Yang, Ningyuan, et al.
Pubblicazione: (2026)