Learning When to Think: Shaping Adaptive Reasoning in R1-Style Models via Multi-Stage RL
Fuente:
arXiv
Salvato in:
| Autori principali: | Tu, Songjun, Lin, Jiahao, Zhang, Qichao, Tian, Xiangyu, Li, Linjing, Lan, Xiangyuan, Zhao, Dongbin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
PaperAudit-Bench: Benchmarking Error Detection in Research Papers for Critical Automated Peer Review
di: Tu, Songjun, et al.
Pubblicazione: (2026)
di: Tu, Songjun, et al.
Pubblicazione: (2026)
Perception-Consistency Multimodal Large Language Models Reasoning via Caption-Regularized Policy Optimization
di: Tu, Songjun, et al.
Pubblicazione: (2025)
di: Tu, Songjun, et al.
Pubblicazione: (2025)
Fast Quiet-STaR: Thinking Without Thought Tokens
di: Huang, Wei, et al.
Pubblicazione: (2025)
di: Huang, Wei, et al.
Pubblicazione: (2025)
Bidirectional RAG: Safe Self-Improving Retrieval-Augmented Generation Through Multi-Stage Validation
di: Chinthala, Teja
Pubblicazione: (2025)
di: Chinthala, Teja
Pubblicazione: (2025)
Thinking Longer, Not Always Smarter: Evaluating LLM Capabilities in Hierarchical Legal Reasoning
di: Zhang, Li, et al.
Pubblicazione: (2025)
di: Zhang, Li, et al.
Pubblicazione: (2025)
One Agent to Serve All: a Lite-Adaptive Stylized AI Assistant for Millions of Multi-Style Official Accounts
di: Fan, Xingyu, et al.
Pubblicazione: (2025)
di: Fan, Xingyu, et al.
Pubblicazione: (2025)
Co-NAML-LSTUR: A Combined Model with Attentive Multi-View Learning and Long- and Short-term User Representations for News Recommendation
di: Nguyen, Minh Hoang, et al.
Pubblicazione: (2025)
di: Nguyen, Minh Hoang, et al.
Pubblicazione: (2025)
When Retrieval Succeeds and Fails: Rethinking Retrieval-Augmented Generation for LLMs
di: Wang, Yongjie, et al.
Pubblicazione: (2025)
di: Wang, Yongjie, et al.
Pubblicazione: (2025)
Can LLMs Compute with Reasons?
di: Sandilya, Harshit, et al.
Pubblicazione: (2024)
di: Sandilya, Harshit, et al.
Pubblicazione: (2024)
Distractor Injection Attacks on Large Reasoning Models: Characterization and Defense
di: Zhang, Zhehao, et al.
Pubblicazione: (2025)
di: Zhang, Zhehao, et al.
Pubblicazione: (2025)
Adaptive Steering and Remasking for Safe Generation in Diffusion Language Models
di: Lee, Yejin, et al.
Pubblicazione: (2026)
di: Lee, Yejin, et al.
Pubblicazione: (2026)
GATE: Graph-based Adaptive Tool Evolution Across Diverse Tasks
di: Luo, Jianwen, et al.
Pubblicazione: (2025)
di: Luo, Jianwen, et al.
Pubblicazione: (2025)
New Skills or Sharper Primitives? A Probabilistic Perspective on the Emergence of Reasoning in RLVR
di: Wang, Zhilin, et al.
Pubblicazione: (2026)
di: Wang, Zhilin, et al.
Pubblicazione: (2026)
Culturally-Nuanced Story Generation for Reasoning in Low-Resource Languages: The Case of Javanese and Sundanese
di: Pranida, Salsabila Zahirah, et al.
Pubblicazione: (2025)
di: Pranida, Salsabila Zahirah, et al.
Pubblicazione: (2025)
Dynamic Dual-Granularity Skill Bank for Agentic RL
di: Tu, Songjun, et al.
Pubblicazione: (2026)
di: Tu, Songjun, et al.
Pubblicazione: (2026)
A Knowledge Enhanced Learning and Semantic Composition Model for Multi-Claim Fact Checking
di: Wang, Shuai, et al.
Pubblicazione: (2021)
di: Wang, Shuai, et al.
Pubblicazione: (2021)
Optimizing What We Trust: Reliability-Guided QUBO Selection of Multi-Agent Weak Framing Signals for Arabic Sentiment Prediction
di: Alkhalifa, Rabab
Pubblicazione: (2026)
di: Alkhalifa, Rabab
Pubblicazione: (2026)
CLMN: Concept based Language Models via Neural Symbolic Reasoning
di: Yang, Yibo
Pubblicazione: (2025)
di: Yang, Yibo
Pubblicazione: (2025)
An NLP-Driven Framework for Curriculum-Labor Market Alignment: Schema-Constrained LLM Extraction, ESCO-Anchored Semantic Matching, and Multi-Dimensional Gap Quantification
di: Turaev, Sherzod, et al.
Pubblicazione: (2026)
di: Turaev, Sherzod, et al.
Pubblicazione: (2026)
When Does Content-Based Routing Work? Representation Requirements for Selective Attention in Hybrid Sequence Models
di: Basu, Abhinaba
Pubblicazione: (2026)
di: Basu, Abhinaba
Pubblicazione: (2026)
Rethinking the Multilingual Reasoning Gap with Layer Swap
di: Lasbordes, Maxence, et al.
Pubblicazione: (2026)
di: Lasbordes, Maxence, et al.
Pubblicazione: (2026)
From Noise to Diversity: Random Embedding Injection in LLM Reasoning
di: Kim, Heejun, et al.
Pubblicazione: (2026)
di: Kim, Heejun, et al.
Pubblicazione: (2026)
Multi-chain Graph Refinement and Selection for Reliable Reasoning in Large Language Models
di: Yang, Yujiao, et al.
Pubblicazione: (2025)
di: Yang, Yujiao, et al.
Pubblicazione: (2025)
Adaptive Multi-Stage Patent Claim Generation with Unified Quality Assessment
di: Liang, Chen-Wei, et al.
Pubblicazione: (2026)
di: Liang, Chen-Wei, et al.
Pubblicazione: (2026)
ADE: Adaptive Dictionary Embeddings -- Scaling Multi-Anchor Representations to Large Language Models
di: Demirci, Orhan, et al.
Pubblicazione: (2026)
di: Demirci, Orhan, et al.
Pubblicazione: (2026)
D-SMART: Enhancing LLM Dialogue Consistency via Dynamic Structured Memory And Reasoning Tree
di: Lei, Xiang, et al.
Pubblicazione: (2025)
di: Lei, Xiang, et al.
Pubblicazione: (2025)
Emotional Sequential Influence Modeling on False Information
di: Naskar, Debashis, et al.
Pubblicazione: (2024)
di: Naskar, Debashis, et al.
Pubblicazione: (2024)
Isolating LLM Lexical Bias: A Curation-Free Triangulated Metric for Preference-Stage Learning
di: Ming, Xiaoyang, et al.
Pubblicazione: (2026)
di: Ming, Xiaoyang, et al.
Pubblicazione: (2026)
The Knesset Corpus: An Annotated Corpus of Hebrew Parliamentary Proceedings
di: Goldin, Gili, et al.
Pubblicazione: (2024)
di: Goldin, Gili, et al.
Pubblicazione: (2024)
Math Natural Language Inference: this should be easy!
di: de Paiva, Valeria, et al.
Pubblicazione: (2025)
di: de Paiva, Valeria, et al.
Pubblicazione: (2025)
Pitfalls in Evaluating Interpretability Agents
di: Haklay, Tal, et al.
Pubblicazione: (2026)
di: Haklay, Tal, et al.
Pubblicazione: (2026)
d-TreeRPO: Towards More Reliable Policy Optimization for Diffusion Language Models
di: Pan, Leyi, et al.
Pubblicazione: (2025)
di: Pan, Leyi, et al.
Pubblicazione: (2025)
Towards Effective and Efficient Continual Pre-training of Large Language Models
di: Chen, Jie, et al.
Pubblicazione: (2024)
di: Chen, Jie, et al.
Pubblicazione: (2024)
An Unforgeable Publicly Verifiable Watermark for Large Language Models
di: Liu, Aiwei, et al.
Pubblicazione: (2023)
di: Liu, Aiwei, et al.
Pubblicazione: (2023)
The Unlikely Duel: Evaluating Creative Writing in LLMs through a Unique Scenario
di: Gómez-Rodríguez, Carlos, et al.
Pubblicazione: (2024)
di: Gómez-Rodríguez, Carlos, et al.
Pubblicazione: (2024)
Direct Large Language Model Alignment Through Self-Rewarding Contrastive Prompt Distillation
di: Liu, Aiwei, et al.
Pubblicazione: (2024)
di: Liu, Aiwei, et al.
Pubblicazione: (2024)
SentiCSE: A Sentiment-aware Contrastive Sentence Embedding Framework with Sentiment-guided Textual Similarity
di: Kim, Jaemin, et al.
Pubblicazione: (2024)
di: Kim, Jaemin, et al.
Pubblicazione: (2024)
Exploiting Pre-trained Encoder-Decoder Transformers for Sequence-to-Sequence Constituent Parsing
di: Fernández-González, Daniel, et al.
Pubblicazione: (2026)
di: Fernández-González, Daniel, et al.
Pubblicazione: (2026)
Parametric Social Identity Injection and Diversification in Public Opinion Simulation
di: Wang, Hexi, et al.
Pubblicazione: (2026)
di: Wang, Hexi, et al.
Pubblicazione: (2026)
Trusted Uncertainty in Large Language Models: A Unified Framework for Confidence Calibration and Risk-Controlled Refusal
di: Oehri, Markus, et al.
Pubblicazione: (2025)
di: Oehri, Markus, et al.
Pubblicazione: (2025)
Documenti analoghi
-
PaperAudit-Bench: Benchmarking Error Detection in Research Papers for Critical Automated Peer Review
di: Tu, Songjun, et al.
Pubblicazione: (2026) -
Perception-Consistency Multimodal Large Language Models Reasoning via Caption-Regularized Policy Optimization
di: Tu, Songjun, et al.
Pubblicazione: (2025) -
Fast Quiet-STaR: Thinking Without Thought Tokens
di: Huang, Wei, et al.
Pubblicazione: (2025) -
Bidirectional RAG: Safe Self-Improving Retrieval-Augmented Generation Through Multi-Stage Validation
di: Chinthala, Teja
Pubblicazione: (2025) -
Thinking Longer, Not Always Smarter: Evaluating LLM Capabilities in Hierarchical Legal Reasoning
di: Zhang, Li, et al.
Pubblicazione: (2025)