Good Reasoning Makes Good Demonstrations: Implicit Reasoning Quality Supervision via In-Context Reinforcement Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Mei, Tiehua, Lv, Minxuan, Pan, Leiyu, Su, Zhenpeng, Hou, Hongru, Chen, Hengrui, Xu, Ao, Yang, Deqing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ProRL: Effective Reinforcement Learning for Proactive Recommendation via Rectified Policy Gradient Estimation
di: Hou, Hongru, et al.
Pubblicazione: (2026)
di: Hou, Hongru, et al.
Pubblicazione: (2026)
Entropy Ratio Clipping as a Soft Global Constraint for Stable Reinforcement Learning
di: Su, Zhenpeng, et al.
Pubblicazione: (2025)
di: Su, Zhenpeng, et al.
Pubblicazione: (2025)
CE-GPPO: Coordinating Entropy via Gradient-Preserving Clipping Policy Optimization in Reinforcement Learning
di: Su, Zhenpeng, et al.
Pubblicazione: (2025)
di: Su, Zhenpeng, et al.
Pubblicazione: (2025)
Klear-Reasoner: Advancing Reasoning Capability via Gradient-Preserving Clipping Policy Optimization
di: Su, Zhenpeng, et al.
Pubblicazione: (2025)
di: Su, Zhenpeng, et al.
Pubblicazione: (2025)
GoLongRL: Capability-Oriented Long Context Reinforcement Learning with Multitask Alignment
di: Lv, Minxuan, et al.
Pubblicazione: (2026)
di: Lv, Minxuan, et al.
Pubblicazione: (2026)
GORACS: Group-level Optimal Transport-guided Coreset Selection for LLM-based Recommender Systems
di: Mei, Tiehua, et al.
Pubblicazione: (2025)
di: Mei, Tiehua, et al.
Pubblicazione: (2025)
Guiding Through Complexity: What Makes Good Supervision for Hard Math Reasoning Tasks?
di: He, Xuan, et al.
Pubblicazione: (2024)
di: He, Xuan, et al.
Pubblicazione: (2024)
Implicit Reasoning in Transformers is Reasoning through Shortcuts
di: Lin, Tianhe, et al.
Pubblicazione: (2025)
di: Lin, Tianhe, et al.
Pubblicazione: (2025)
What Makes Good Multilingual Reasoning? Disentangling Reasoning Traces with Measurable Features
di: Ki, Dayeon, et al.
Pubblicazione: (2026)
di: Ki, Dayeon, et al.
Pubblicazione: (2026)
Hard Proofs and Good Reasons
di: DeDeo, Simon
Pubblicazione: (2024)
di: DeDeo, Simon
Pubblicazione: (2024)
Good Data Makes Good Sense.
di: Anderson, Mary Alice
Pubblicazione: (1999)
di: Anderson, Mary Alice
Pubblicazione: (1999)
VLMs are Good Teachers for Video Reasoning via Adaptive Test-Time Optimization
di: Cheng, Junhao, et al.
Pubblicazione: (2026)
di: Cheng, Junhao, et al.
Pubblicazione: (2026)
What Makes a Good Reasoning Chain? Uncovering Structural Patterns in Long Chain-of-Thought Reasoning
di: Jiang, Gangwei, et al.
Pubblicazione: (2025)
di: Jiang, Gangwei, et al.
Pubblicazione: (2025)
What Makes Good In-context Demonstrations for Code Intelligence Tasks with LLMs?
di: Gao, Shuzheng, et al.
Pubblicazione: (2023)
di: Gao, Shuzheng, et al.
Pubblicazione: (2023)
Finedeep: Mitigating Sparse Activation in Dense LLMs via Multi-Layer Fine-Grained Experts
di: Pan, Leiyu, et al.
Pubblicazione: (2025)
di: Pan, Leiyu, et al.
Pubblicazione: (2025)
Nonlinearity in Dynamic Causal Effects: Making the Bad into the Good, and the Good into the Great?
di: Kitagawa, Toru, et al.
Pubblicazione: (2025)
di: Kitagawa, Toru, et al.
Pubblicazione: (2025)
What Makes Good Instruction-Tuning Data? An In-Context Learning Perspective
di: Han, Guangzeng, et al.
Pubblicazione: (2026)
di: Han, Guangzeng, et al.
Pubblicazione: (2026)
Save the Good Prefix: Precise Error Penalization via Process-Supervised RL to Enhance LLM Reasoning
di: Liu, Haolin, et al.
Pubblicazione: (2026)
di: Liu, Haolin, et al.
Pubblicazione: (2026)
Enhancing In-Context Learning via Implicit Demonstration Augmentation
di: Zhou, Xiaoling, et al.
Pubblicazione: (2024)
di: Zhou, Xiaoling, et al.
Pubblicazione: (2024)
Large Language Models Are Latent Variable Models: Explaining and Finding Good Demonstrations for In-Context Learning
di: Wang, Xinyi, et al.
Pubblicazione: (2023)
di: Wang, Xinyi, et al.
Pubblicazione: (2023)
What Makes a Good Curriculum? Disentangling the Effects of Data Ordering on LLM Mathematical Reasoning
di: Jia, Yaning, et al.
Pubblicazione: (2025)
di: Jia, Yaning, et al.
Pubblicazione: (2025)
DSMoE: Matrix-Partitioned Experts with Dynamic Routing for Computation-Efficient Dense LLMs
di: Lv, Minxuan, et al.
Pubblicazione: (2025)
di: Lv, Minxuan, et al.
Pubblicazione: (2025)
Learning to Detect Baked Goods with Limited Supervision
di: Schmitt, Thomas H., et al.
Pubblicazione: (2026)
di: Schmitt, Thomas H., et al.
Pubblicazione: (2026)
LAD-Reasoner: Tiny Multimodal Models are Good Reasoners for Logical Anomaly Detection
di: Li, Weijia, et al.
Pubblicazione: (2025)
di: Li, Weijia, et al.
Pubblicazione: (2025)
Good News Is Not a Sufficient Condition for Motivated Reasoning
di: Thaler, Michael
Pubblicazione: (2020)
di: Thaler, Michael
Pubblicazione: (2020)
Facilitating Long Context Understanding via Supervised Chain-of-Thought Reasoning
di: Lin, Jingyang, et al.
Pubblicazione: (2025)
di: Lin, Jingyang, et al.
Pubblicazione: (2025)
Context-CoT: Enhancing Context Learning via High-Quality Reasoning Synthesis
di: Jin, Hongbo, et al.
Pubblicazione: (2026)
di: Jin, Hongbo, et al.
Pubblicazione: (2026)
Making a Good Doctor
Pubblicazione: (2025)
Pubblicazione: (2025)
Making Good in The Global South
di: Carolina Villagra
Pubblicazione: (2026)
di: Carolina Villagra
Pubblicazione: (2026)
Making the Library Good for Business
di: Lee, John W., et al.
Pubblicazione: (1973)
di: Lee, John W., et al.
Pubblicazione: (1973)
Multi-Path Collaborative Reasoning via Reinforcement Learning
di: Lv, Jindi, et al.
Pubblicazione: (2025)
di: Lv, Jindi, et al.
Pubblicazione: (2025)
Process In-Context Learning: Enhancing Mathematical Reasoning via Dynamic Demonstration Insertion
di: Gao, Ang, et al.
Pubblicazione: (2026)
di: Gao, Ang, et al.
Pubblicazione: (2026)
How do Transformers Learn Implicit Reasoning?
di: Ye, Jiaran, et al.
Pubblicazione: (2025)
di: Ye, Jiaran, et al.
Pubblicazione: (2025)
What Makes for Good Visual Instructions? Synthesizing Complex Visual Reasoning Instructions for Visual Instruction Tuning
di: Du, Yifan, et al.
Pubblicazione: (2023)
di: Du, Yifan, et al.
Pubblicazione: (2023)
Good Seed Makes a Good Crop: Discovering Secret Seeds in Text-to-Image Diffusion Models
di: Xu, Katherine, et al.
Pubblicazione: (2024)
di: Xu, Katherine, et al.
Pubblicazione: (2024)
Context Reasoner: Incentivizing Reasoning Capability for Contextualized Privacy and Safety Compliance via Reinforcement Learning
di: Hu, Wenbin, et al.
Pubblicazione: (2025)
di: Hu, Wenbin, et al.
Pubblicazione: (2025)
What Defines Good Reasoning in LLMs? Dissecting Reasoning Steps with Multi-Aspect Evaluation
di: Do, Heejin, et al.
Pubblicazione: (2025)
di: Do, Heejin, et al.
Pubblicazione: (2025)
Corrupted by Reasoning: Reasoning Language Models Become Free-Riders in Public Goods Games
di: Piedrahita, David Guzman, et al.
Pubblicazione: (2025)
di: Piedrahita, David Guzman, et al.
Pubblicazione: (2025)
Is Your Model Really A Good Math Reasoner? Evaluating Mathematical Reasoning with Checklist
di: Zhou, Zihao, et al.
Pubblicazione: (2024)
di: Zhou, Zihao, et al.
Pubblicazione: (2024)
Demonstration Selection for In-Context Learning via Reinforcement Learning
di: Wang, Xubin, et al.
Pubblicazione: (2024)
di: Wang, Xubin, et al.
Pubblicazione: (2024)
Documenti analoghi
-
ProRL: Effective Reinforcement Learning for Proactive Recommendation via Rectified Policy Gradient Estimation
di: Hou, Hongru, et al.
Pubblicazione: (2026) -
Entropy Ratio Clipping as a Soft Global Constraint for Stable Reinforcement Learning
di: Su, Zhenpeng, et al.
Pubblicazione: (2025) -
CE-GPPO: Coordinating Entropy via Gradient-Preserving Clipping Policy Optimization in Reinforcement Learning
di: Su, Zhenpeng, et al.
Pubblicazione: (2025) -
Klear-Reasoner: Advancing Reasoning Capability via Gradient-Preserving Clipping Policy Optimization
di: Su, Zhenpeng, et al.
Pubblicazione: (2025) -
GoLongRL: Capability-Oriented Long Context Reinforcement Learning with Multitask Alignment
di: Lv, Minxuan, et al.
Pubblicazione: (2026)