InT: Self-Proposed Interventions Enable Credit Assignment in LLM Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Yang, Matthew Y. R., Bai, Hao, Wu, Ian, Yang, Gene, Setlur, Amrith, Kumar, Aviral |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
POPE: Learning to Reason on Hard Problems via Privileged On-Policy Exploration
di: Qu, Yuxiao, et al.
Pubblicazione: (2026)
di: Qu, Yuxiao, et al.
Pubblicazione: (2026)
Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning
di: Qu, Yuxiao, et al.
Pubblicazione: (2025)
di: Qu, Yuxiao, et al.
Pubblicazione: (2025)
RLAD: Training LLMs to Discover Abstractions for Solving Reasoning Problems
di: Qu, Yuxiao, et al.
Pubblicazione: (2025)
di: Qu, Yuxiao, et al.
Pubblicazione: (2025)
QED-Nano: Teaching a Tiny Model to Prove Hard Theorems
di: LM-Provers, et al.
Pubblicazione: (2026)
di: LM-Provers, et al.
Pubblicazione: (2026)
From Reasoning Chains to Verifiable Subproblems: Curriculum Reinforcement Learning Enables Credit Assignment for LLM Reasoning
di: Jiang, Xitai, et al.
Pubblicazione: (2026)
di: Jiang, Xitai, et al.
Pubblicazione: (2026)
e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs
di: Setlur, Amrith, et al.
Pubblicazione: (2025)
di: Setlur, Amrith, et al.
Pubblicazione: (2025)
CAPO: Towards Enhancing LLM Reasoning through Generative Credit Assignment
di: Xie, Guofu, et al.
Pubblicazione: (2025)
di: Xie, Guofu, et al.
Pubblicazione: (2025)
RL on Incorrect Synthetic Data Scales the Efficiency of LLM Math Reasoning by Eight-Fold
di: Setlur, Amrith, et al.
Pubblicazione: (2024)
di: Setlur, Amrith, et al.
Pubblicazione: (2024)
Scaling Test-Time Compute Without Verification or RL is Suboptimal
di: Setlur, Amrith, et al.
Pubblicazione: (2025)
di: Setlur, Amrith, et al.
Pubblicazione: (2025)
Reasoning Cache: Continual Improvement Over Long Horizons via Short-Horizon RL
di: Wu, Ian, et al.
Pubblicazione: (2026)
di: Wu, Ian, et al.
Pubblicazione: (2026)
Beyond Uniform Credit: Causal Credit Assignment for Policy Optimization
di: Khandoga, Mykola, et al.
Pubblicazione: (2026)
di: Khandoga, Mykola, et al.
Pubblicazione: (2026)
Reuse your FLOPs: Scaling RL on Hard Problems by Conditioning on Very Off-Policy Prefixes
di: Setlur, Amrith, et al.
Pubblicazione: (2026)
di: Setlur, Amrith, et al.
Pubblicazione: (2026)
Reducing Credit Assignment Variance via Counterfactual Reasoning Paths
di: Ding, Fei, et al.
Pubblicazione: (2026)
di: Ding, Fei, et al.
Pubblicazione: (2026)
Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction
di: Shen, Junhong, et al.
Pubblicazione: (2025)
di: Shen, Junhong, et al.
Pubblicazione: (2025)
MICA: Multi-granularity Intertemporal Credit Assignment for Long-Horizon Emotional Support Dialogue
di: Zhang, Naifan, et al.
Pubblicazione: (2026)
di: Zhang, Naifan, et al.
Pubblicazione: (2026)
Discovering Process-Outcome Credit in Multi-Step LLM Reasoning
di: Wang, Xiangwei, et al.
Pubblicazione: (2026)
di: Wang, Xiangwei, et al.
Pubblicazione: (2026)
Rewarding Progress: Scaling Automated Process Verifiers for LLM Reasoning
di: Setlur, Amrith, et al.
Pubblicazione: (2024)
di: Setlur, Amrith, et al.
Pubblicazione: (2024)
GRPO-$λ$: Credit Assignment improves LLM Reasoning
di: Parthasarathi, Prasanna, et al.
Pubblicazione: (2025)
di: Parthasarathi, Prasanna, et al.
Pubblicazione: (2025)
Less is More: Improving LLM Reasoning with Minimal Test-Time Intervention
di: Yang, Zhen, et al.
Pubblicazione: (2025)
di: Yang, Zhen, et al.
Pubblicazione: (2025)
APEX-Searcher: Refining Credit Assignment with Subgoaling for Agentic Retrieval-Augmented Generation
di: Chen, Kun, et al.
Pubblicazione: (2026)
di: Chen, Kun, et al.
Pubblicazione: (2026)
TRIM: Hybrid Inference via Targeted Stepwise Routing in Multi-Step Reasoning Tasks
di: Kapoor, Vansh, et al.
Pubblicazione: (2026)
di: Kapoor, Vansh, et al.
Pubblicazione: (2026)
Recursive Introspection: Teaching Language Model Agents How to Self-Improve
di: Qu, Yuxiao, et al.
Pubblicazione: (2024)
di: Qu, Yuxiao, et al.
Pubblicazione: (2024)
Hindsight Credit Assignment for Long-Horizon LLM Agents
di: Tan, Hui-Ze, et al.
Pubblicazione: (2026)
di: Tan, Hui-Ze, et al.
Pubblicazione: (2026)
DACA-GRPO: Denoising-Aware Credit Assignment for Reinforcement Learning in Diffusion Language Models
di: Monsefi, Amin Karimi, et al.
Pubblicazione: (2026)
di: Monsefi, Amin Karimi, et al.
Pubblicazione: (2026)
From Biased Chatbots to Biased Agents: Examining Role Assignment Effects on LLM Agent Robustness
di: Cao, Linbo, et al.
Pubblicazione: (2026)
di: Cao, Linbo, et al.
Pubblicazione: (2026)
Reasoning Aware Self-Consistency: Leveraging Reasoning Paths for Efficient LLM Sampling
di: Wan, Guangya, et al.
Pubblicazione: (2024)
di: Wan, Guangya, et al.
Pubblicazione: (2024)
Credit Assignment with Resets in Language Model Reasoning
di: Samanta, Ankur, et al.
Pubblicazione: (2026)
di: Samanta, Ankur, et al.
Pubblicazione: (2026)
CaRT: Teaching LLM Agents to Know When They Know Enough
di: Liu, Grace, et al.
Pubblicazione: (2025)
di: Liu, Grace, et al.
Pubblicazione: (2025)
GRASP: Gated Regression-Aware Skill Proposer for Self-Improving LLM Agents
di: Moll, Johannes, et al.
Pubblicazione: (2026)
di: Moll, Johannes, et al.
Pubblicazione: (2026)
Benchmark Test-Time Scaling of General LLM Agents
di: Li, Xiaochuan, et al.
Pubblicazione: (2026)
di: Li, Xiaochuan, et al.
Pubblicazione: (2026)
Towards Safe Reasoning in Large Reasoning Models via Corrective Intervention
di: Zhang, Yichi, et al.
Pubblicazione: (2025)
di: Zhang, Yichi, et al.
Pubblicazione: (2025)
Segment Policy Optimization: Effective Segment-Level Credit Assignment in RL for Large Language Models
di: Guo, Yiran, et al.
Pubblicazione: (2025)
di: Guo, Yiran, et al.
Pubblicazione: (2025)
OPPO: Bayesian Value Recursion for Token-Level Credit Assignment in LLM Reasoning
di: Li, Yu, et al.
Pubblicazione: (2026)
di: Li, Yu, et al.
Pubblicazione: (2026)
HeartLLM: Discretized ECG Tokenization for LLM-Based Diagnostic Reasoning
di: Yang, Jinning, et al.
Pubblicazione: (2025)
di: Yang, Jinning, et al.
Pubblicazione: (2025)
Offline Reinforcement Learning for LLM Multi-Step Reasoning
di: Wang, Huaijie, et al.
Pubblicazione: (2024)
di: Wang, Huaijie, et al.
Pubblicazione: (2024)
TEaR: Improving LLM-based Machine Translation with Systematic Self-Refinement
di: Feng, Zhaopeng, et al.
Pubblicazione: (2024)
di: Feng, Zhaopeng, et al.
Pubblicazione: (2024)
Shapley-Coop: Credit Assignment for Emergent Cooperation in Self-Interested LLM Agents
di: Hua, Yun, et al.
Pubblicazione: (2025)
di: Hua, Yun, et al.
Pubblicazione: (2025)
IndicDB -- Benchmarking Multilingual Text-to-SQL Capabilities in Indian Languages
di: Dawar, Aviral, et al.
Pubblicazione: (2026)
di: Dawar, Aviral, et al.
Pubblicazione: (2026)
Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback
di: Zhang, Xiaoying, et al.
Pubblicazione: (2025)
di: Zhang, Xiaoying, et al.
Pubblicazione: (2025)
Skill-Conditioned Gated Self-Distillation for LLM Reasoning
di: Huang, Jiazhen, et al.
Pubblicazione: (2026)
di: Huang, Jiazhen, et al.
Pubblicazione: (2026)
Documenti analoghi
-
POPE: Learning to Reason on Hard Problems via Privileged On-Policy Exploration
di: Qu, Yuxiao, et al.
Pubblicazione: (2026) -
Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning
di: Qu, Yuxiao, et al.
Pubblicazione: (2025) -
RLAD: Training LLMs to Discover Abstractions for Solving Reasoning Problems
di: Qu, Yuxiao, et al.
Pubblicazione: (2025) -
QED-Nano: Teaching a Tiny Model to Prove Hard Theorems
di: LM-Provers, et al.
Pubblicazione: (2026) -
From Reasoning Chains to Verifiable Subproblems: Curriculum Reinforcement Learning Enables Credit Assignment for LLM Reasoning
di: Jiang, Xitai, et al.
Pubblicazione: (2026)