iGRPO: Self-Feedback-Driven LLM Reasoning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Hatamizadeh, Ali, Prabhumoye, Shrimai, Gitman, Igor, Lu, Ximing, Han, Seungju, Ping, Wei, Choi, Yejin, Kautz, Jan |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Gated DeltaNet-2: Decoupling Erase and Write in Linear Attention
par: Hatamizadeh, Ali, et autres
Publié: (2026)
par: Hatamizadeh, Ali, et autres
Publié: (2026)
Prismatic Synthesis: Gradient-based Data Diversification Boosts Generalization in LLM Reasoning
par: Jung, Jaehun, et autres
Publié: (2025)
par: Jung, Jaehun, et autres
Publié: (2025)
RLP: Reinforcement as a Pretraining Objective
par: Hatamizadeh, Ali, et autres
Publié: (2025)
par: Hatamizadeh, Ali, et autres
Publié: (2025)
Retro-Search: Exploring Untaken Paths for Deeper and Efficient Reasoning
par: Lu, Ximing, et autres
Publié: (2025)
par: Lu, Ximing, et autres
Publié: (2025)
Introspective X Training: Feedback Conditioning Improves Scaling Across all LLM Training Stages
par: Cui, Brandon, et autres
Publié: (2026)
par: Cui, Brandon, et autres
Publié: (2026)
Nemotron-CrossThink: Scaling Self-Learning beyond Math Reasoning
par: Akter, Syeda Nahida, et autres
Publié: (2025)
par: Akter, Syeda Nahida, et autres
Publié: (2025)
Front-Loading Reasoning: The Synergy between Pretraining and Post-Training Data
par: Akter, Syeda Nahida, et autres
Publié: (2025)
par: Akter, Syeda Nahida, et autres
Publié: (2025)
MambaVision: A Hybrid Mamba-Transformer Vision Backbone
par: Hatamizadeh, Ali, et autres
Publié: (2024)
par: Hatamizadeh, Ali, et autres
Publié: (2024)
ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models
par: Liu, Mingjie, et autres
Publié: (2025)
par: Liu, Mingjie, et autres
Publié: (2025)
DiffiT: Diffusion Vision Transformers for Image Generation
par: Hatamizadeh, Ali, et autres
Publié: (2023)
par: Hatamizadeh, Ali, et autres
Publié: (2023)
Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback
par: Zhang, Xiaoying, et autres
Publié: (2025)
par: Zhang, Xiaoying, et autres
Publié: (2025)
Gated Delta Networks: Improving Mamba2 with Delta Rule
par: Yang, Songlin, et autres
Publié: (2024)
par: Yang, Songlin, et autres
Publié: (2024)
AgentKit: Structured LLM Reasoning with Dynamic Graphs
par: Wu, Yue, et autres
Publié: (2024)
par: Wu, Yue, et autres
Publié: (2024)
Verifying the Verifiers: Unveiling Pitfalls and Potentials in Fact Verifiers
par: Seo, Wooseok, et autres
Publié: (2025)
par: Seo, Wooseok, et autres
Publié: (2025)
Maximize Your Data's Potential: Enhancing LLM Accuracy with Two-Phase Pretraining
par: Feng, Steven, et autres
Publié: (2024)
par: Feng, Steven, et autres
Publié: (2024)
ViR: Towards Efficient Vision Retention Backbones
par: Hatamizadeh, Ali, et autres
Publié: (2023)
par: Hatamizadeh, Ali, et autres
Publié: (2023)
Nemotron-CC-Math: A 133 Billion-Token-Scale High Quality Math Pretraining Dataset
par: Mahabadi, Rabeeh Karimi, et autres
Publié: (2025)
par: Mahabadi, Rabeeh Karimi, et autres
Publié: (2025)
Decompose, Mix, Adapt: A Unified Framework for Parameter-Efficient Neural Network Recombination and Compression
par: Tasnim, Nazia, et autres
Publié: (2026)
par: Tasnim, Nazia, et autres
Publié: (2026)
Socratic-MCTS: Test-Time Visual Reasoning by Asking the Right Questions
par: Acuna, David, et autres
Publié: (2025)
par: Acuna, David, et autres
Publié: (2025)
ProfBench: Multi-Domain Rubrics requiring Professional Knowledge to Answer and Judge
par: Wang, Zhilin, et autres
Publié: (2025)
par: Wang, Zhilin, et autres
Publié: (2025)
FasterViT: Fast Vision Transformers with Hierarchical Attention
par: Hatamizadeh, Ali, et autres
Publié: (2023)
par: Hatamizadeh, Ali, et autres
Publié: (2023)
JAMDEC: Unsupervised Authorship Obfuscation using Constrained Decoding over Small Language Models
par: Fisher, Jillian, et autres
Publié: (2024)
par: Fisher, Jillian, et autres
Publié: (2024)
GRPO-$λ$: Credit Assignment improves LLM Reasoning
par: Parthasarathi, Prasanna, et autres
Publié: (2025)
par: Parthasarathi, Prasanna, et autres
Publié: (2025)
NeMo-Inspector: A Visualization Tool for LLM Generation Analysis
par: Gitman, Daria, et autres
Publié: (2025)
par: Gitman, Daria, et autres
Publié: (2025)
Information-Theoretic Distillation for Reference-less Summarization
par: Jung, Jaehun, et autres
Publié: (2024)
par: Jung, Jaehun, et autres
Publié: (2024)
MIND: Math Informed syNthetic Dialogues for Pretraining LLMs
par: Akter, Syeda Nahida, et autres
Publié: (2024)
par: Akter, Syeda Nahida, et autres
Publié: (2024)
Synthetic Mixed Training: Scaling Parametric Knowledge Acquisition Beyond RAG
par: Han, Seungju, et autres
Publié: (2026)
par: Han, Seungju, et autres
Publié: (2026)
Long Grounded Thoughts: Synthesizing Visual Problems and Reasoning Chains at Scale
par: Acuna, David, et autres
Publié: (2025)
par: Acuna, David, et autres
Publié: (2025)
OpenMathInstruct-1: A 1.8 Million Math Instruction Tuning Dataset
par: Toshniwal, Shubham, et autres
Publié: (2024)
par: Toshniwal, Shubham, et autres
Publié: (2024)
Multi-Task GRPO: Reliable LLM Reasoning Across Tasks
par: Ramesh, Shyam Sundhar, et autres
Publié: (2026)
par: Ramesh, Shyam Sundhar, et autres
Publié: (2026)
EDGE-GRPO: Entropy-Driven GRPO with Guided Error Correction for Advantage Diversity
par: Zhang, Xingjian, et autres
Publié: (2025)
par: Zhang, Xingjian, et autres
Publié: (2025)
In-the-Flow Agentic System Optimization for Effective Planning and Tool Use
par: Li, Zhuofeng, et autres
Publié: (2025)
par: Li, Zhuofeng, et autres
Publié: (2025)
Unleashing Hierarchical Reasoning: An LLM-Driven Framework for Training-Free Referring Video Object Segmentation
par: Zhao, Bingrui, et autres
Publié: (2025)
par: Zhao, Bingrui, et autres
Publié: (2025)
AIMO-2 Winning Solution: Building State-of-the-Art Mathematical Reasoning Models with OpenMathReasoning dataset
par: Moshkov, Ivan, et autres
Publié: (2025)
par: Moshkov, Ivan, et autres
Publié: (2025)
The Invisible Leash: Why RLVR May or May Not Escape Its Origin
par: Wu, Fang, et autres
Publié: (2025)
par: Wu, Fang, et autres
Publié: (2025)
Comparative Analysis and Parametric Tuning of PPO, GRPO, and DAPO for LLM Reasoning Enhancement
par: Lian, Yongsheng
Publié: (2025)
par: Lian, Yongsheng
Publié: (2025)
Signal Reshaping for GRPO in Weak-Feedback Agentic Code Repair
par: Li, Jia, et autres
Publié: (2026)
par: Li, Jia, et autres
Publié: (2026)
DeepSearch: Overcome the Bottleneck of Reinforcement Learning with Verifiable Rewards via Monte Carlo Tree Search
par: Wu, Fang, et autres
Publié: (2025)
par: Wu, Fang, et autres
Publié: (2025)
Phenomenal Yet Puzzling: Testing Inductive Reasoning Capabilities of Language Models with Hypothesis Refinement
par: Qiu, Linlu, et autres
Publié: (2023)
par: Qiu, Linlu, et autres
Publié: (2023)
ProRL Agent: Rollout-as-a-Service for RL Training of Multi-Turn LLM Agents
par: Zhang, Hao, et autres
Publié: (2026)
par: Zhang, Hao, et autres
Publié: (2026)
Documents similaires
-
Gated DeltaNet-2: Decoupling Erase and Write in Linear Attention
par: Hatamizadeh, Ali, et autres
Publié: (2026) -
Prismatic Synthesis: Gradient-based Data Diversification Boosts Generalization in LLM Reasoning
par: Jung, Jaehun, et autres
Publié: (2025) -
RLP: Reinforcement as a Pretraining Objective
par: Hatamizadeh, Ali, et autres
Publié: (2025) -
Retro-Search: Exploring Untaken Paths for Deeper and Efficient Reasoning
par: Lu, Ximing, et autres
Publié: (2025) -
Introspective X Training: Feedback Conditioning Improves Scaling Across all LLM Training Stages
par: Cui, Brandon, et autres
Publié: (2026)