RAGEN-2: Reasoning Collapse in Agentic RL
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Zihan, Gui, Chi, Jin, Xing, Wang, Qineng, Liu, Licheng, Wang, Kangrui, Chen, Shiqi, Li, Linjie, Yang, Zhengyuan, Zhang, Pingyue, Lu, Yiping, Wu, Jiajun, Fei-Fei, Li, Wang, Lijuan, Choi, Yejin, Li, Manling |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning
par: Wang, Zihan, et autres
Publié: (2025)
par: Wang, Zihan, et autres
Publié: (2025)
VAGEN: Reinforcing World Model Reasoning for Multi-Turn VLM Agents
par: Wang, Kangrui, et autres
Publié: (2025)
par: Wang, Kangrui, et autres
Publié: (2025)
Planning with the Views via Scene Self-Exploration
par: Wang, Kangrui, et autres
Publié: (2026)
par: Wang, Kangrui, et autres
Publié: (2026)
Theory of Space: Can Foundation Models Construct Spatial Beliefs through Active Exploration?
par: Zhang, Pingyue, et autres
Publié: (2026)
par: Zhang, Pingyue, et autres
Publié: (2026)
MindCube: Spatial Mental Modeling from Limited Views
par: Wang, Qineng, et autres
Publié: (2025)
par: Wang, Qineng, et autres
Publié: (2025)
A Simple "Try Again" Can Elicit Multi-Turn LLM Reasoning
par: Liu, Licheng, et autres
Publié: (2025)
par: Liu, Licheng, et autres
Publié: (2025)
Internalizing World Models via Self-Play Finetuning for Agentic RL
par: Chen, Shiqi, et autres
Publié: (2025)
par: Chen, Shiqi, et autres
Publié: (2025)
Learning from Trials and Errors: Reflective Test-Time Planning for Embodied LLMs
par: Hong, Yining, et autres
Publié: (2026)
par: Hong, Yining, et autres
Publié: (2026)
Embodied Agent Interface: Benchmarking LLMs for Embodied Decision Making
par: Li, Manling, et autres
Publié: (2024)
par: Li, Manling, et autres
Publié: (2024)
Beyond Words: Advancing Long-Text Image Generation via Multimodal Autoregressive Models
par: Wang, Alex Jinpeng, et autres
Publié: (2025)
par: Wang, Alex Jinpeng, et autres
Publié: (2025)
ESI-Bench: Towards Embodied Spatial Intelligence that Closes the Perception-Action Loop
par: Hong, Yining, et autres
Publié: (2026)
par: Hong, Yining, et autres
Publié: (2026)
Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark
par: Hao, Yunzhuo, et autres
Publié: (2025)
par: Hao, Yunzhuo, et autres
Publié: (2025)
ImageGen-CoT: Enhancing Text-to-Image In-context Learning with Chain-of-Thought Reasoning
par: Liao, Jiaqi, et autres
Publié: (2025)
par: Liao, Jiaqi, et autres
Publié: (2025)
ENACT: Evaluating Embodied Cognition with World Modeling of Egocentric Interaction
par: Wang, Qineng, et autres
Publié: (2025)
par: Wang, Qineng, et autres
Publié: (2025)
Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning
par: Ni, Minheng, et autres
Publié: (2025)
par: Ni, Minheng, et autres
Publié: (2025)
Bring Metric Functions into Diffusion Models
par: An, Jie, et autres
Publié: (2024)
par: An, Jie, et autres
Publié: (2024)
ODESteer: A Unified ODE-Based Steering Framework for LLM Alignment
par: Zhao, Hongjue, et autres
Publié: (2026)
par: Zhao, Hongjue, et autres
Publié: (2026)
Diagnostic Benchmark and Iterative Inpainting for Layout-Guided Image Generation
par: Cho, Jaemin, et autres
Publié: (2023)
par: Cho, Jaemin, et autres
Publié: (2023)
What makes Reasoning Models Different? Follow the Reasoning Leader for Efficient Decoding
par: Li, Ming, et autres
Publié: (2025)
par: Li, Ming, et autres
Publié: (2025)
LiVOS: Light Video Object Segmentation with Gated Linear Matching
par: Liu, Qin, et autres
Publié: (2024)
par: Liu, Qin, et autres
Publié: (2024)
MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities
par: Yu, Weihao, et autres
Publié: (2023)
par: Yu, Weihao, et autres
Publié: (2023)
SoTA with Less: MCTS-Guided Sample Selection for Data-Efficient Visual Reasoning Self-Improvement
par: Wang, Xiyao, et autres
Publié: (2025)
par: Wang, Xiyao, et autres
Publié: (2025)
Idea2Img: Iterative Self-Refinement with GPT-4V(ision) for Automatic Image Design and Generation
par: Yang, Zhengyuan, et autres
Publié: (2023)
par: Yang, Zhengyuan, et autres
Publié: (2023)
Entity6K: A Large Open-Domain Evaluation Dataset for Real-World Entity Recognition
par: Qiu, Jielin, et autres
Publié: (2024)
par: Qiu, Jielin, et autres
Publié: (2024)
Chain-of-Experts: Unlocking the Communication Power of Mixture-of-Experts Models
par: Wang, Zihan, et autres
Publié: (2025)
par: Wang, Zihan, et autres
Publié: (2025)
STITCH: Simultaneous Thinking and Talking with Chunked Reasoning for Spoken Language Models
par: Chiang, Cheng-Han, et autres
Publié: (2025)
par: Chiang, Cheng-Han, et autres
Publié: (2025)
Visually Descriptive Language Model for Vector Graphics Reasoning
par: Wang, Zhenhailong, et autres
Publié: (2024)
par: Wang, Zhenhailong, et autres
Publié: (2024)
SENTINEL: A Multi-Level Formal Framework for Safety Evaluation of Foundation Model-based Embodied Agents
par: Zhan, Simon Sinong, et autres
Publié: (2025)
par: Zhan, Simon Sinong, et autres
Publié: (2025)
ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning
par: Lin, Zihan, et autres
Publié: (2026)
par: Lin, Zihan, et autres
Publié: (2026)
EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents
par: Yang, Rui, et autres
Publié: (2025)
par: Yang, Rui, et autres
Publié: (2025)
Glance: Accelerating Diffusion Models with 1 Sample
par: Dong, Zhuobai, et autres
Publié: (2025)
par: Dong, Zhuobai, et autres
Publié: (2025)
V-MAGE: A Game Evaluation Framework for Assessing Vision-Centric Capabilities in Multimodal Large Language Models
par: Zheng, Xiangxi, et autres
Publié: (2025)
par: Zheng, Xiangxi, et autres
Publié: (2025)
TextGround4M: A Prompt-Aligned Dataset for Layout-Aware Text Rendering
par: Mao, Dongxing, et autres
Publié: (2026)
par: Mao, Dongxing, et autres
Publié: (2026)
Certainly Uncertain: A Benchmark and Metric for Multimodal Epistemic and Aleatoric Awareness
par: Chandu, Khyathi Raghavi, et autres
Publié: (2024)
par: Chandu, Khyathi Raghavi, et autres
Publié: (2024)
CLORE: Content-Level Optimization for Reasoning Efficiency
par: Wu, Yuyang, et autres
Publié: (2026)
par: Wu, Yuyang, et autres
Publié: (2026)
ThinkMorph: Emergent Properties in Multimodal Interleaved Chain-of-Thought Reasoning
par: Gu, Jiawei, et autres
Publié: (2025)
par: Gu, Jiawei, et autres
Publié: (2025)
COSMO: COntrastive Streamlined MultimOdal Model with Interleaved Pre-Training
par: Wang, Alex Jinpeng, et autres
Publié: (2024)
par: Wang, Alex Jinpeng, et autres
Publié: (2024)
T*: Re-thinking Temporal Search for Long-Form Video Understanding
par: Ye, Jinhui, et autres
Publié: (2025)
par: Ye, Jinhui, et autres
Publié: (2025)
Computer-Use Agents as Judges for Generative User Interface
par: Lin, Kevin Qinghong, et autres
Publié: (2025)
par: Lin, Kevin Qinghong, et autres
Publié: (2025)
Rethinking the Bounds of LLM Reasoning: Are Multi-Agent Discussions the Key?
par: Wang, Qineng, et autres
Publié: (2024)
par: Wang, Qineng, et autres
Publié: (2024)
Documents similaires
-
RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning
par: Wang, Zihan, et autres
Publié: (2025) -
VAGEN: Reinforcing World Model Reasoning for Multi-Turn VLM Agents
par: Wang, Kangrui, et autres
Publié: (2025) -
Planning with the Views via Scene Self-Exploration
par: Wang, Kangrui, et autres
Publié: (2026) -
Theory of Space: Can Foundation Models Construct Spatial Beliefs through Active Exploration?
par: Zhang, Pingyue, et autres
Publié: (2026) -
MindCube: Spatial Mental Modeling from Limited Views
par: Wang, Qineng, et autres
Publié: (2025)