From Trial-and-Error to Improvement: A Systematic Analysis of LLM Exploration Mechanisms in RLVR
Fuente:
arXiv
Guardado en:
| Autores principales: | Deng, Jia, Chen, Jie, Chen, Zhipeng, Cheng, Daixuan, Bai, Fei, Zhang, Beichen, Min, Yinqian, Gao, Yanzipeng, Zhao, Wayne Xin, Wen, Ji-Rong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Low-rank Optimization Trajectories Modeling for LLM RLVR Acceleration
por: Chen, Zhipeng, et al.
Publicado: (2026)
por: Chen, Zhipeng, et al.
Publicado: (2026)
Decomposing the Entropy-Performance Exchange: The Missing Keys to Unlocking Effective Reinforcement Learning
por: Deng, Jia, et al.
Publicado: (2025)
por: Deng, Jia, et al.
Publicado: (2025)
Towards Effective Code-Integrated Reasoning
por: Bai, Fei, et al.
Publicado: (2025)
por: Bai, Fei, et al.
Publicado: (2025)
An Empirical Study on Eliciting and Improving R1-like Reasoning Models
por: Chen, Zhipeng, et al.
Publicado: (2025)
por: Chen, Zhipeng, et al.
Publicado: (2025)
ICPC-Eval: Probing the Frontiers of LLM Reasoning with Competitive Programming Contests
por: Xu, Shiyi, et al.
Publicado: (2025)
por: Xu, Shiyi, et al.
Publicado: (2025)
Challenging the Boundaries of Reasoning: An Olympiad-Level Math Benchmark for Large Language Models
por: Sun, Haoxiang, et al.
Publicado: (2025)
por: Sun, Haoxiang, et al.
Publicado: (2025)
Semantic-Space Exploration and Exploitation in RLVR for LLM Reasoning
por: Huang, Fanding, et al.
Publicado: (2025)
por: Huang, Fanding, et al.
Publicado: (2025)
JiuZhang3.0: Efficiently Improving Mathematical Reasoning by Training Small Data Synthesis Models
por: Zhou, Kun, et al.
Publicado: (2024)
por: Zhou, Kun, et al.
Publicado: (2024)
R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning
por: Song, Huatong, et al.
Publicado: (2025)
por: Song, Huatong, et al.
Publicado: (2025)
Reasoning with Exploration: An Entropy Perspective
por: Cheng, Daixuan, et al.
Publicado: (2025)
por: Cheng, Daixuan, et al.
Publicado: (2025)
Adaptive Ability Decomposing for Unlocking Large Reasoning Model Effective Reinforcement Learning
por: Chen, Zhipeng, et al.
Publicado: (2026)
por: Chen, Zhipeng, et al.
Publicado: (2026)
Not Everything is All You Need: Toward Low-Redundant Optimization for Large Language Model Alignment
por: Chen, Zhipeng, et al.
Publicado: (2024)
por: Chen, Zhipeng, et al.
Publicado: (2024)
Trial and Error: Exploration-Based Trajectory Optimization for LLM Agents
por: Song, Yifan, et al.
Publicado: (2024)
por: Song, Yifan, et al.
Publicado: (2024)
Slow Thinking for Sequential Recommendation
por: Zhang, Junjie, et al.
Publicado: (2025)
por: Zhang, Junjie, et al.
Publicado: (2025)
Enhancing LLM Reasoning with Reward-guided Tree Search
por: Jiang, Jinhao, et al.
Publicado: (2024)
por: Jiang, Jinhao, et al.
Publicado: (2024)
Computer Environments Elicit General Agentic Intelligence in LLMs
por: Cheng, Daixuan, et al.
Publicado: (2026)
por: Cheng, Daixuan, et al.
Publicado: (2026)
Delay, Plateau, or Collapse: Evaluating the Impact of Systematic Verification Error on RLVR
por: Egashira, Kazuki, et al.
Publicado: (2026)
por: Egashira, Kazuki, et al.
Publicado: (2026)
Extracting and Combining Abilities For Building Multi-lingual Ability-enhanced Large Language Models
por: Chen, Zhipeng, et al.
Publicado: (2024)
por: Chen, Zhipeng, et al.
Publicado: (2024)
Controllable Exploration in Hybrid-Policy RLVR for Multi-Modal Reasoning
por: Huang, Zhuoxu, et al.
Publicado: (2026)
por: Huang, Zhuoxu, et al.
Publicado: (2026)
Unveiling the Flaws: Exploring Imperfections in Synthetic Data and Mitigation Strategies for Large Language Models
por: Chen, Jie, et al.
Publicado: (2024)
por: Chen, Jie, et al.
Publicado: (2024)
Sticker-TTS: Learn to Utilize Historical Experience with a Sticker-driven Test-Time Scaling Framework
por: Chen, Jie, et al.
Publicado: (2025)
por: Chen, Jie, et al.
Publicado: (2025)
MAGE: Mutual Attestation for a Group of Enclaves without Trusted Third Parties
por: Chen, Guoxing, et al.
Publicado: (2020)
por: Chen, Guoxing, et al.
Publicado: (2020)
Improving Large Language Models via Fine-grained Reinforcement Learning with Minimum Editing Constraint
por: Chen, Zhipeng, et al.
Publicado: (2024)
por: Chen, Zhipeng, et al.
Publicado: (2024)
Depth-Breadth Synergy in RLVR: Unlocking LLM Reasoning Gains with Adaptive Exploration
por: Yang, Zhicheng, et al.
Publicado: (2025)
por: Yang, Zhicheng, et al.
Publicado: (2025)
Exploration vs Exploitation: Rethinking RLVR through Clipping, Entropy, and Spurious Reward
por: Chen, Peter, et al.
Publicado: (2025)
por: Chen, Peter, et al.
Publicado: (2025)
Imitate, Explore, and Self-Improve: A Reproduction Report on Slow-thinking Reasoning Systems
por: Min, Yingqian, et al.
Publicado: (2024)
por: Min, Yingqian, et al.
Publicado: (2024)
Neuron-based Personality Trait Induction in Large Language Models
por: Deng, Jia, et al.
Publicado: (2024)
por: Deng, Jia, et al.
Publicado: (2024)
Irrational Complex Rotations Empower Low-bit Optimizers
por: Tian, Zhen, et al.
Publicado: (2025)
por: Tian, Zhen, et al.
Publicado: (2025)
Covariate Ordered Systematic Sampling as an Improvement to Randomized Controlled Trials
por: Jobson, Deddy, et al.
Publicado: (2024)
por: Jobson, Deddy, et al.
Publicado: (2024)
The Improvement of General Condition and Immunity Function of CKD After Treatment With Bailing Capsule: A Randomized Clinical Trial
por: Wanjia Chen, et al.
Publicado: (2025)
por: Wanjia Chen, et al.
Publicado: (2025)
How You Begin is How You Reason: Driving Exploration in RLVR via Prefix-Tuned Priors
por: Xu, Yifan, et al.
Publicado: (2026)
por: Xu, Yifan, et al.
Publicado: (2026)
SWE-Master: Unleashing the Potential of Software Engineering Agents via Post-Training
por: Song, Huatong, et al.
Publicado: (2026)
por: Song, Huatong, et al.
Publicado: (2026)
Listwise Policy Optimization: Group-based RLVR as Target-Projection on the LLM Response Simplex
por: Qu, Yun, et al.
Publicado: (2026)
por: Qu, Yun, et al.
Publicado: (2026)
ClawGym: A Scalable Framework for Building Effective Claw Agents
por: Bai, Fei, et al.
Publicado: (2026)
por: Bai, Fei, et al.
Publicado: (2026)
SAGE: Shaping Anchors for Guided Exploration in RLVR of LLMs
por: Lee, Chanuk, et al.
Publicado: (2026)
por: Lee, Chanuk, et al.
Publicado: (2026)
Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models
por: Chen, Zhipeng, et al.
Publicado: (2025)
por: Chen, Zhipeng, et al.
Publicado: (2025)
Universal Item Tokenization for Transferable Generative Recommendation
por: Zheng, Bowen, et al.
Publicado: (2025)
por: Zheng, Bowen, et al.
Publicado: (2025)
Toward Autonomous Long-Horizon Engineering for ML Research
por: Chen, Guoxin, et al.
Publicado: (2026)
por: Chen, Guoxin, et al.
Publicado: (2026)
Virgo: A Preliminary Exploration on Reproducing o1-like MLLM
por: Du, Yifan, et al.
Publicado: (2025)
por: Du, Yifan, et al.
Publicado: (2025)
ETTRL: Balancing Exploration and Exploitation in LLM Test-Time Reinforcement Learning Via Entropy Mechanism
por: Liu, Jia, et al.
Publicado: (2025)
por: Liu, Jia, et al.
Publicado: (2025)
Ejemplares similares
-
Low-rank Optimization Trajectories Modeling for LLM RLVR Acceleration
por: Chen, Zhipeng, et al.
Publicado: (2026) -
Decomposing the Entropy-Performance Exchange: The Missing Keys to Unlocking Effective Reinforcement Learning
por: Deng, Jia, et al.
Publicado: (2025) -
Towards Effective Code-Integrated Reasoning
por: Bai, Fei, et al.
Publicado: (2025) -
An Empirical Study on Eliciting and Improving R1-like Reasoning Models
por: Chen, Zhipeng, et al.
Publicado: (2025) -
ICPC-Eval: Probing the Frontiers of LLM Reasoning with Competitive Programming Contests
por: Xu, Shiyi, et al.
Publicado: (2025)