Semantic-Space Exploration and Exploitation in RLVR for LLM Reasoning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Huang, Fanding, Huang, Guanbo, Fan, Xiao, He, Yi, Liang, Xiao, Chen, Xiao, Jiang, Qinting, Khan, Faisal Nadeem, Jiang, Jingyan, Wang, Zhi |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
COSMIC: Clique-Oriented Semantic Multi-space Integration for Robust CLIP Test-Time Adaptation
par: Huang, Fanding, et autres
Publié: (2025)
par: Huang, Fanding, et autres
Publié: (2025)
MoETTA: Test-Time Adaptation Under Mixed Distribution Shifts with MoE-LayerNorm
par: Fan, Xiao, et autres
Publié: (2025)
par: Fan, Xiao, et autres
Publié: (2025)
Test-Time Distillation for Continual Model Adaptation
par: Chen, Xiao, et autres
Publié: (2025)
par: Chen, Xiao, et autres
Publié: (2025)
Exploration vs Exploitation: Rethinking RLVR through Clipping, Entropy, and Spurious Reward
par: Chen, Peter, et autres
Publié: (2025)
par: Chen, Peter, et autres
Publié: (2025)
On the Direction of RLVR Updates for LLM Reasoning: Identification and Exploitation
par: Huang, Kexin, et autres
Publié: (2026)
par: Huang, Kexin, et autres
Publié: (2026)
B-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasoners
par: Zeng, Weihao, et autres
Publié: (2024)
par: Zeng, Weihao, et autres
Publié: (2024)
Enhancing Quantitative Reasoning Skills of Large Language Models through Dimension Perception
par: Huang, Yuncheng, et autres
Publié: (2023)
par: Huang, Yuncheng, et autres
Publié: (2023)
Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR
par: Kim, Jeonghye, et autres
Publié: (2026)
par: Kim, Jeonghye, et autres
Publié: (2026)
ExpLang: Improved Exploration and Exploitation in LLM Reasoning with On-Policy Thinking Language Selection
par: Gao, Changjiang, et autres
Publié: (2026)
par: Gao, Changjiang, et autres
Publié: (2026)
The Unlearnability Phenomenon in RLVR for Language Models
par: Chen, Yulin, et autres
Publié: (2026)
par: Chen, Yulin, et autres
Publié: (2026)
Nonsense Helps: Prompt Space Perturbation Broadens Reasoning Exploration
par: Huang, Langlin, et autres
Publié: (2026)
par: Huang, Langlin, et autres
Publié: (2026)
How Far Can Unsupervised RLVR Scale LLM Training?
par: He, Bingxiang, et autres
Publié: (2026)
par: He, Bingxiang, et autres
Publié: (2026)
Does LLM Alignment Really Need Diversity? An Empirical Study of Adapting RLVR Methods for Moral Reasoning
par: Zhang, Zhaowei, et autres
Publié: (2026)
par: Zhang, Zhaowei, et autres
Publié: (2026)
Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models
par: Chen, Zhipeng, et autres
Publié: (2025)
par: Chen, Zhipeng, et autres
Publié: (2025)
Depth-Breadth Synergy in RLVR: Unlocking LLM Reasoning Gains with Adaptive Exploration
par: Yang, Zhicheng, et autres
Publié: (2025)
par: Yang, Zhicheng, et autres
Publié: (2025)
Laying the Foundation First? Investigating the Generalization from Atomic Skills to Complex Reasoning Tasks
par: Huang, Yuncheng, et autres
Publié: (2024)
par: Huang, Yuncheng, et autres
Publié: (2024)
SAGE: Shaping Anchors for Guided Exploration in RLVR of LLMs
par: Lee, Chanuk, et autres
Publié: (2026)
par: Lee, Chanuk, et autres
Publié: (2026)
SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning
par: Liang, Xiao, et autres
Publié: (2025)
par: Liang, Xiao, et autres
Publié: (2025)
JudgeRLVR: Judge First, Generate Second for Efficient Reasoning
par: Duo, Jiangshan, et autres
Publié: (2026)
par: Duo, Jiangshan, et autres
Publié: (2026)
Recycling Failures: Salvaging Exploration in RLVR via Fine-Grained Off-Policy Guidance
par: Ren, Yanwei, et autres
Publié: (2026)
par: Ren, Yanwei, et autres
Publié: (2026)
When Greedy Wins: Emergent Exploitation Bias in Meta-Bandit LLM Training
par: Chen, Sanxing, et autres
Publié: (2025)
par: Chen, Sanxing, et autres
Publié: (2025)
Improving RL Exploration for LLM Reasoning through Retrospective Replay
par: Dou, Shihan, et autres
Publié: (2025)
par: Dou, Shihan, et autres
Publié: (2025)
Discover Your Neighbors: Advanced Stable Test-Time Adaptation in Dynamic World
par: Jiang, Qinting, et autres
Publié: (2024)
par: Jiang, Qinting, et autres
Publié: (2024)
CLIPO: Contrastive Learning in Policy Optimization Generalizes RLVR
par: Cui, Sijia, et autres
Publié: (2026)
par: Cui, Sijia, et autres
Publié: (2026)
Offline Exploration-Aware Fine-Tuning for Long-Chain Mathematical Reasoning
par: Mu, Yongyu, et autres
Publié: (2026)
par: Mu, Yongyu, et autres
Publié: (2026)
You Only Need Minimal RLVR Training: Extrapolating LLMs via Rank-1 Trajectories
par: Wei, Zhepei, et autres
Publié: (2026)
par: Wei, Zhepei, et autres
Publié: (2026)
Quantile Advantage Estimation: Stabilizing RLVR for LLM Reasoning
par: Wu, Junkang, et autres
Publié: (2025)
par: Wu, Junkang, et autres
Publié: (2025)
Self-Distilled RLVR
par: Yang, Chenxu, et autres
Publié: (2026)
par: Yang, Chenxu, et autres
Publié: (2026)
DSDR: Dual-Scale Diversity Regularization for Exploration in LLM Reasoning
par: Wan, Zhongwei, et autres
Publié: (2026)
par: Wan, Zhongwei, et autres
Publié: (2026)
Low-rank Optimization Trajectories Modeling for LLM RLVR Acceleration
par: Chen, Zhipeng, et autres
Publié: (2026)
par: Chen, Zhipeng, et autres
Publié: (2026)
Token Hidden Reward: Steering Exploration-Exploitation in Group Relative Deep Reinforcement Learning
par: Deng, Wenlong, et autres
Publié: (2025)
par: Deng, Wenlong, et autres
Publié: (2025)
A Scalable Multi-LLM Collaboration System with Retrieval-based Selection and Exploration-Exploitation-Driven Enhancement
par: Tang, Shengji, et autres
Publié: (2025)
par: Tang, Shengji, et autres
Publié: (2025)
Outcome-based Exploration for LLM Reasoning
par: Song, Yuda, et autres
Publié: (2025)
par: Song, Yuda, et autres
Publié: (2025)
Generalization of RLVR Using Causal Reasoning as a Testbed
par: Lu, Brian, et autres
Publié: (2025)
par: Lu, Brian, et autres
Publié: (2025)
Exploring Key Point Analysis with Pairwise Generation and Graph Partitioning
par: Li, Xiao, et autres
Publié: (2024)
par: Li, Xiao, et autres
Publié: (2024)
Controllable Exploration in Hybrid-Policy RLVR for Multi-Modal Reasoning
par: Huang, Zhuoxu, et autres
Publié: (2026)
par: Huang, Zhuoxu, et autres
Publié: (2026)
Disentangling Exploration of Large Language Models by Optimal Exploitation
par: Grams, Tim, et autres
Publié: (2025)
par: Grams, Tim, et autres
Publié: (2025)
Feature-Based Instance Neighbor Discovery: Advanced Stable Test-Time Adaptation in Dynamic World
par: Jiang, Qinting, et autres
Publié: (2025)
par: Jiang, Qinting, et autres
Publié: (2025)
HTPO: Towards Exploration-Exploitation Balanced Policy Optimization via Hierarchical Token-level Objective Control
par: Yao, Xincheng, et autres
Publié: (2026)
par: Yao, Xincheng, et autres
Publié: (2026)
Skill-Conditioned Gated Self-Distillation for LLM Reasoning
par: Huang, Jiazhen, et autres
Publié: (2026)
par: Huang, Jiazhen, et autres
Publié: (2026)
Documents similaires
-
COSMIC: Clique-Oriented Semantic Multi-space Integration for Robust CLIP Test-Time Adaptation
par: Huang, Fanding, et autres
Publié: (2025) -
MoETTA: Test-Time Adaptation Under Mixed Distribution Shifts with MoE-LayerNorm
par: Fan, Xiao, et autres
Publié: (2025) -
Test-Time Distillation for Continual Model Adaptation
par: Chen, Xiao, et autres
Publié: (2025) -
Exploration vs Exploitation: Rethinking RLVR through Clipping, Entropy, and Spurious Reward
par: Chen, Peter, et autres
Publié: (2025) -
On the Direction of RLVR Updates for LLM Reasoning: Identification and Exploitation
par: Huang, Kexin, et autres
Publié: (2026)