Evaluating Parameter Efficient Methods for RLVR
Fuente:
arXiv
Guardado en:
| Autores principales: | Yin, Qingyu, Wu, Yulun, Shen, Zhennan, Li, Sunbowen, Wang, Zhilin, Li, Yanshu, Leong, Chak Tou, Kang, Jiale, Gu, Jinjin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Deeper Insights Without Updates: The Power of In-Context Learning Over Fine-Tuning
por: Yin, Qingyu, et al.
Publicado: (2024)
por: Yin, Qingyu, et al.
Publicado: (2024)
STeCa: Step-level Trajectory Calibration for LLM Agent Learning
por: Wang, Hanlin, et al.
Publicado: (2025)
por: Wang, Hanlin, et al.
Publicado: (2025)
Merlin's Whisper: Enabling Efficient Reasoning in Large Language Models via Black-box Persuasive Prompting
por: Xia, Heming, et al.
Publicado: (2025)
por: Xia, Heming, et al.
Publicado: (2025)
SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution
por: Wang, Hanlin, et al.
Publicado: (2025)
por: Wang, Hanlin, et al.
Publicado: (2025)
Scaling over Scaling: Exploring Test-Time Scaling Plateau in Large Reasoning Models
por: Wang, Jian, et al.
Publicado: (2025)
por: Wang, Jian, et al.
Publicado: (2025)
Finding RELIEF: Shaping Reasoning Behavior without Reasoning Supervision via Belief Engineering
por: Leong, Chak Tou, et al.
Publicado: (2026)
por: Leong, Chak Tou, et al.
Publicado: (2026)
Data-Efficient RLVR via Off-Policy Influence Guidance
por: Zhu, Erle, et al.
Publicado: (2025)
por: Zhu, Erle, et al.
Publicado: (2025)
Why Safeguarded Ships Run Aground? Aligned Large Language Models' Safety Mechanisms Tend to Be Anchored in The Template Region
por: Leong, Chak Tou, et al.
Publicado: (2025)
por: Leong, Chak Tou, et al.
Publicado: (2025)
Improving Sampling Efficiency in RLVR through Adaptive Rollout and Response Reuse
por: Zhang, Yuheng, et al.
Publicado: (2025)
por: Zhang, Yuheng, et al.
Publicado: (2025)
Probing the Difficulty Perception Mechanism of Large Language Models
por: Lee, Sunbowen, et al.
Publicado: (2025)
por: Lee, Sunbowen, et al.
Publicado: (2025)
Protein as a Second Language for LLMs
por: Chen, Xinhui, et al.
Publicado: (2025)
por: Chen, Xinhui, et al.
Publicado: (2025)
QET: Enhancing Quantized LLM Parameters and KV cache Compression through Element Substitution and Residual Clustering
por: Wang, Yanshu, et al.
Publicado: (2024)
por: Wang, Yanshu, et al.
Publicado: (2024)
When and What to Ask: AskBench and Rubric-Guided RLVR for LLM Clarification
por: Zhao, Jiale, et al.
Publicado: (2026)
por: Zhao, Jiale, et al.
Publicado: (2026)
Self-Distilled RLVR
por: Yang, Chenxu, et al.
Publicado: (2026)
por: Yang, Chenxu, et al.
Publicado: (2026)
JudgeRLVR: Judge First, Generate Second for Efficient Reasoning
por: Duo, Jiangshan, et al.
Publicado: (2026)
por: Duo, Jiangshan, et al.
Publicado: (2026)
Induction Head Toxicity Mechanistically Explains Repetition Curse in Large Language Models
por: Wang, Shuxun, et al.
Publicado: (2025)
por: Wang, Shuxun, et al.
Publicado: (2025)
Not only where, But when: Temporal Scheduling for RLVR
por: Zhang, Jinghao, et al.
Publicado: (2026)
por: Zhang, Jinghao, et al.
Publicado: (2026)
RLVR-World: Training World Models with Reinforcement Learning
por: Wu, Jialong, et al.
Publicado: (2025)
por: Wu, Jialong, et al.
Publicado: (2025)
RLVR Training of LLMs Does Not Improve Thinking Ability for General QA: Evaluation Method and a Simple Solution
por: Li, Kaiyuan, et al.
Publicado: (2026)
por: Li, Kaiyuan, et al.
Publicado: (2026)
When to Stop Reusing: Dynamic Gradient Gating for Sample-Efficient RLVR
por: Miao, Yuchun, et al.
Publicado: (2026)
por: Miao, Yuchun, et al.
Publicado: (2026)
Counterfactual experience augmented off-policy reinforcement learning
por: Lee, Sunbowen, et al.
Publicado: (2025)
por: Lee, Sunbowen, et al.
Publicado: (2025)
WIMLE: Uncertainty-Aware World Models with IMLE for Sample-Efficient Continuous Control
por: Aghabozorgi, Mehran, et al.
Publicado: (2026)
por: Aghabozorgi, Mehran, et al.
Publicado: (2026)
ELAS: Efficient Pre-Training of Low-Rank Large Language Models via 2:4 Activation Sparsity
por: Li, Jiaxi, et al.
Publicado: (2026)
por: Li, Jiaxi, et al.
Publicado: (2026)
Efficiently Aligning Draft Models via Parameter- and Data-Efficient Adaptation
por: Lin, Luxi, et al.
Publicado: (2026)
por: Lin, Luxi, et al.
Publicado: (2026)
IRDS: Interpretable RLVR Data Selection via Verifier-Coupled Sparse Autoencoder Coverage
por: Li, Yuhan, et al.
Publicado: (2026)
por: Li, Yuhan, et al.
Publicado: (2026)
Refusal Falls off a Cliff: How Safety Alignment Fails in Reasoning?
por: Yin, Qingyu, et al.
Publicado: (2025)
por: Yin, Qingyu, et al.
Publicado: (2025)
Quantile Advantage Estimation: Stabilizing RLVR for LLM Reasoning
por: Wu, Junkang, et al.
Publicado: (2025)
por: Wu, Junkang, et al.
Publicado: (2025)
ParamReL: Learning Parameter Space Representation via Progressively Encoding Bayesian Flow Networks
por: Wu, Zhangkai, et al.
Publicado: (2024)
por: Wu, Zhangkai, et al.
Publicado: (2024)
Asymmetric Advantage Modulation Calibrates Entropy Dynamics in RLVR
por: Gu, Hengrui, et al.
Publicado: (2026)
por: Gu, Hengrui, et al.
Publicado: (2026)
Beyond Variance: Prompt-Efficient RLVR via Rare-Event Amplification and Bidirectional Pairing
por: Pang, Yujuan, et al.
Publicado: (2026)
por: Pang, Yujuan, et al.
Publicado: (2026)
Exploration vs Exploitation: Rethinking RLVR through Clipping, Entropy, and Spurious Reward
por: Chen, Peter, et al.
Publicado: (2025)
por: Chen, Peter, et al.
Publicado: (2025)
Efficient RLVR Training via Weighted Mutual Information Data Selection
por: Zhou, Xinyu, et al.
Publicado: (2026)
por: Zhou, Xinyu, et al.
Publicado: (2026)
Symbolic Representation for Any-to-Any Generative Tasks
por: Chen, Jiaqi, et al.
Publicado: (2025)
por: Chen, Jiaqi, et al.
Publicado: (2025)
Athena: Efficient Block-Wise Post-Training Quantization for Large Language Models Using Second-Order Matrix Derivative Information
por: Wang, Yanshu, et al.
Publicado: (2024)
por: Wang, Yanshu, et al.
Publicado: (2024)
On the Direction of RLVR Updates for LLM Reasoning: Identification and Exploitation
por: Huang, Kexin, et al.
Publicado: (2026)
por: Huang, Kexin, et al.
Publicado: (2026)
PEFT-Arena: Understanding Parameter-Efficient Finetuning from a Stability-Plasticity Perspective
por: Huang, Yangyi, et al.
Publicado: (2026)
por: Huang, Yangyi, et al.
Publicado: (2026)
Where to Spend Rollouts: Hit-Utility Optimal Rollout Allocation for Group-Based RLVR
por: Wang, Tao, et al.
Publicado: (2026)
por: Wang, Tao, et al.
Publicado: (2026)
SAGE: Shaping Anchors for Guided Exploration in RLVR of LLMs
por: Lee, Chanuk, et al.
Publicado: (2026)
por: Lee, Chanuk, et al.
Publicado: (2026)
Linear Dynamics in the RLVR Training of Large Language Models
por: Wang, Tianle, et al.
Publicado: (2026)
por: Wang, Tianle, et al.
Publicado: (2026)
Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity
por: Lochab, Anamika, et al.
Publicado: (2026)
por: Lochab, Anamika, et al.
Publicado: (2026)
Ejemplares similares
-
Deeper Insights Without Updates: The Power of In-Context Learning Over Fine-Tuning
por: Yin, Qingyu, et al.
Publicado: (2024) -
STeCa: Step-level Trajectory Calibration for LLM Agent Learning
por: Wang, Hanlin, et al.
Publicado: (2025) -
Merlin's Whisper: Enabling Efficient Reasoning in Large Language Models via Black-box Persuasive Prompting
por: Xia, Heming, et al.
Publicado: (2025) -
SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution
por: Wang, Hanlin, et al.
Publicado: (2025) -
Scaling over Scaling: Exploring Test-Time Scaling Plateau in Large Reasoning Models
por: Wang, Jian, et al.
Publicado: (2025)