Evaluating Parameter Efficient Methods for RLVR
Fuente:
arXiv
Salvato in:
| Autori principali: | Yin, Qingyu, Wu, Yulun, Shen, Zhennan, Li, Sunbowen, Wang, Zhilin, Li, Yanshu, Leong, Chak Tou, Kang, Jiale, Gu, Jinjin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Deeper Insights Without Updates: The Power of In-Context Learning Over Fine-Tuning
di: Yin, Qingyu, et al.
Pubblicazione: (2024)
di: Yin, Qingyu, et al.
Pubblicazione: (2024)
STeCa: Step-level Trajectory Calibration for LLM Agent Learning
di: Wang, Hanlin, et al.
Pubblicazione: (2025)
di: Wang, Hanlin, et al.
Pubblicazione: (2025)
Merlin's Whisper: Enabling Efficient Reasoning in Large Language Models via Black-box Persuasive Prompting
di: Xia, Heming, et al.
Pubblicazione: (2025)
di: Xia, Heming, et al.
Pubblicazione: (2025)
SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution
di: Wang, Hanlin, et al.
Pubblicazione: (2025)
di: Wang, Hanlin, et al.
Pubblicazione: (2025)
Scaling over Scaling: Exploring Test-Time Scaling Plateau in Large Reasoning Models
di: Wang, Jian, et al.
Pubblicazione: (2025)
di: Wang, Jian, et al.
Pubblicazione: (2025)
Finding RELIEF: Shaping Reasoning Behavior without Reasoning Supervision via Belief Engineering
di: Leong, Chak Tou, et al.
Pubblicazione: (2026)
di: Leong, Chak Tou, et al.
Pubblicazione: (2026)
Data-Efficient RLVR via Off-Policy Influence Guidance
di: Zhu, Erle, et al.
Pubblicazione: (2025)
di: Zhu, Erle, et al.
Pubblicazione: (2025)
Why Safeguarded Ships Run Aground? Aligned Large Language Models' Safety Mechanisms Tend to Be Anchored in The Template Region
di: Leong, Chak Tou, et al.
Pubblicazione: (2025)
di: Leong, Chak Tou, et al.
Pubblicazione: (2025)
Improving Sampling Efficiency in RLVR through Adaptive Rollout and Response Reuse
di: Zhang, Yuheng, et al.
Pubblicazione: (2025)
di: Zhang, Yuheng, et al.
Pubblicazione: (2025)
Probing the Difficulty Perception Mechanism of Large Language Models
di: Lee, Sunbowen, et al.
Pubblicazione: (2025)
di: Lee, Sunbowen, et al.
Pubblicazione: (2025)
Protein as a Second Language for LLMs
di: Chen, Xinhui, et al.
Pubblicazione: (2025)
di: Chen, Xinhui, et al.
Pubblicazione: (2025)
QET: Enhancing Quantized LLM Parameters and KV cache Compression through Element Substitution and Residual Clustering
di: Wang, Yanshu, et al.
Pubblicazione: (2024)
di: Wang, Yanshu, et al.
Pubblicazione: (2024)
When and What to Ask: AskBench and Rubric-Guided RLVR for LLM Clarification
di: Zhao, Jiale, et al.
Pubblicazione: (2026)
di: Zhao, Jiale, et al.
Pubblicazione: (2026)
Self-Distilled RLVR
di: Yang, Chenxu, et al.
Pubblicazione: (2026)
di: Yang, Chenxu, et al.
Pubblicazione: (2026)
JudgeRLVR: Judge First, Generate Second for Efficient Reasoning
di: Duo, Jiangshan, et al.
Pubblicazione: (2026)
di: Duo, Jiangshan, et al.
Pubblicazione: (2026)
Induction Head Toxicity Mechanistically Explains Repetition Curse in Large Language Models
di: Wang, Shuxun, et al.
Pubblicazione: (2025)
di: Wang, Shuxun, et al.
Pubblicazione: (2025)
Not only where, But when: Temporal Scheduling for RLVR
di: Zhang, Jinghao, et al.
Pubblicazione: (2026)
di: Zhang, Jinghao, et al.
Pubblicazione: (2026)
RLVR-World: Training World Models with Reinforcement Learning
di: Wu, Jialong, et al.
Pubblicazione: (2025)
di: Wu, Jialong, et al.
Pubblicazione: (2025)
RLVR Training of LLMs Does Not Improve Thinking Ability for General QA: Evaluation Method and a Simple Solution
di: Li, Kaiyuan, et al.
Pubblicazione: (2026)
di: Li, Kaiyuan, et al.
Pubblicazione: (2026)
When to Stop Reusing: Dynamic Gradient Gating for Sample-Efficient RLVR
di: Miao, Yuchun, et al.
Pubblicazione: (2026)
di: Miao, Yuchun, et al.
Pubblicazione: (2026)
Counterfactual experience augmented off-policy reinforcement learning
di: Lee, Sunbowen, et al.
Pubblicazione: (2025)
di: Lee, Sunbowen, et al.
Pubblicazione: (2025)
WIMLE: Uncertainty-Aware World Models with IMLE for Sample-Efficient Continuous Control
di: Aghabozorgi, Mehran, et al.
Pubblicazione: (2026)
di: Aghabozorgi, Mehran, et al.
Pubblicazione: (2026)
ELAS: Efficient Pre-Training of Low-Rank Large Language Models via 2:4 Activation Sparsity
di: Li, Jiaxi, et al.
Pubblicazione: (2026)
di: Li, Jiaxi, et al.
Pubblicazione: (2026)
Efficiently Aligning Draft Models via Parameter- and Data-Efficient Adaptation
di: Lin, Luxi, et al.
Pubblicazione: (2026)
di: Lin, Luxi, et al.
Pubblicazione: (2026)
IRDS: Interpretable RLVR Data Selection via Verifier-Coupled Sparse Autoencoder Coverage
di: Li, Yuhan, et al.
Pubblicazione: (2026)
di: Li, Yuhan, et al.
Pubblicazione: (2026)
Refusal Falls off a Cliff: How Safety Alignment Fails in Reasoning?
di: Yin, Qingyu, et al.
Pubblicazione: (2025)
di: Yin, Qingyu, et al.
Pubblicazione: (2025)
Quantile Advantage Estimation: Stabilizing RLVR for LLM Reasoning
di: Wu, Junkang, et al.
Pubblicazione: (2025)
di: Wu, Junkang, et al.
Pubblicazione: (2025)
ParamReL: Learning Parameter Space Representation via Progressively Encoding Bayesian Flow Networks
di: Wu, Zhangkai, et al.
Pubblicazione: (2024)
di: Wu, Zhangkai, et al.
Pubblicazione: (2024)
Asymmetric Advantage Modulation Calibrates Entropy Dynamics in RLVR
di: Gu, Hengrui, et al.
Pubblicazione: (2026)
di: Gu, Hengrui, et al.
Pubblicazione: (2026)
Beyond Variance: Prompt-Efficient RLVR via Rare-Event Amplification and Bidirectional Pairing
di: Pang, Yujuan, et al.
Pubblicazione: (2026)
di: Pang, Yujuan, et al.
Pubblicazione: (2026)
Exploration vs Exploitation: Rethinking RLVR through Clipping, Entropy, and Spurious Reward
di: Chen, Peter, et al.
Pubblicazione: (2025)
di: Chen, Peter, et al.
Pubblicazione: (2025)
Efficient RLVR Training via Weighted Mutual Information Data Selection
di: Zhou, Xinyu, et al.
Pubblicazione: (2026)
di: Zhou, Xinyu, et al.
Pubblicazione: (2026)
Symbolic Representation for Any-to-Any Generative Tasks
di: Chen, Jiaqi, et al.
Pubblicazione: (2025)
di: Chen, Jiaqi, et al.
Pubblicazione: (2025)
Athena: Efficient Block-Wise Post-Training Quantization for Large Language Models Using Second-Order Matrix Derivative Information
di: Wang, Yanshu, et al.
Pubblicazione: (2024)
di: Wang, Yanshu, et al.
Pubblicazione: (2024)
On the Direction of RLVR Updates for LLM Reasoning: Identification and Exploitation
di: Huang, Kexin, et al.
Pubblicazione: (2026)
di: Huang, Kexin, et al.
Pubblicazione: (2026)
PEFT-Arena: Understanding Parameter-Efficient Finetuning from a Stability-Plasticity Perspective
di: Huang, Yangyi, et al.
Pubblicazione: (2026)
di: Huang, Yangyi, et al.
Pubblicazione: (2026)
Where to Spend Rollouts: Hit-Utility Optimal Rollout Allocation for Group-Based RLVR
di: Wang, Tao, et al.
Pubblicazione: (2026)
di: Wang, Tao, et al.
Pubblicazione: (2026)
SAGE: Shaping Anchors for Guided Exploration in RLVR of LLMs
di: Lee, Chanuk, et al.
Pubblicazione: (2026)
di: Lee, Chanuk, et al.
Pubblicazione: (2026)
Linear Dynamics in the RLVR Training of Large Language Models
di: Wang, Tianle, et al.
Pubblicazione: (2026)
di: Wang, Tianle, et al.
Pubblicazione: (2026)
Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity
di: Lochab, Anamika, et al.
Pubblicazione: (2026)
di: Lochab, Anamika, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Deeper Insights Without Updates: The Power of In-Context Learning Over Fine-Tuning
di: Yin, Qingyu, et al.
Pubblicazione: (2024) -
STeCa: Step-level Trajectory Calibration for LLM Agent Learning
di: Wang, Hanlin, et al.
Pubblicazione: (2025) -
Merlin's Whisper: Enabling Efficient Reasoning in Large Language Models via Black-box Persuasive Prompting
di: Xia, Heming, et al.
Pubblicazione: (2025) -
SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution
di: Wang, Hanlin, et al.
Pubblicazione: (2025) -
Scaling over Scaling: Exploring Test-Time Scaling Plateau in Large Reasoning Models
di: Wang, Jian, et al.
Pubblicazione: (2025)