Where Rollouts Begin: Low-Load, High-Leverage First-Token Diversification for RLVR
Fuente:
arXiv
Salvato in:
| Autori principali: | Kim, Soeun, No, Albert |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Assigning Distinct Roles to Quantized and Low-Rank Matrices Toward Optimal Weight Decomposition
di: Cho, Yoonjun, et al.
Pubblicazione: (2025)
di: Cho, Yoonjun, et al.
Pubblicazione: (2025)
JudgeRLVR: Judge First, Generate Second for Efficient Reasoning
di: Duo, Jiangshan, et al.
Pubblicazione: (2026)
di: Duo, Jiangshan, et al.
Pubblicazione: (2026)
Exploring Multi-Temperature Strategies for Token- and Rollout-Level Control in RLVR
di: Zhuang, Haomin, et al.
Pubblicazione: (2025)
di: Zhuang, Haomin, et al.
Pubblicazione: (2025)
Low-rank Optimization Trajectories Modeling for LLM RLVR Acceleration
di: Chen, Zhipeng, et al.
Pubblicazione: (2026)
di: Chen, Zhipeng, et al.
Pubblicazione: (2026)
Sparse but Critical: A Token-Level Analysis of Distributional Shifts in RLVR Fine-Tuning of LLMs
di: Meng, Haoming, et al.
Pubblicazione: (2026)
di: Meng, Haoming, et al.
Pubblicazione: (2026)
Not All Rollouts are Useful: Down-Sampling Rollouts in LLM Reinforcement Learning
di: Xu, Yixuan Even, et al.
Pubblicazione: (2025)
di: Xu, Yixuan Even, et al.
Pubblicazione: (2025)
CLIPO: Contrastive Learning in Policy Optimization Generalizes RLVR
di: Cui, Sijia, et al.
Pubblicazione: (2026)
di: Cui, Sijia, et al.
Pubblicazione: (2026)
SAGE: Shaping Anchors for Guided Exploration in RLVR of LLMs
di: Lee, Chanuk, et al.
Pubblicazione: (2026)
di: Lee, Chanuk, et al.
Pubblicazione: (2026)
Asymmetric Advantage Modulation Calibrates Entropy Dynamics in RLVR
di: Gu, Hengrui, et al.
Pubblicazione: (2026)
di: Gu, Hengrui, et al.
Pubblicazione: (2026)
RLPR: Extrapolating RLVR to General Domains without Verifiers
di: Yu, Tianyu, et al.
Pubblicazione: (2025)
di: Yu, Tianyu, et al.
Pubblicazione: (2025)
Generalization of RLVR Using Causal Reasoning as a Testbed
di: Lu, Brian, et al.
Pubblicazione: (2025)
di: Lu, Brian, et al.
Pubblicazione: (2025)
Token-Efficient Leverage Learning in Large Language Models
di: Zeng, Yuanhao, et al.
Pubblicazione: (2024)
di: Zeng, Yuanhao, et al.
Pubblicazione: (2024)
Flexible Entropy Control in RLVR with a Gradient-Preserving Perspective
di: Chen, Kun, et al.
Pubblicazione: (2026)
di: Chen, Kun, et al.
Pubblicazione: (2026)
IFCap: Image-like Retrieval and Frequency-based Entity Filtering for Zero-shot Captioning
di: Lee, Soeun, et al.
Pubblicazione: (2024)
di: Lee, Soeun, et al.
Pubblicazione: (2024)
ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning
di: Kim, Taewhan, et al.
Pubblicazione: (2024)
di: Kim, Taewhan, et al.
Pubblicazione: (2024)
Adaptive Rollout Allocation for Online Reinforcement Learning with Verifiable Rewards
di: Nguyen, Hieu Trung, et al.
Pubblicazione: (2026)
di: Nguyen, Hieu Trung, et al.
Pubblicazione: (2026)
SPEC-RL: Accelerating On-Policy Reinforcement Learning with Speculative Rollouts
di: Liu, Bingshuai, et al.
Pubblicazione: (2025)
di: Liu, Bingshuai, et al.
Pubblicazione: (2025)
The Invisible Leash: Why RLVR May or May Not Escape Its Origin
di: Wu, Fang, et al.
Pubblicazione: (2025)
di: Wu, Fang, et al.
Pubblicazione: (2025)
TSR: Trajectory-Search Rollouts for Multi-Turn RL of LLM Agents
di: Djuhera, Aladin, et al.
Pubblicazione: (2026)
di: Djuhera, Aladin, et al.
Pubblicazione: (2026)
Countdown-Code: A Testbed for Studying The Emergence and Generalization of Reward Hacking in RLVR
di: Khalifa, Muhammad, et al.
Pubblicazione: (2026)
di: Khalifa, Muhammad, et al.
Pubblicazione: (2026)
Exploration vs Exploitation: Rethinking RLVR through Clipping, Entropy, and Spurious Reward
di: Chen, Peter, et al.
Pubblicazione: (2025)
di: Chen, Peter, et al.
Pubblicazione: (2025)
Knowledgeable Agents by Offline Reinforcement Learning from Large Language Model Rollouts
di: Pang, Jing-Cheng, et al.
Pubblicazione: (2024)
di: Pang, Jing-Cheng, et al.
Pubblicazione: (2024)
A State-of-the-Art SQL Reasoning Model using RLVR
di: Ali, Alnur, et al.
Pubblicazione: (2025)
di: Ali, Alnur, et al.
Pubblicazione: (2025)
$V_{0.5}$: Generalist Value Model as a Prior for Sparse RL Rollouts
di: Zhang, Yi-Kai, et al.
Pubblicazione: (2026)
di: Zhang, Yi-Kai, et al.
Pubblicazione: (2026)
Mitigating Distribution Sharpening in Math RLVR via Distribution-Aligned Hint Synthesis and Backward Hint Annealing
di: Xie, Pei-Xi, et al.
Pubblicazione: (2026)
di: Xie, Pei-Xi, et al.
Pubblicazione: (2026)
Sparse-RL: Breaking the Memory Wall in LLM Reinforcement Learning via Stable Sparse Rollouts
di: Luo, Sijia, et al.
Pubblicazione: (2026)
di: Luo, Sijia, et al.
Pubblicazione: (2026)
Prismatic Synthesis: Gradient-based Data Diversification Boosts Generalization in LLM Reasoning
di: Jung, Jaehun, et al.
Pubblicazione: (2025)
di: Jung, Jaehun, et al.
Pubblicazione: (2025)
Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs
di: Yang, Zhihe, et al.
Pubblicazione: (2025)
di: Yang, Zhihe, et al.
Pubblicazione: (2025)
Where Hindsight Credit Can Reside: A Signed-Capacity View of Token Updates in RLVR
di: He, Yuhang, et al.
Pubblicazione: (2026)
di: He, Yuhang, et al.
Pubblicazione: (2026)
Forget What Matters, Keep the Rest: Selective Unlearning of Informative Tokens
di: Koh, Seunghee, et al.
Pubblicazione: (2026)
di: Koh, Seunghee, et al.
Pubblicazione: (2026)
When Every Token Counts: Optimal Segmentation for Low-Resource Language Models
di: Raj, Bharath, et al.
Pubblicazione: (2024)
di: Raj, Bharath, et al.
Pubblicazione: (2024)
Nested-ReFT: Efficient Reinforcement Learning for Large Language Model Fine-Tuning via Off-Policy Rollouts
di: Heuillet, Maxime, et al.
Pubblicazione: (2025)
di: Heuillet, Maxime, et al.
Pubblicazione: (2025)
Improving Data Efficiency for LLM Reinforcement Fine-tuning Through Difficulty-targeted Online Data Selection and Rollout Replay
di: Sun, Yifan, et al.
Pubblicazione: (2025)
di: Sun, Yifan, et al.
Pubblicazione: (2025)
Empowering Small-Scale Knowledge Graphs: A Strategy of Leveraging General-Purpose Knowledge Graphs for Enriched Embeddings
di: Sawczyn, Albert, et al.
Pubblicazione: (2024)
di: Sawczyn, Albert, et al.
Pubblicazione: (2024)
SynC: Synthetic Image Caption Dataset Refinement with One-to-many Mapping for Zero-shot Image Captioning
di: Kim, Si-Woo, et al.
Pubblicazione: (2025)
di: Kim, Si-Woo, et al.
Pubblicazione: (2025)
Looking to Learn: Token-wise Dynamic Gating for Low-Resource Vision-Language Modelling
di: Ganescu, Bianca-Mihaela, et al.
Pubblicazione: (2025)
di: Ganescu, Bianca-Mihaela, et al.
Pubblicazione: (2025)
Where Do Reasoning Models Refuse?
di: Yamaguchi, Kureha, et al.
Pubblicazione: (2025)
di: Yamaguchi, Kureha, et al.
Pubblicazione: (2025)
TokenButler: Token Importance is Predictable
di: Akhauri, Yash, et al.
Pubblicazione: (2025)
di: Akhauri, Yash, et al.
Pubblicazione: (2025)
AI-Augmented Surveys: Leveraging Large Language Models and Surveys for Opinion Prediction
di: Kim, Junsol, et al.
Pubblicazione: (2023)
di: Kim, Junsol, et al.
Pubblicazione: (2023)
PaperSearchQA: Learning to Search and Reason over Scientific Papers with RLVR
di: Burgess, James, et al.
Pubblicazione: (2026)
di: Burgess, James, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Assigning Distinct Roles to Quantized and Low-Rank Matrices Toward Optimal Weight Decomposition
di: Cho, Yoonjun, et al.
Pubblicazione: (2025) -
JudgeRLVR: Judge First, Generate Second for Efficient Reasoning
di: Duo, Jiangshan, et al.
Pubblicazione: (2026) -
Exploring Multi-Temperature Strategies for Token- and Rollout-Level Control in RLVR
di: Zhuang, Haomin, et al.
Pubblicazione: (2025) -
Low-rank Optimization Trajectories Modeling for LLM RLVR Acceleration
di: Chen, Zhipeng, et al.
Pubblicazione: (2026) -
Sparse but Critical: A Token-Level Analysis of Distributional Shifts in RLVR Fine-Tuning of LLMs
di: Meng, Haoming, et al.
Pubblicazione: (2026)