Learning from Less: Measuring the Effectiveness of RLVR in Low Data and Compute Regimes
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Bauer, Justin, Walshe, Thomas, Pham, Derek, Vishwakarma, Harit, Parchami, Armin, Sala, Frederic, Varma, Paroma |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Automating Benchmark Design
par: Dsouza, Amanda, et autres
Publié: (2025)
par: Dsouza, Amanda, et autres
Publié: (2025)
RIFT: A RubrIc Failure Mode Taxonomy and Automated Diagnostics
par: Qi, Zhengyang, et autres
Publié: (2026)
par: Qi, Zhengyang, et autres
Publié: (2026)
Time To Impeach LLM-as-a-Judge: Programs are the Future of Evaluation
par: Huang, Tzu-Heng, et autres
Publié: (2025)
par: Huang, Tzu-Heng, et autres
Publié: (2025)
Promises and Pitfalls of Threshold-based Auto-labeling
par: Vishwakarma, Harit, et autres
Publié: (2022)
par: Vishwakarma, Harit, et autres
Publié: (2022)
OTTER: Effortless Label Distribution Adaptation of Zero-shot Models
par: Shin, Changho, et autres
Publié: (2024)
par: Shin, Changho, et autres
Publié: (2024)
Pearls from Pebbles: Improved Confidence Functions for Auto-labeling
par: Vishwakarma, Harit, et autres
Publié: (2024)
par: Vishwakarma, Harit, et autres
Publié: (2024)
Taming False Positives in Out-of-Distribution Detection with Human Feedback
par: Vishwakarma, Harit, et autres
Publié: (2024)
par: Vishwakarma, Harit, et autres
Publié: (2024)
Adaptive Scoring and Thresholding with Human Feedback for Robust Out-of-Distribution Detection
par: Yamada, Daisuke, et autres
Publié: (2025)
par: Yamada, Daisuke, et autres
Publié: (2025)
Learn More with Less: Uncertainty Consistency Guided Query Selection for RLVR
par: Yi, Hao, et autres
Publié: (2026)
par: Yi, Hao, et autres
Publié: (2026)
Prune 'n Predict: Optimizing LLM Decision-making with Conformal Prediction
par: Vishwakarma, Harit, et autres
Publié: (2024)
par: Vishwakarma, Harit, et autres
Publié: (2024)
TrajPRed: Trajectory Prediction with Region-based Relation Learning
par: Zhou, Chen, et autres
Publié: (2024)
par: Zhou, Chen, et autres
Publié: (2024)
COSMOS: Predictable and Cost-Effective Adaptation of LLMs
par: Wang, Jiayu, et autres
Publié: (2025)
par: Wang, Jiayu, et autres
Publié: (2025)
Quantifying Empirical Compute-Supervision Tradeoffs in RLVR
par: Mitsuhashi, Ryo, et autres
Publié: (2026)
par: Mitsuhashi, Ryo, et autres
Publié: (2026)
Causal Spherical Hypergraph Networks for Modelling Social Uncertainty
par: Harit, Anoushka, et autres
Publié: (2025)
par: Harit, Anoushka, et autres
Publié: (2025)
Actionable Interpretability via Causal Hypergraphs: Unravelling Batch Size Effects in Deep Learning
par: Sun, Zhongtian, et autres
Publié: (2025)
par: Sun, Zhongtian, et autres
Publié: (2025)
On the Implicit Reward Overfitting and the Low-rank Dynamics in RLVR
par: Ye, Hao, et autres
Publié: (2026)
par: Ye, Hao, et autres
Publié: (2026)
Weak-to-Strong Generalization Through the Data-Centric Lens
par: Shin, Changho, et autres
Publié: (2024)
par: Shin, Changho, et autres
Publié: (2024)
Studying How to Efficiently and Effectively Guide Models with Explanations
par: Rao, Sukrut, et autres
Publié: (2023)
par: Rao, Sukrut, et autres
Publié: (2023)
Before the Model Learns the Bug:Fuzzing RLVR Verifiers
par: Ray, Jaideep
Publié: (2026)
par: Ray, Jaideep
Publié: (2026)
GeoRA: Geometry-Aware Low-Rank Adaptation for RLVR
par: Zhang, Jiaying, et autres
Publié: (2026)
par: Zhang, Jiaying, et autres
Publié: (2026)
RicciFlowRec: A Geometric Root Cause Recommender Using Ricci Curvature on Financial Graphs
par: Sun, Zhongtian, et autres
Publié: (2025)
par: Sun, Zhongtian, et autres
Publié: (2025)
Visual Grounding Helps Learn Word Meanings in Low-Data Regimes
par: Zhuang, Chengxu, et autres
Publié: (2023)
par: Zhuang, Chengxu, et autres
Publié: (2023)
MEML-GRPO: Heterogeneous Multi-Expert Mutual Learning for RLVR Advancement
par: Jia, Weitao, et autres
Publié: (2025)
par: Jia, Weitao, et autres
Publié: (2025)
Detecting RLVR Training Data via Structural Convergence of Reasoning
par: Zhang, Hongbo, et autres
Publié: (2026)
par: Zhang, Hongbo, et autres
Publié: (2026)
Low-rank Optimization Trajectories Modeling for LLM RLVR Acceleration
par: Chen, Zhipeng, et autres
Publié: (2026)
par: Chen, Zhipeng, et autres
Publié: (2026)
The Path Not Taken: RLVR Provably Learns Off the Principals
par: Zhu, Hanqing, et autres
Publié: (2025)
par: Zhu, Hanqing, et autres
Publié: (2025)
RLVR-World: Training World Models with Reinforcement Learning
par: Wu, Jialong, et autres
Publié: (2025)
par: Wu, Jialong, et autres
Publié: (2025)
Table Detection with Active Learning
par: Gautam, Somraj, et autres
Publié: (2025)
par: Gautam, Somraj, et autres
Publié: (2025)
Enhancing Effectiveness and Robustness in a Low-Resource Regime via Decision-Boundary-aware Data Augmentation
par: Jin, Kyohoon, et autres
Publié: (2024)
par: Jin, Kyohoon, et autres
Publié: (2024)
EWC-Guided Diffusion Replay for Exemplar-Free Continual Learning in Medical Imaging
par: Harit, Anoushka, et autres
Publié: (2025)
par: Harit, Anoushka, et autres
Publié: (2025)
ManifoldMind: Dynamic Hyperbolic Reasoning for Trustworthy Recommendations
par: Harit, Anoushka, et autres
Publié: (2025)
par: Harit, Anoushka, et autres
Publié: (2025)
CLIPO: Contrastive Learning in Policy Optimization Generalizes RLVR
par: Cui, Sijia, et autres
Publié: (2026)
par: Cui, Sijia, et autres
Publié: (2026)
Vintage Code, Modern Judges: Meta-Validation in Low Data Regimes
par: Fandina, Ora Nova, et autres
Publié: (2025)
par: Fandina, Ora Nova, et autres
Publié: (2025)
AI Organizations are More Effective but Less Aligned than Individual Agents
par: Shen, Judy Hanwen, et autres
Publié: (2026)
par: Shen, Judy Hanwen, et autres
Publié: (2026)
GLANCE: Graph Logic Attention Network with Cluster Enhancement for Heterophilous Graph Representation Learning
par: Sun, Zhongtian, et autres
Publié: (2025)
par: Sun, Zhongtian, et autres
Publié: (2025)
Open-Medical-R1: How to Choose Data for RLVR Training at Medicine Domain
par: Qiu, Zhongxi, et autres
Publié: (2025)
par: Qiu, Zhongxi, et autres
Publié: (2025)
IRDS: Interpretable RLVR Data Selection via Verifier-Coupled Sparse Autoencoder Coverage
par: Li, Yuhan, et autres
Publié: (2026)
par: Li, Yuhan, et autres
Publié: (2026)
Aligning Large Language Models to Follow Instructions and Hallucinate Less via Effective Data Filtering
par: Si, Shuzheng, et autres
Publié: (2025)
par: Si, Shuzheng, et autres
Publié: (2025)
Enhancing Neural Theorem Proving through Data Augmentation and Dynamic Sampling Method
par: Vishwakarma, Rahul, et autres
Publié: (2023)
par: Vishwakarma, Rahul, et autres
Publié: (2023)
Evaluating Sample Utility for Efficient Data Selection by Mimicking Model Weights
par: Huang, Tzu-Heng, et autres
Publié: (2025)
par: Huang, Tzu-Heng, et autres
Publié: (2025)
Documents similaires
-
Automating Benchmark Design
par: Dsouza, Amanda, et autres
Publié: (2025) -
RIFT: A RubrIc Failure Mode Taxonomy and Automated Diagnostics
par: Qi, Zhengyang, et autres
Publié: (2026) -
Time To Impeach LLM-as-a-Judge: Programs are the Future of Evaluation
par: Huang, Tzu-Heng, et autres
Publié: (2025) -
Promises and Pitfalls of Threshold-based Auto-labeling
par: Vishwakarma, Harit, et autres
Publié: (2022) -
OTTER: Effortless Label Distribution Adaptation of Zero-shot Models
par: Shin, Changho, et autres
Publié: (2024)