RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zeng, Zhiyuan, Ivison, Hamish, Wang, Yiping, Yuan, Lifan, Li, Shuyue Stella, Ye, Zhuorui, Li, Siting, He, Jacqueline, Zhou, Runlong, Chen, Tong, Zhao, Chenyang, Tsvetkov, Yulia, Du, Simon Shaolei, Jaques, Natasha, Peng, Hao, Koh, Pang Wei, Hajishirzi, Hannaneh |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ScienceMeter: Tracking Scientific Knowledge Updates in Language Models
par: Wang, Yike, et autres
Publié: (2025)
par: Wang, Yike, et autres
Publié: (2025)
Generalizing Verifiable Instruction Following
par: Pyatkin, Valentina, et autres
Publié: (2025)
par: Pyatkin, Valentina, et autres
Publié: (2025)
Spurious Rewards: Rethinking Training Signals in RLVR
par: Shao, Rulin, et autres
Publié: (2025)
par: Shao, Rulin, et autres
Publié: (2025)
PrefDisco: Benchmarking Proactive Personalized Reasoning
par: Li, Shuyue Stella, et autres
Publié: (2025)
par: Li, Shuyue Stella, et autres
Publié: (2025)
EvalTree: Profiling Language Model Weaknesses via Hierarchical Capability Trees
par: Zeng, Zhiyuan, et autres
Publié: (2025)
par: Zeng, Zhiyuan, et autres
Publié: (2025)
MentorCollab: Selective Large-to-Small Inference-Time Guidance for Efficient Reasoning
par: Wang, Haojin, et autres
Publié: (2026)
par: Wang, Haojin, et autres
Publié: (2026)
Exploring How Generative MLLMs Perceive More Than CLIP with the Same Vision Encoder
par: Li, Siting, et autres
Publié: (2024)
par: Li, Siting, et autres
Publié: (2024)
Personalizing Reinforcement Learning from Human Feedback with Variational Preference Learning
par: Poddar, Sriyash, et autres
Publié: (2024)
par: Poddar, Sriyash, et autres
Publié: (2024)
Precise Information Control in Long-Form Text Generation
par: He, Jacqueline, et autres
Publié: (2025)
par: He, Jacqueline, et autres
Publié: (2025)
Cold-Start Personalization via Training-Free Priors from Structured World Models
par: Bose, Avinandan, et autres
Publié: (2026)
par: Bose, Avinandan, et autres
Publié: (2026)
ComPO: Community Preferences for Language Model Personalization
par: Kumar, Sachin, et autres
Publié: (2024)
par: Kumar, Sachin, et autres
Publié: (2024)
Small Reward Models via Backward Inference
par: Wang, Yike, et autres
Publié: (2026)
par: Wang, Yike, et autres
Publié: (2026)
MediQ: Question-Asking LLMs and a Benchmark for Reliable Interactive Clinical Reasoning
par: Li, Shuyue Stella, et autres
Publié: (2024)
par: Li, Shuyue Stella, et autres
Publié: (2024)
Fine-grained Hallucination Detection and Editing for Language Models
par: Mishra, Abhika, et autres
Publié: (2024)
par: Mishra, Abhika, et autres
Publié: (2024)
Large-Scale Data Selection for Instruction Tuning
par: Ivison, Hamish, et autres
Publié: (2025)
par: Ivison, Hamish, et autres
Publié: (2025)
A False Sense of Privacy: Evaluating Textual Data Sanitization Beyond Surface-level Privacy Leakage
par: Xin, Rui, et autres
Publié: (2025)
par: Xin, Rui, et autres
Publié: (2025)
JPEG-LM: LLMs as Image Generators with Canonical Codec Representations
par: Han, Xiaochuang, et autres
Publié: (2024)
par: Han, Xiaochuang, et autres
Publié: (2024)
Ads in AI Chatbots? An Analysis of How Large Language Models Navigate Conflicts of Interest
par: Wu, Addison J., et autres
Publié: (2026)
par: Wu, Addison J., et autres
Publié: (2026)
InfoGatherer: Principled Information Seeking via Evidence Retrieval and Strategic Questioning
par: Taranukhin, Maksym, et autres
Publié: (2026)
par: Taranukhin, Maksym, et autres
Publié: (2026)
Meta-Reinforcement Learning with Self-Reflection for Agentic Search
par: Xiao, Teng, et autres
Publié: (2026)
par: Xiao, Teng, et autres
Publié: (2026)
Unpacking DPO and PPO: Disentangling Best Practices for Learning from Preference Feedback
par: Ivison, Hamish, et autres
Publié: (2024)
par: Ivison, Hamish, et autres
Publié: (2024)
Impossibility Theorems for Feature Attribution
par: Bilodeau, Blair, et autres
Publié: (2022)
par: Bilodeau, Blair, et autres
Publié: (2022)
Deep Reasoning in General Purpose Agents via Structured Meta-Cognition
par: Light, Dean, et autres
Publié: (2026)
par: Light, Dean, et autres
Publié: (2026)
The Delta Learning Hypothesis: Preference Tuning on Weak Data can Yield Strong Gains
par: Geng, Scott, et autres
Publié: (2025)
par: Geng, Scott, et autres
Publié: (2025)
Merge to Learn: Efficiently Adding Skills to Language Models with Model Merging
par: Morrison, Jacob, et autres
Publié: (2024)
par: Morrison, Jacob, et autres
Publié: (2024)
EvoLM: Self-Evolving Language Models through Co-Evolved Discriminative Rubrics
par: Li, Shuyue Stella, et autres
Publié: (2026)
par: Li, Shuyue Stella, et autres
Publié: (2026)
Highlighting What Matters: Promptable Embeddings for Attribute-Focused Image Retrieval
par: Li, Siting, et autres
Publié: (2025)
par: Li, Siting, et autres
Publié: (2025)
APT: Adaptive Pruning and Tuning Pretrained Language Models for Efficient Training and Inference
par: Zhao, Bowen, et autres
Publié: (2024)
par: Zhao, Bowen, et autres
Publié: (2024)
ValueScope: Unveiling Implicit Norms and Values via Return Potential Model of Social Interactions
par: Park, Chan Young, et autres
Publié: (2024)
par: Park, Chan Young, et autres
Publié: (2024)
Do Membership Inference Attacks Work on Large Language Models?
par: Duan, Michael, et autres
Publié: (2024)
par: Duan, Michael, et autres
Publié: (2024)
Reliable, Adaptable, and Attributable Language Models with Retrieval
par: Asai, Akari, et autres
Publié: (2024)
par: Asai, Akari, et autres
Publié: (2024)
MatFormer: Nested Transformer for Elastic Inference
par: Devvrit, et autres
Publié: (2023)
par: Devvrit, et autres
Publié: (2023)
Are Language Models Sensitive to Morally Irrelevant Distractors?
par: Shaw, Andrew, et autres
Publié: (2026)
par: Shaw, Andrew, et autres
Publié: (2026)
PrefPalette: Personalized Preference Modeling with Latent Attributes
par: Li, Shuyue Stella, et autres
Publié: (2025)
par: Li, Shuyue Stella, et autres
Publié: (2025)
ParaPO: Aligning Language Models to Reduce Verbatim Reproduction of Pre-training Data
par: Chen, Tong, et autres
Publié: (2025)
par: Chen, Tong, et autres
Publié: (2025)
The Curious Case of Factuality Finetuning: Models' Internal Beliefs Can Improve Factuality
par: Newman, Benjamin, et autres
Publié: (2025)
par: Newman, Benjamin, et autres
Publié: (2025)
Privasis: Synthesizing the Largest "Public" Private Dataset from Scratch
par: Kim, Hyunwoo, et autres
Publié: (2026)
par: Kim, Hyunwoo, et autres
Publié: (2026)
Teaching LLMs to Abstain across Languages via Multilingual Feedback
par: Feng, Shangbin, et autres
Publié: (2024)
par: Feng, Shangbin, et autres
Publié: (2024)
Critical Batch Size Revisited: A Simple Empirical Approach to Large-Batch Language Model Training
par: Merrill, William, et autres
Publié: (2025)
par: Merrill, William, et autres
Publié: (2025)
Husky: A Unified, Open-Source Language Agent for Multi-Step Reasoning
par: Kim, Joongwon, et autres
Publié: (2024)
par: Kim, Joongwon, et autres
Publié: (2024)
Documents similaires
-
ScienceMeter: Tracking Scientific Knowledge Updates in Language Models
par: Wang, Yike, et autres
Publié: (2025) -
Generalizing Verifiable Instruction Following
par: Pyatkin, Valentina, et autres
Publié: (2025) -
Spurious Rewards: Rethinking Training Signals in RLVR
par: Shao, Rulin, et autres
Publié: (2025) -
PrefDisco: Benchmarking Proactive Personalized Reasoning
par: Li, Shuyue Stella, et autres
Publié: (2025) -
EvalTree: Profiling Language Model Weaknesses via Hierarchical Capability Trees
par: Zeng, Zhiyuan, et autres
Publié: (2025)