RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments
Fuente:
arXiv
Salvato in:
| Autori principali: | Zeng, Zhiyuan, Ivison, Hamish, Wang, Yiping, Yuan, Lifan, Li, Shuyue Stella, Ye, Zhuorui, Li, Siting, He, Jacqueline, Zhou, Runlong, Chen, Tong, Zhao, Chenyang, Tsvetkov, Yulia, Du, Simon Shaolei, Jaques, Natasha, Peng, Hao, Koh, Pang Wei, Hajishirzi, Hannaneh |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ScienceMeter: Tracking Scientific Knowledge Updates in Language Models
di: Wang, Yike, et al.
Pubblicazione: (2025)
di: Wang, Yike, et al.
Pubblicazione: (2025)
Generalizing Verifiable Instruction Following
di: Pyatkin, Valentina, et al.
Pubblicazione: (2025)
di: Pyatkin, Valentina, et al.
Pubblicazione: (2025)
Spurious Rewards: Rethinking Training Signals in RLVR
di: Shao, Rulin, et al.
Pubblicazione: (2025)
di: Shao, Rulin, et al.
Pubblicazione: (2025)
PrefDisco: Benchmarking Proactive Personalized Reasoning
di: Li, Shuyue Stella, et al.
Pubblicazione: (2025)
di: Li, Shuyue Stella, et al.
Pubblicazione: (2025)
EvalTree: Profiling Language Model Weaknesses via Hierarchical Capability Trees
di: Zeng, Zhiyuan, et al.
Pubblicazione: (2025)
di: Zeng, Zhiyuan, et al.
Pubblicazione: (2025)
MentorCollab: Selective Large-to-Small Inference-Time Guidance for Efficient Reasoning
di: Wang, Haojin, et al.
Pubblicazione: (2026)
di: Wang, Haojin, et al.
Pubblicazione: (2026)
Exploring How Generative MLLMs Perceive More Than CLIP with the Same Vision Encoder
di: Li, Siting, et al.
Pubblicazione: (2024)
di: Li, Siting, et al.
Pubblicazione: (2024)
Personalizing Reinforcement Learning from Human Feedback with Variational Preference Learning
di: Poddar, Sriyash, et al.
Pubblicazione: (2024)
di: Poddar, Sriyash, et al.
Pubblicazione: (2024)
Precise Information Control in Long-Form Text Generation
di: He, Jacqueline, et al.
Pubblicazione: (2025)
di: He, Jacqueline, et al.
Pubblicazione: (2025)
Cold-Start Personalization via Training-Free Priors from Structured World Models
di: Bose, Avinandan, et al.
Pubblicazione: (2026)
di: Bose, Avinandan, et al.
Pubblicazione: (2026)
ComPO: Community Preferences for Language Model Personalization
di: Kumar, Sachin, et al.
Pubblicazione: (2024)
di: Kumar, Sachin, et al.
Pubblicazione: (2024)
Small Reward Models via Backward Inference
di: Wang, Yike, et al.
Pubblicazione: (2026)
di: Wang, Yike, et al.
Pubblicazione: (2026)
MediQ: Question-Asking LLMs and a Benchmark for Reliable Interactive Clinical Reasoning
di: Li, Shuyue Stella, et al.
Pubblicazione: (2024)
di: Li, Shuyue Stella, et al.
Pubblicazione: (2024)
Fine-grained Hallucination Detection and Editing for Language Models
di: Mishra, Abhika, et al.
Pubblicazione: (2024)
di: Mishra, Abhika, et al.
Pubblicazione: (2024)
Large-Scale Data Selection for Instruction Tuning
di: Ivison, Hamish, et al.
Pubblicazione: (2025)
di: Ivison, Hamish, et al.
Pubblicazione: (2025)
A False Sense of Privacy: Evaluating Textual Data Sanitization Beyond Surface-level Privacy Leakage
di: Xin, Rui, et al.
Pubblicazione: (2025)
di: Xin, Rui, et al.
Pubblicazione: (2025)
JPEG-LM: LLMs as Image Generators with Canonical Codec Representations
di: Han, Xiaochuang, et al.
Pubblicazione: (2024)
di: Han, Xiaochuang, et al.
Pubblicazione: (2024)
Ads in AI Chatbots? An Analysis of How Large Language Models Navigate Conflicts of Interest
di: Wu, Addison J., et al.
Pubblicazione: (2026)
di: Wu, Addison J., et al.
Pubblicazione: (2026)
InfoGatherer: Principled Information Seeking via Evidence Retrieval and Strategic Questioning
di: Taranukhin, Maksym, et al.
Pubblicazione: (2026)
di: Taranukhin, Maksym, et al.
Pubblicazione: (2026)
Meta-Reinforcement Learning with Self-Reflection for Agentic Search
di: Xiao, Teng, et al.
Pubblicazione: (2026)
di: Xiao, Teng, et al.
Pubblicazione: (2026)
Unpacking DPO and PPO: Disentangling Best Practices for Learning from Preference Feedback
di: Ivison, Hamish, et al.
Pubblicazione: (2024)
di: Ivison, Hamish, et al.
Pubblicazione: (2024)
Impossibility Theorems for Feature Attribution
di: Bilodeau, Blair, et al.
Pubblicazione: (2022)
di: Bilodeau, Blair, et al.
Pubblicazione: (2022)
Deep Reasoning in General Purpose Agents via Structured Meta-Cognition
di: Light, Dean, et al.
Pubblicazione: (2026)
di: Light, Dean, et al.
Pubblicazione: (2026)
The Delta Learning Hypothesis: Preference Tuning on Weak Data can Yield Strong Gains
di: Geng, Scott, et al.
Pubblicazione: (2025)
di: Geng, Scott, et al.
Pubblicazione: (2025)
Merge to Learn: Efficiently Adding Skills to Language Models with Model Merging
di: Morrison, Jacob, et al.
Pubblicazione: (2024)
di: Morrison, Jacob, et al.
Pubblicazione: (2024)
EvoLM: Self-Evolving Language Models through Co-Evolved Discriminative Rubrics
di: Li, Shuyue Stella, et al.
Pubblicazione: (2026)
di: Li, Shuyue Stella, et al.
Pubblicazione: (2026)
Highlighting What Matters: Promptable Embeddings for Attribute-Focused Image Retrieval
di: Li, Siting, et al.
Pubblicazione: (2025)
di: Li, Siting, et al.
Pubblicazione: (2025)
APT: Adaptive Pruning and Tuning Pretrained Language Models for Efficient Training and Inference
di: Zhao, Bowen, et al.
Pubblicazione: (2024)
di: Zhao, Bowen, et al.
Pubblicazione: (2024)
ValueScope: Unveiling Implicit Norms and Values via Return Potential Model of Social Interactions
di: Park, Chan Young, et al.
Pubblicazione: (2024)
di: Park, Chan Young, et al.
Pubblicazione: (2024)
Do Membership Inference Attacks Work on Large Language Models?
di: Duan, Michael, et al.
Pubblicazione: (2024)
di: Duan, Michael, et al.
Pubblicazione: (2024)
Reliable, Adaptable, and Attributable Language Models with Retrieval
di: Asai, Akari, et al.
Pubblicazione: (2024)
di: Asai, Akari, et al.
Pubblicazione: (2024)
MatFormer: Nested Transformer for Elastic Inference
di: Devvrit, et al.
Pubblicazione: (2023)
di: Devvrit, et al.
Pubblicazione: (2023)
Are Language Models Sensitive to Morally Irrelevant Distractors?
di: Shaw, Andrew, et al.
Pubblicazione: (2026)
di: Shaw, Andrew, et al.
Pubblicazione: (2026)
PrefPalette: Personalized Preference Modeling with Latent Attributes
di: Li, Shuyue Stella, et al.
Pubblicazione: (2025)
di: Li, Shuyue Stella, et al.
Pubblicazione: (2025)
ParaPO: Aligning Language Models to Reduce Verbatim Reproduction of Pre-training Data
di: Chen, Tong, et al.
Pubblicazione: (2025)
di: Chen, Tong, et al.
Pubblicazione: (2025)
The Curious Case of Factuality Finetuning: Models' Internal Beliefs Can Improve Factuality
di: Newman, Benjamin, et al.
Pubblicazione: (2025)
di: Newman, Benjamin, et al.
Pubblicazione: (2025)
Privasis: Synthesizing the Largest "Public" Private Dataset from Scratch
di: Kim, Hyunwoo, et al.
Pubblicazione: (2026)
di: Kim, Hyunwoo, et al.
Pubblicazione: (2026)
Teaching LLMs to Abstain across Languages via Multilingual Feedback
di: Feng, Shangbin, et al.
Pubblicazione: (2024)
di: Feng, Shangbin, et al.
Pubblicazione: (2024)
Critical Batch Size Revisited: A Simple Empirical Approach to Large-Batch Language Model Training
di: Merrill, William, et al.
Pubblicazione: (2025)
di: Merrill, William, et al.
Pubblicazione: (2025)
Husky: A Unified, Open-Source Language Agent for Multi-Step Reasoning
di: Kim, Joongwon, et al.
Pubblicazione: (2024)
di: Kim, Joongwon, et al.
Pubblicazione: (2024)
Documenti analoghi
-
ScienceMeter: Tracking Scientific Knowledge Updates in Language Models
di: Wang, Yike, et al.
Pubblicazione: (2025) -
Generalizing Verifiable Instruction Following
di: Pyatkin, Valentina, et al.
Pubblicazione: (2025) -
Spurious Rewards: Rethinking Training Signals in RLVR
di: Shao, Rulin, et al.
Pubblicazione: (2025) -
PrefDisco: Benchmarking Proactive Personalized Reasoning
di: Li, Shuyue Stella, et al.
Pubblicazione: (2025) -
EvalTree: Profiling Language Model Weaknesses via Hierarchical Capability Trees
di: Zeng, Zhiyuan, et al.
Pubblicazione: (2025)