Enregistré dans:
| Auteurs principaux: | Zhang, Mengyu, Ding, Siyu, Yin, Weichong, Sun, Yu, Wu, Hua |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2511.02463 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
KnowRL: Boosting LLM Reasoning via Reinforcement Learning with Minimal-Sufficient Knowledge Guidance
par: Yu, Linhao, et autres
Publié: (2026)
par: Yu, Linhao, et autres
Publié: (2026)
RLPR: Extrapolating RLVR to General Domains without Verifiers
par: Yu, Tianyu, et autres
Publié: (2025)
par: Yu, Tianyu, et autres
Publié: (2025)
IRDS: Interpretable RLVR Data Selection via Verifier-Coupled Sparse Autoencoder Coverage
par: Li, Yuhan, et autres
Publié: (2026)
par: Li, Yuhan, et autres
Publié: (2026)
Beyond Multiple Choice: Verifiable OpenQA for Robust Vision-Language RFT
par: Liu, Yesheng, et autres
Publié: (2025)
par: Liu, Yesheng, et autres
Publié: (2025)
Before the Model Learns the Bug:Fuzzing RLVR Verifiers
par: Ray, Jaideep
Publié: (2026)
par: Ray, Jaideep
Publié: (2026)
DéjàQ: Open-Ended Evolution of Diverse, Learnable and Verifiable Problems
par: Röpke, Willem, et autres
Publié: (2026)
par: Röpke, Willem, et autres
Publié: (2026)
OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments
par: Xie, Tianbao, et autres
Publié: (2024)
par: Xie, Tianbao, et autres
Publié: (2024)
Backdoors in RLVR: Jailbreak Backdoors in LLMs From Verifiable Reward
par: Guo, Weiyang, et autres
Publié: (2026)
par: Guo, Weiyang, et autres
Publié: (2026)
JADE: Expert-Grounded Dynamic Evaluation for Open-Ended Professional Tasks
par: Lin, Lanbo, et autres
Publié: (2026)
par: Lin, Lanbo, et autres
Publié: (2026)
Aletheia: What Makes RLVR For Code Verifiers Tick?
par: Venkatkrishna, Vatsal, et autres
Publié: (2026)
par: Venkatkrishna, Vatsal, et autres
Publié: (2026)
Open-Ended Task Discovery via Bayesian Optimization
par: Adachi, Masaki, et autres
Publié: (2026)
par: Adachi, Masaki, et autres
Publié: (2026)
Building Open-Ended Embodied Agent via Language-Policy Bidirectional Adaptation
par: Zhai, Shaopeng, et autres
Publié: (2023)
par: Zhai, Shaopeng, et autres
Publié: (2023)
On Creativity and Open-Endedness
par: Soros, L. B., et autres
Publié: (2024)
par: Soros, L. B., et autres
Publié: (2024)
LLMs Gaming Verifiers: RLVR can Lead to Reward Hacking
par: Helff, Lukas, et autres
Publié: (2026)
par: Helff, Lukas, et autres
Publié: (2026)
Tru-POMDP: Task Planning Under Uncertainty via Tree of Hypotheses and Open-Ended POMDPs
par: Tang, Wenjing, et autres
Publié: (2025)
par: Tang, Wenjing, et autres
Publié: (2025)
Orthogonal Finetuning for Direct Preference Optimization
par: Yang, Chenxu, et autres
Publié: (2024)
par: Yang, Chenxu, et autres
Publié: (2024)
RM-PoT: Reformulating Mathematical Problems and Solving via Program of Thoughts
par: Zhang, Yu, et autres
Publié: (2025)
par: Zhang, Yu, et autres
Publié: (2025)
Hard2Verify: A Step-Level Verification Benchmark for Open-Ended Frontier Math
par: Pandit, Shrey, et autres
Publié: (2025)
par: Pandit, Shrey, et autres
Publié: (2025)
GRLO: Towards Generalizable Reinforcement Learning in Open-Ended Environments from Zero
par: Yin, Shangjian, et autres
Publié: (2026)
par: Yin, Shangjian, et autres
Publié: (2026)
Weights-Rotated Preference Optimization for Large Language Models
par: Yang, Chenxu, et autres
Publié: (2025)
par: Yang, Chenxu, et autres
Publié: (2025)
RLVR-World: Training World Models with Reinforcement Learning
par: Wu, Jialong, et autres
Publié: (2025)
par: Wu, Jialong, et autres
Publié: (2025)
PerMix-RLVR: Preserving Persona Expressivity under Verifiable-Reward Alignment
par: Oh, Jihwan, et autres
Publié: (2026)
par: Oh, Jihwan, et autres
Publié: (2026)
Yunjue Agent Tech Report: A Fully Reproducible, Zero-Start In-Situ Self-Evolving Agent System for Open-Ended Tasks
par: Li, Haotian, et autres
Publié: (2026)
par: Li, Haotian, et autres
Publié: (2026)
Luban: Building Open-Ended Creative Agents via Autonomous Embodied Verification
par: Guo, Yuxuan, et autres
Publié: (2024)
par: Guo, Yuxuan, et autres
Publié: (2024)
Group-Evolving Agents: Open-Ended Self-Improvement via Experience Sharing
par: Weng, Zhaotian, et autres
Publié: (2026)
par: Weng, Zhaotian, et autres
Publié: (2026)
Differentiating Choices via Commonality for Multiple-Choice Question Answering
par: Deng, Wenqing, et autres
Publié: (2024)
par: Deng, Wenqing, et autres
Publié: (2024)
Expert Evaluation of LLM's Open-Ended Legal Reasoning on the Japanese Bar Exam Writing Task
par: Choi, Jungmin, et autres
Publié: (2026)
par: Choi, Jungmin, et autres
Publié: (2026)
Embodied World Models Emerge from Navigational Task in Open-Ended Environments
par: Jin, Li, et autres
Publié: (2025)
par: Jin, Li, et autres
Publié: (2025)
InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training
par: Wang, Pengkai, et autres
Publié: (2025)
par: Wang, Pengkai, et autres
Publié: (2025)
ArenaRL: Scaling RL for Open-Ended Agents via Tournament-based Relative Ranking
par: Zhang, Qiang, et autres
Publié: (2026)
par: Zhang, Qiang, et autres
Publié: (2026)
Pessimistic Verification for Open Ended Math Questions
par: Huang, Yanxing, et autres
Publié: (2025)
par: Huang, Yanxing, et autres
Publié: (2025)
GUIDE: A Benchmark for Understanding and Assisting Users in Open-Ended GUI Tasks
par: Yang, Saelyne, et autres
Publié: (2026)
par: Yang, Saelyne, et autres
Publié: (2026)
EAPO: Entropy-Driven Adaptive Positive-Negative Sample Weighting for Policy Optimization in Open-Ended QA
par: Zeng, Yunsheng, et autres
Publié: (2026)
par: Zeng, Yunsheng, et autres
Publié: (2026)
Quality Diversity through Human Feedback: Towards Open-Ended Diversity-Driven Optimization
par: Ding, Li, et autres
Publié: (2023)
par: Ding, Li, et autres
Publié: (2023)
Does RLVR Extend Reasoning Boundaries? Investigating Capability Expansion in Vision-Language Models
par: Shen, Minghe, et autres
Publié: (2025)
par: Shen, Minghe, et autres
Publié: (2025)
Reverse-Engineered Reasoning for Open-Ended Generation
par: Wang, Haozhe, et autres
Publié: (2025)
par: Wang, Haozhe, et autres
Publié: (2025)
The Multiple Ticket Hypothesis: Random Sparse Subnetworks Suffice for RLVR
par: Adewuyi, Israel, et autres
Publié: (2026)
par: Adewuyi, Israel, et autres
Publié: (2026)
MATEval: A Multi-Agent Discussion Framework for Advancing Open-Ended Text Evaluation
par: Li, Yu, et autres
Publié: (2024)
par: Li, Yu, et autres
Publié: (2024)
A Mixture-of-Experts Approach to Few-Shot Task Transfer in Open-Ended Text Worlds
par: Cui, Christopher Z., et autres
Publié: (2024)
par: Cui, Christopher Z., et autres
Publié: (2024)
Kinetix: Investigating the Training of General Agents through Open-Ended Physics-Based Control Tasks
par: Matthews, Michael, et autres
Publié: (2024)
par: Matthews, Michael, et autres
Publié: (2024)
Documents similaires
-
KnowRL: Boosting LLM Reasoning via Reinforcement Learning with Minimal-Sufficient Knowledge Guidance
par: Yu, Linhao, et autres
Publié: (2026) -
RLPR: Extrapolating RLVR to General Domains without Verifiers
par: Yu, Tianyu, et autres
Publié: (2025) -
IRDS: Interpretable RLVR Data Selection via Verifier-Coupled Sparse Autoencoder Coverage
par: Li, Yuhan, et autres
Publié: (2026) -
Beyond Multiple Choice: Verifiable OpenQA for Robust Vision-Language RFT
par: Liu, Yesheng, et autres
Publié: (2025) -
Before the Model Learns the Bug:Fuzzing RLVR Verifiers
par: Ray, Jaideep
Publié: (2026)