Salvato in:
| Autori principali: | Zhang, Mengyu, Ding, Siyu, Yin, Weichong, Sun, Yu, Wu, Hua |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2511.02463 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
KnowRL: Boosting LLM Reasoning via Reinforcement Learning with Minimal-Sufficient Knowledge Guidance
di: Yu, Linhao, et al.
Pubblicazione: (2026)
di: Yu, Linhao, et al.
Pubblicazione: (2026)
RLPR: Extrapolating RLVR to General Domains without Verifiers
di: Yu, Tianyu, et al.
Pubblicazione: (2025)
di: Yu, Tianyu, et al.
Pubblicazione: (2025)
IRDS: Interpretable RLVR Data Selection via Verifier-Coupled Sparse Autoencoder Coverage
di: Li, Yuhan, et al.
Pubblicazione: (2026)
di: Li, Yuhan, et al.
Pubblicazione: (2026)
Beyond Multiple Choice: Verifiable OpenQA for Robust Vision-Language RFT
di: Liu, Yesheng, et al.
Pubblicazione: (2025)
di: Liu, Yesheng, et al.
Pubblicazione: (2025)
Before the Model Learns the Bug:Fuzzing RLVR Verifiers
di: Ray, Jaideep
Pubblicazione: (2026)
di: Ray, Jaideep
Pubblicazione: (2026)
DéjàQ: Open-Ended Evolution of Diverse, Learnable and Verifiable Problems
di: Röpke, Willem, et al.
Pubblicazione: (2026)
di: Röpke, Willem, et al.
Pubblicazione: (2026)
OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments
di: Xie, Tianbao, et al.
Pubblicazione: (2024)
di: Xie, Tianbao, et al.
Pubblicazione: (2024)
Backdoors in RLVR: Jailbreak Backdoors in LLMs From Verifiable Reward
di: Guo, Weiyang, et al.
Pubblicazione: (2026)
di: Guo, Weiyang, et al.
Pubblicazione: (2026)
JADE: Expert-Grounded Dynamic Evaluation for Open-Ended Professional Tasks
di: Lin, Lanbo, et al.
Pubblicazione: (2026)
di: Lin, Lanbo, et al.
Pubblicazione: (2026)
Aletheia: What Makes RLVR For Code Verifiers Tick?
di: Venkatkrishna, Vatsal, et al.
Pubblicazione: (2026)
di: Venkatkrishna, Vatsal, et al.
Pubblicazione: (2026)
Open-Ended Task Discovery via Bayesian Optimization
di: Adachi, Masaki, et al.
Pubblicazione: (2026)
di: Adachi, Masaki, et al.
Pubblicazione: (2026)
Building Open-Ended Embodied Agent via Language-Policy Bidirectional Adaptation
di: Zhai, Shaopeng, et al.
Pubblicazione: (2023)
di: Zhai, Shaopeng, et al.
Pubblicazione: (2023)
On Creativity and Open-Endedness
di: Soros, L. B., et al.
Pubblicazione: (2024)
di: Soros, L. B., et al.
Pubblicazione: (2024)
LLMs Gaming Verifiers: RLVR can Lead to Reward Hacking
di: Helff, Lukas, et al.
Pubblicazione: (2026)
di: Helff, Lukas, et al.
Pubblicazione: (2026)
Tru-POMDP: Task Planning Under Uncertainty via Tree of Hypotheses and Open-Ended POMDPs
di: Tang, Wenjing, et al.
Pubblicazione: (2025)
di: Tang, Wenjing, et al.
Pubblicazione: (2025)
Orthogonal Finetuning for Direct Preference Optimization
di: Yang, Chenxu, et al.
Pubblicazione: (2024)
di: Yang, Chenxu, et al.
Pubblicazione: (2024)
RM-PoT: Reformulating Mathematical Problems and Solving via Program of Thoughts
di: Zhang, Yu, et al.
Pubblicazione: (2025)
di: Zhang, Yu, et al.
Pubblicazione: (2025)
Hard2Verify: A Step-Level Verification Benchmark for Open-Ended Frontier Math
di: Pandit, Shrey, et al.
Pubblicazione: (2025)
di: Pandit, Shrey, et al.
Pubblicazione: (2025)
GRLO: Towards Generalizable Reinforcement Learning in Open-Ended Environments from Zero
di: Yin, Shangjian, et al.
Pubblicazione: (2026)
di: Yin, Shangjian, et al.
Pubblicazione: (2026)
Weights-Rotated Preference Optimization for Large Language Models
di: Yang, Chenxu, et al.
Pubblicazione: (2025)
di: Yang, Chenxu, et al.
Pubblicazione: (2025)
RLVR-World: Training World Models with Reinforcement Learning
di: Wu, Jialong, et al.
Pubblicazione: (2025)
di: Wu, Jialong, et al.
Pubblicazione: (2025)
PerMix-RLVR: Preserving Persona Expressivity under Verifiable-Reward Alignment
di: Oh, Jihwan, et al.
Pubblicazione: (2026)
di: Oh, Jihwan, et al.
Pubblicazione: (2026)
Yunjue Agent Tech Report: A Fully Reproducible, Zero-Start In-Situ Self-Evolving Agent System for Open-Ended Tasks
di: Li, Haotian, et al.
Pubblicazione: (2026)
di: Li, Haotian, et al.
Pubblicazione: (2026)
Luban: Building Open-Ended Creative Agents via Autonomous Embodied Verification
di: Guo, Yuxuan, et al.
Pubblicazione: (2024)
di: Guo, Yuxuan, et al.
Pubblicazione: (2024)
Group-Evolving Agents: Open-Ended Self-Improvement via Experience Sharing
di: Weng, Zhaotian, et al.
Pubblicazione: (2026)
di: Weng, Zhaotian, et al.
Pubblicazione: (2026)
Differentiating Choices via Commonality for Multiple-Choice Question Answering
di: Deng, Wenqing, et al.
Pubblicazione: (2024)
di: Deng, Wenqing, et al.
Pubblicazione: (2024)
Expert Evaluation of LLM's Open-Ended Legal Reasoning on the Japanese Bar Exam Writing Task
di: Choi, Jungmin, et al.
Pubblicazione: (2026)
di: Choi, Jungmin, et al.
Pubblicazione: (2026)
Embodied World Models Emerge from Navigational Task in Open-Ended Environments
di: Jin, Li, et al.
Pubblicazione: (2025)
di: Jin, Li, et al.
Pubblicazione: (2025)
InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training
di: Wang, Pengkai, et al.
Pubblicazione: (2025)
di: Wang, Pengkai, et al.
Pubblicazione: (2025)
ArenaRL: Scaling RL for Open-Ended Agents via Tournament-based Relative Ranking
di: Zhang, Qiang, et al.
Pubblicazione: (2026)
di: Zhang, Qiang, et al.
Pubblicazione: (2026)
Pessimistic Verification for Open Ended Math Questions
di: Huang, Yanxing, et al.
Pubblicazione: (2025)
di: Huang, Yanxing, et al.
Pubblicazione: (2025)
GUIDE: A Benchmark for Understanding and Assisting Users in Open-Ended GUI Tasks
di: Yang, Saelyne, et al.
Pubblicazione: (2026)
di: Yang, Saelyne, et al.
Pubblicazione: (2026)
EAPO: Entropy-Driven Adaptive Positive-Negative Sample Weighting for Policy Optimization in Open-Ended QA
di: Zeng, Yunsheng, et al.
Pubblicazione: (2026)
di: Zeng, Yunsheng, et al.
Pubblicazione: (2026)
Quality Diversity through Human Feedback: Towards Open-Ended Diversity-Driven Optimization
di: Ding, Li, et al.
Pubblicazione: (2023)
di: Ding, Li, et al.
Pubblicazione: (2023)
Does RLVR Extend Reasoning Boundaries? Investigating Capability Expansion in Vision-Language Models
di: Shen, Minghe, et al.
Pubblicazione: (2025)
di: Shen, Minghe, et al.
Pubblicazione: (2025)
Reverse-Engineered Reasoning for Open-Ended Generation
di: Wang, Haozhe, et al.
Pubblicazione: (2025)
di: Wang, Haozhe, et al.
Pubblicazione: (2025)
The Multiple Ticket Hypothesis: Random Sparse Subnetworks Suffice for RLVR
di: Adewuyi, Israel, et al.
Pubblicazione: (2026)
di: Adewuyi, Israel, et al.
Pubblicazione: (2026)
MATEval: A Multi-Agent Discussion Framework for Advancing Open-Ended Text Evaluation
di: Li, Yu, et al.
Pubblicazione: (2024)
di: Li, Yu, et al.
Pubblicazione: (2024)
A Mixture-of-Experts Approach to Few-Shot Task Transfer in Open-Ended Text Worlds
di: Cui, Christopher Z., et al.
Pubblicazione: (2024)
di: Cui, Christopher Z., et al.
Pubblicazione: (2024)
Kinetix: Investigating the Training of General Agents through Open-Ended Physics-Based Control Tasks
di: Matthews, Michael, et al.
Pubblicazione: (2024)
di: Matthews, Michael, et al.
Pubblicazione: (2024)
Documenti analoghi
-
KnowRL: Boosting LLM Reasoning via Reinforcement Learning with Minimal-Sufficient Knowledge Guidance
di: Yu, Linhao, et al.
Pubblicazione: (2026) -
RLPR: Extrapolating RLVR to General Domains without Verifiers
di: Yu, Tianyu, et al.
Pubblicazione: (2025) -
IRDS: Interpretable RLVR Data Selection via Verifier-Coupled Sparse Autoencoder Coverage
di: Li, Yuhan, et al.
Pubblicazione: (2026) -
Beyond Multiple Choice: Verifiable OpenQA for Robust Vision-Language RFT
di: Liu, Yesheng, et al.
Pubblicazione: (2025) -
Before the Model Learns the Bug:Fuzzing RLVR Verifiers
di: Ray, Jaideep
Pubblicazione: (2026)