Salvato in:
| Autori principali: | Cao, Guining, Peng, Jiaxin, Zeng, Chu, Zhao, Yu, Song, Shuangyong, Yongxiang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2605.18191 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Prompt-Level Reward Specifications for Open-Ended Post-Training
di: Weng, Zijun, et al.
Pubblicazione: (2026)
di: Weng, Zijun, et al.
Pubblicazione: (2026)
Tournament-GRPO: Group-Wise Tournament Rewards for Reinforcement Learning in Open-Ended Long-Form Generation
di: Yang, Zixuan, et al.
Pubblicazione: (2026)
di: Yang, Zixuan, et al.
Pubblicazione: (2026)
Emotional Support with LLM-based Empathetic Dialogue Generation
di: Wang, Shiquan, et al.
Pubblicazione: (2025)
di: Wang, Shiquan, et al.
Pubblicazione: (2025)
Self-Rewarding Rubric-Based Reinforcement Learning for Open-Ended Reasoning
di: Ye, Zhiling, et al.
Pubblicazione: (2025)
di: Ye, Zhiling, et al.
Pubblicazione: (2025)
Rainbow Teaming: Open-Ended Generation of Diverse Adversarial Prompts
di: Samvelyan, Mikayel, et al.
Pubblicazione: (2024)
di: Samvelyan, Mikayel, et al.
Pubblicazione: (2024)
From General to Targeted Rewards: Surpassing GPT-4 in Open-Ended Long-Context Generation
di: Guo, Zhihan, et al.
Pubblicazione: (2025)
di: Guo, Zhihan, et al.
Pubblicazione: (2025)
Evaluating Reward Model Generalization via Pairwise Maximum Discrepancy Competitions
di: Luo, Shunyang, et al.
Pubblicazione: (2026)
di: Luo, Shunyang, et al.
Pubblicazione: (2026)
PaTaRM: Bridging Pairwise and Pointwise Signals via Preference-Aware Task-Adaptive Reward Modeling
di: Jian, Ai, et al.
Pubblicazione: (2025)
di: Jian, Ai, et al.
Pubblicazione: (2025)
On Creativity and Open-Endedness
di: Soros, L. B., et al.
Pubblicazione: (2024)
di: Soros, L. B., et al.
Pubblicazione: (2024)
Pessimistic Verification for Open Ended Math Questions
di: Huang, Yanxing, et al.
Pubblicazione: (2025)
di: Huang, Yanxing, et al.
Pubblicazione: (2025)
$i$REPO: $i$mplicit Reward Pairwise Difference based Empirical Preference Optimization
di: Le, Long Tan, et al.
Pubblicazione: (2024)
di: Le, Long Tan, et al.
Pubblicazione: (2024)
G-Zero: Self-Play for Open-Ended Generation from Zero Data
di: Huang, Chengsong, et al.
Pubblicazione: (2026)
di: Huang, Chengsong, et al.
Pubblicazione: (2026)
Group-Evolving Agents: Open-Ended Self-Improvement via Experience Sharing
di: Weng, Zhaotian, et al.
Pubblicazione: (2026)
di: Weng, Zhaotian, et al.
Pubblicazione: (2026)
DéjàQ: Open-Ended Evolution of Diverse, Learnable and Verifiable Problems
di: Röpke, Willem, et al.
Pubblicazione: (2026)
di: Röpke, Willem, et al.
Pubblicazione: (2026)
Generation Space Size: Understanding and Calibrating Open-Endedness of LLM Generations
di: Yu, Sunny, et al.
Pubblicazione: (2025)
di: Yu, Sunny, et al.
Pubblicazione: (2025)
TableReasoner: Advancing Table Reasoning Framework with Large Language Models
di: Xiong, Sishi, et al.
Pubblicazione: (2025)
di: Xiong, Sishi, et al.
Pubblicazione: (2025)
DIVERGE: Diversity-Enhanced RAG for Open-Ended Information Seeking
di: Hu, Tianyi, et al.
Pubblicazione: (2026)
di: Hu, Tianyi, et al.
Pubblicazione: (2026)
Quality Diversity through Human Feedback: Towards Open-Ended Diversity-Driven Optimization
di: Ding, Li, et al.
Pubblicazione: (2023)
di: Ding, Li, et al.
Pubblicazione: (2023)
Reverse-Engineered Reasoning for Open-Ended Generation
di: Wang, Haozhe, et al.
Pubblicazione: (2025)
di: Wang, Haozhe, et al.
Pubblicazione: (2025)
Pairwise Calibrated Rewards for Pluralistic Alignment
di: Halpern, Daniel, et al.
Pubblicazione: (2025)
di: Halpern, Daniel, et al.
Pubblicazione: (2025)
Enabling Adaptive Agent Training in Open-Ended Simulators by Targeting Diversity
di: Costales, Robby, et al.
Pubblicazione: (2024)
di: Costales, Robby, et al.
Pubblicazione: (2024)
Towards Open-Ended Emotional Support Conversations in LLMs via Reinforcement Learning with Future-Oriented Rewards
di: Yang, Ting, et al.
Pubblicazione: (2025)
di: Yang, Ting, et al.
Pubblicazione: (2025)
RAG-RewardBench: Benchmarking Reward Models in Retrieval Augmented Generation for Preference Alignment
di: Jin, Zhuoran, et al.
Pubblicazione: (2024)
di: Jin, Zhuoran, et al.
Pubblicazione: (2024)
Beyond the Binary: Capturing Diverse Preferences With Reward Regularization
di: Padmakumar, Vishakh, et al.
Pubblicazione: (2024)
di: Padmakumar, Vishakh, et al.
Pubblicazione: (2024)
Balancing Diversity and Risk in LLM Sampling: How to Select Your Method and Parameter for Open-Ended Text Generation
di: Zhou, Yuxuan, et al.
Pubblicazione: (2024)
di: Zhou, Yuxuan, et al.
Pubblicazione: (2024)
D-QRELO: Training- and Data-Free Delta Compression for Large Language Models via Quantization and Residual Low-Rank Approximation
di: Li, Junlin, et al.
Pubblicazione: (2026)
di: Li, Junlin, et al.
Pubblicazione: (2026)
Arithmetic Control of LLMs for Diverse User Preferences: Directional Preference Alignment with Multi-Objective Rewards
di: Wang, Haoxiang, et al.
Pubblicazione: (2024)
di: Wang, Haoxiang, et al.
Pubblicazione: (2024)
Yunjue Agent Tech Report: A Fully Reproducible, Zero-Start In-Situ Self-Evolving Agent System for Open-Ended Tasks
di: Li, Haotian, et al.
Pubblicazione: (2026)
di: Li, Haotian, et al.
Pubblicazione: (2026)
AI Gamestore: Scalable, Open-Ended Evaluation of Machine General Intelligence with Human Games
di: Ying, Lance, et al.
Pubblicazione: (2026)
di: Ying, Lance, et al.
Pubblicazione: (2026)
RMGAP: Benchmarking the Generalization of Reward Models across Diverse Preferences
di: Zhou, Yangyang, et al.
Pubblicazione: (2026)
di: Zhou, Yangyang, et al.
Pubblicazione: (2026)
Generating Planning Feedback for Open-Ended Programming Exercises with LLMs
di: Demirtaş, Mehmet Arif, et al.
Pubblicazione: (2025)
di: Demirtaş, Mehmet Arif, et al.
Pubblicazione: (2025)
Table-R1: Region-based Reinforcement Learning for Table Understanding
di: Wu, Zhenhe, et al.
Pubblicazione: (2025)
di: Wu, Zhenhe, et al.
Pubblicazione: (2025)
Diversity Collapse in Multi-Agent LLM Systems: Structural Coupling and Collective Failure in Open-Ended Idea Generation
di: Chen, Nuo, et al.
Pubblicazione: (2026)
di: Chen, Nuo, et al.
Pubblicazione: (2026)
DS-STAR: Data Science Agent for Solving Diverse Tasks across Heterogeneous Formats and Open-Ended Queries
di: Nam, Jaehyun, et al.
Pubblicazione: (2025)
di: Nam, Jaehyun, et al.
Pubblicazione: (2025)
GUIDE: A Benchmark for Understanding and Assisting Users in Open-Ended GUI Tasks
di: Yang, Saelyne, et al.
Pubblicazione: (2026)
di: Yang, Saelyne, et al.
Pubblicazione: (2026)
From Abstract to Actionable: Pairwise Shapley Values for Explainable AI
di: Xu, Jiaxin, et al.
Pubblicazione: (2025)
di: Xu, Jiaxin, et al.
Pubblicazione: (2025)
OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments
di: Xie, Tianbao, et al.
Pubblicazione: (2024)
di: Xie, Tianbao, et al.
Pubblicazione: (2024)
Kinetix: Investigating the Training of General Agents through Open-Ended Physics-Based Control Tasks
di: Matthews, Michael, et al.
Pubblicazione: (2024)
di: Matthews, Michael, et al.
Pubblicazione: (2024)
Building Open-Ended Embodied Agent via Language-Policy Bidirectional Adaptation
di: Zhai, Shaopeng, et al.
Pubblicazione: (2023)
di: Zhai, Shaopeng, et al.
Pubblicazione: (2023)
The Hyperfitting Phenomenon: Sharpening and Stabilizing LLMs for Open-Ended Text Generation
di: Carlsson, Fredrik, et al.
Pubblicazione: (2024)
di: Carlsson, Fredrik, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Prompt-Level Reward Specifications for Open-Ended Post-Training
di: Weng, Zijun, et al.
Pubblicazione: (2026) -
Tournament-GRPO: Group-Wise Tournament Rewards for Reinforcement Learning in Open-Ended Long-Form Generation
di: Yang, Zixuan, et al.
Pubblicazione: (2026) -
Emotional Support with LLM-based Empathetic Dialogue Generation
di: Wang, Shiquan, et al.
Pubblicazione: (2025) -
Self-Rewarding Rubric-Based Reinforcement Learning for Open-Ended Reasoning
di: Ye, Zhiling, et al.
Pubblicazione: (2025) -
Rainbow Teaming: Open-Ended Generation of Diverse Adversarial Prompts
di: Samvelyan, Mikayel, et al.
Pubblicazione: (2024)