Prompt-Level Reward Specifications for Open-Ended Post-Training
Fuente:
arXiv
Salvato in:
| Autori principali: | Weng, Zijun, Hu, Xiaohui, Song, Shuangyong, Li, Yongxiang, Yu, Kaidong, Huang, Xuanjing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Pairwise Preference Reward and Group-Based Diversity Enhancement for Superior Open-Ended Generation
di: Cao, Guining, et al.
Pubblicazione: (2026)
di: Cao, Guining, et al.
Pubblicazione: (2026)
Emotional Support with LLM-based Empathetic Dialogue Generation
di: Wang, Shiquan, et al.
Pubblicazione: (2025)
di: Wang, Shiquan, et al.
Pubblicazione: (2025)
Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation
di: Li, Zongxia, et al.
Pubblicazione: (2025)
di: Li, Zongxia, et al.
Pubblicazione: (2025)
Stop Rewarding Hallucinated Steps: Faithfulness-Aware Step-Level Reinforcement Learning for Small Reasoning Models
di: Nie, Shuo, et al.
Pubblicazione: (2026)
di: Nie, Shuo, et al.
Pubblicazione: (2026)
MiRD: Reliable Set-Valued Prediction for Open-Ended Question Answering via Miscoverage Risk Decomposition
di: Hu, Anqi, et al.
Pubblicazione: (2026)
di: Hu, Anqi, et al.
Pubblicazione: (2026)
OpenGenAlign: A Preference Dataset and Benchmark for Trustworthy Reward Modeling in Open-Ended, Long-Context Generation
di: Zhang, Hanning, et al.
Pubblicazione: (2025)
di: Zhang, Hanning, et al.
Pubblicazione: (2025)
Towards Robustness and Diversity: Continual Learning in Dialog Generation with Text-Mixup and Batch Nuclear-Norm Maximization
di: Wang, Zihan, et al.
Pubblicazione: (2024)
di: Wang, Zihan, et al.
Pubblicazione: (2024)
Improve LLM-as-a-Judge Ability as a General Ability
di: Yu, Jiachen, et al.
Pubblicazione: (2025)
di: Yu, Jiachen, et al.
Pubblicazione: (2025)
From General to Targeted Rewards: Surpassing GPT-4 in Open-Ended Long-Context Generation
di: Guo, Zhihan, et al.
Pubblicazione: (2025)
di: Guo, Zhihan, et al.
Pubblicazione: (2025)
Self-Rewarding Rubric-Based Reinforcement Learning for Open-Ended Reasoning
di: Ye, Zhiling, et al.
Pubblicazione: (2025)
di: Ye, Zhiling, et al.
Pubblicazione: (2025)
HAF-RM: A Hybrid Alignment Framework for Reward Model Training
di: Liu, Shujun, et al.
Pubblicazione: (2024)
di: Liu, Shujun, et al.
Pubblicazione: (2024)
MR-UIE: Multi-Perspective Reasoning with Reinforcement Learning for Universal Information Extraction
di: Li, Zhongqiu, et al.
Pubblicazione: (2025)
di: Li, Zhongqiu, et al.
Pubblicazione: (2025)
Neural Models and Language Model Prompting for the Multidimensional Evaluation of Open-Ended Conversations
di: Elizabeth, Michelle, et al.
Pubblicazione: (2025)
di: Elizabeth, Michelle, et al.
Pubblicazione: (2025)
TableZoomer: A Collaborative Agent Framework for Large-scale Table Question Answering
di: Xiong, Sishi, et al.
Pubblicazione: (2025)
di: Xiong, Sishi, et al.
Pubblicazione: (2025)
OpenEP: Open-Ended Future Event Prediction
di: Guan, Yong, et al.
Pubblicazione: (2024)
di: Guan, Yong, et al.
Pubblicazione: (2024)
Tournament-GRPO: Group-Wise Tournament Rewards for Reinforcement Learning in Open-Ended Long-Form Generation
di: Yang, Zixuan, et al.
Pubblicazione: (2026)
di: Yang, Zixuan, et al.
Pubblicazione: (2026)
Rainbow Teaming: Open-Ended Generation of Diverse Adversarial Prompts
di: Samvelyan, Mikayel, et al.
Pubblicazione: (2024)
di: Samvelyan, Mikayel, et al.
Pubblicazione: (2024)
UniARM: Towards a Unified Autoregressive Reward Model for Multi-Objective Test-Time Alignment
di: Xie, Hongyan, et al.
Pubblicazione: (2026)
di: Xie, Hongyan, et al.
Pubblicazione: (2026)
Spotting Out-of-Character Behavior: Atomic-Level Evaluation of Persona Fidelity in Open-Ended Generation
di: Shin, Jisu, et al.
Pubblicazione: (2025)
di: Shin, Jisu, et al.
Pubblicazione: (2025)
EvoRubric: Self-Evolving Rubric-Driven RL for Open-Ended Generation
di: Guan, Xin, et al.
Pubblicazione: (2026)
di: Guan, Xin, et al.
Pubblicazione: (2026)
TCNN: Triple Convolutional Neural Network Models for Retrieval-based Question Answering System in E-commerce
di: Song, Shuangyong, et al.
Pubblicazione: (2020)
di: Song, Shuangyong, et al.
Pubblicazione: (2020)
T2R-bench: A Benchmark for Generating Article-Level Reports from Real World Industrial Tables
di: Zhang, Jie, et al.
Pubblicazione: (2025)
di: Zhang, Jie, et al.
Pubblicazione: (2025)
OpenSIR: Open-Ended Self-Improving Reasoner
di: Kwan, Wai-Chung, et al.
Pubblicazione: (2025)
di: Kwan, Wai-Chung, et al.
Pubblicazione: (2025)
Dynamic and Generalizable Process Reward Modeling
di: Yin, Zhangyue, et al.
Pubblicazione: (2025)
di: Yin, Zhangyue, et al.
Pubblicazione: (2025)
Marco-o1: Towards Open Reasoning Models for Open-Ended Solutions
di: Zhao, Yu, et al.
Pubblicazione: (2024)
di: Zhao, Yu, et al.
Pubblicazione: (2024)
Reverse-Engineered Reasoning for Open-Ended Generation
di: Wang, Haozhe, et al.
Pubblicazione: (2025)
di: Wang, Haozhe, et al.
Pubblicazione: (2025)
Multi-Intent Spoken Language Understanding: Methods, Trends, and Challenges
di: Wu, Di, et al.
Pubblicazione: (2025)
di: Wu, Di, et al.
Pubblicazione: (2025)
Consolidating Rewarded Perturbations for LLM Post-Training
di: Zhang, Zheyu, et al.
Pubblicazione: (2026)
di: Zhang, Zheyu, et al.
Pubblicazione: (2026)
From National Curricula to Cultural Awareness: Constructing Open-Ended Culture-Specific Question Answering Dataset
di: Yoo, Haneul, et al.
Pubblicazione: (2026)
di: Yoo, Haneul, et al.
Pubblicazione: (2026)
Artificial Hivemind: The Open-Ended Homogeneity of Language Models (and Beyond)
di: Jiang, Liwei, et al.
Pubblicazione: (2025)
di: Jiang, Liwei, et al.
Pubblicazione: (2025)
MATEval: A Multi-Agent Discussion Framework for Advancing Open-Ended Text Evaluation
di: Li, Yu, et al.
Pubblicazione: (2024)
di: Li, Yu, et al.
Pubblicazione: (2024)
Odysseus Navigates the Sirens' Song: Dynamic Focus Decoding for Factual and Diverse Open-Ended Text Generation
di: Luo, Wen, et al.
Pubblicazione: (2025)
di: Luo, Wen, et al.
Pubblicazione: (2025)
ONEBench to Test Them All: Sample-Level Benchmarking Over Open-Ended Capabilities
di: Ghosh, Adhiraj, et al.
Pubblicazione: (2024)
di: Ghosh, Adhiraj, et al.
Pubblicazione: (2024)
DIVERGE: Diversity-Enhanced RAG for Open-Ended Information Seeking
di: Hu, Tianyi, et al.
Pubblicazione: (2026)
di: Hu, Tianyi, et al.
Pubblicazione: (2026)
MoPS: Modular Story Premise Synthesis for Open-Ended Automatic Story Generation
di: Ma, Yan, et al.
Pubblicazione: (2024)
di: Ma, Yan, et al.
Pubblicazione: (2024)
G-Zero: Self-Play for Open-Ended Generation from Zero Data
di: Huang, Chengsong, et al.
Pubblicazione: (2026)
di: Huang, Chengsong, et al.
Pubblicazione: (2026)
WebWeaver: Structuring Web-Scale Evidence with Dynamic Outlines for Open-Ended Deep Research
di: Li, Zijian, et al.
Pubblicazione: (2025)
di: Li, Zijian, et al.
Pubblicazione: (2025)
Open-Ended Wargames with Large Language Models
di: Hogan, Daniel P., et al.
Pubblicazione: (2024)
di: Hogan, Daniel P., et al.
Pubblicazione: (2024)
RewardHarness: Self-Evolving Agentic Post-Training
di: Zhang, Yuxuan, et al.
Pubblicazione: (2026)
di: Zhang, Yuxuan, et al.
Pubblicazione: (2026)
Pre-Trained Policy Discriminators are General Reward Models
di: Dou, Shihan, et al.
Pubblicazione: (2025)
di: Dou, Shihan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Pairwise Preference Reward and Group-Based Diversity Enhancement for Superior Open-Ended Generation
di: Cao, Guining, et al.
Pubblicazione: (2026) -
Emotional Support with LLM-based Empathetic Dialogue Generation
di: Wang, Shiquan, et al.
Pubblicazione: (2025) -
Semantically-Aware Rewards for Open-Ended R1 Training in Free-Form Generation
di: Li, Zongxia, et al.
Pubblicazione: (2025) -
Stop Rewarding Hallucinated Steps: Faithfulness-Aware Step-Level Reinforcement Learning for Small Reasoning Models
di: Nie, Shuo, et al.
Pubblicazione: (2026) -
MiRD: Reliable Set-Valued Prediction for Open-Ended Question Answering via Miscoverage Risk Decomposition
di: Hu, Anqi, et al.
Pubblicazione: (2026)