Boosting Reward Model with Preference-Conditional Multi-Aspect Synthetic Data Generation
Fuente:
arXiv
Guardado en:
| Autores principales: | Shen, Jiaming, Xu, Ran, Jun, Yennie, Qin, Zhen, Liu, Tianqi, Yang, Carl, Liang, Yi, Baumgartner, Simon, Bendersky, Michael |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Multilingual Fine-Grained News Headline Hallucination Detection
por: Shen, Jiaming, et al.
Publicado: (2024)
por: Shen, Jiaming, et al.
Publicado: (2024)
PLaD: Preference-based Large Language Model Distillation with Pseudo-Preference Pairs
por: Zhang, Rongzhi, et al.
Publicado: (2024)
por: Zhang, Rongzhi, et al.
Publicado: (2024)
LAMPO: Large Language Models as Preference Machines for Few-shot Ordinal Classification
por: Qin, Zhen, et al.
Publicado: (2024)
por: Qin, Zhen, et al.
Publicado: (2024)
Integrating Planning into Single-Turn Long-Form Text Generation
por: Liang, Yi, et al.
Publicado: (2024)
por: Liang, Yi, et al.
Publicado: (2024)
Predicting Text Preference Via Structured Comparative Reasoning
por: Yan, Jing Nathan, et al.
Publicado: (2023)
por: Yan, Jing Nathan, et al.
Publicado: (2023)
LiPO: Listwise Preference Optimization through Learning-to-Rank
por: Liu, Tianqi, et al.
Publicado: (2024)
por: Liu, Tianqi, et al.
Publicado: (2024)
Reliable Confidence Intervals for Information Retrieval Evaluation Using Generative A.I
por: Oosterhuis, Harrie, et al.
Publicado: (2024)
por: Oosterhuis, Harrie, et al.
Publicado: (2024)
OpenRubrics: Towards Scalable Synthetic Rubric Generation for Reward Modeling and LLM Alignment
por: Liu, Tianci, et al.
Publicado: (2025)
por: Liu, Tianci, et al.
Publicado: (2025)
Building Math Agents with Multi-Turn Iterative Preference Learning
por: Xiong, Wei, et al.
Publicado: (2024)
por: Xiong, Wei, et al.
Publicado: (2024)
Multi-dimensional Preference Alignment by Conditioning Reward Itself
por: Jang, Jiho, et al.
Publicado: (2025)
por: Jang, Jiho, et al.
Publicado: (2025)
Large Language Models are Effective Text Rankers with Pairwise Ranking Prompting
por: Qin, Zhen, et al.
Publicado: (2023)
por: Qin, Zhen, et al.
Publicado: (2023)
Self-Boosting Large Language Models with Synthetic Preference Data
por: Dong, Qingxiu, et al.
Publicado: (2024)
por: Dong, Qingxiu, et al.
Publicado: (2024)
Boosting Data Analytics With Synthetic Volume Expansion
por: Shen, Xiaotong, et al.
Publicado: (2023)
por: Shen, Xiaotong, et al.
Publicado: (2023)
Stochastic RAG: End-to-End Retrieval-Augmented Generation through Expected Utility Maximization
por: Zamani, Hamed, et al.
Publicado: (2024)
por: Zamani, Hamed, et al.
Publicado: (2024)
A Dense Reward View on Aligning Text-to-Image Diffusion with Preference
por: Yang, Shentao, et al.
Publicado: (2024)
por: Yang, Shentao, et al.
Publicado: (2024)
MARBLE: Multi-Aspect Reward Balance for Diffusion RL
por: Zhao, Canyu, et al.
Publicado: (2026)
por: Zhao, Canyu, et al.
Publicado: (2026)
Auto-Rubric as Reward: From Implicit Preferences to Explicit Multimodal Generative Criteria
por: Tian, Juanxi, et al.
Publicado: (2026)
por: Tian, Juanxi, et al.
Publicado: (2026)
RefReward-SR: LR-Conditioned Reward Modeling for Preference-Aligned Super-Resolution
por: Song, Yushuai, et al.
Publicado: (2026)
por: Song, Yushuai, et al.
Publicado: (2026)
Beyond Scalar Reward Model: Learning Generative Judge from Preference Data
por: Ye, Ziyi, et al.
Publicado: (2024)
por: Ye, Ziyi, et al.
Publicado: (2024)
Towards Data-Centric RLHF: Simple Metrics for Preference Dataset Comparison
por: Shen, Judy Hanwen, et al.
Publicado: (2024)
por: Shen, Judy Hanwen, et al.
Publicado: (2024)
Boosting Vulnerability Detection of LLMs via Curriculum Preference Optimization with Synthetic Reasoning Data
por: Wen, Xin-Cheng, et al.
Publicado: (2025)
por: Wen, Xin-Cheng, et al.
Publicado: (2025)
West-of-N: Synthetic Preferences for Self-Improving Reward Models
por: Pace, Alizée, et al.
Publicado: (2024)
por: Pace, Alizée, et al.
Publicado: (2024)
Bridging the Preference Gap between Retrievers and LLMs
por: Ke, Zixuan, et al.
Publicado: (2024)
por: Ke, Zixuan, et al.
Publicado: (2024)
RRM: Robust Reward Model Training Mitigates Reward Hacking
por: Liu, Tianqi, et al.
Publicado: (2024)
por: Liu, Tianqi, et al.
Publicado: (2024)
Boosting Large Language Models with Continual Learning for Aspect-based Sentiment Analysis
por: Ding, Xuanwen, et al.
Publicado: (2024)
por: Ding, Xuanwen, et al.
Publicado: (2024)
Evidence gaps in orthognathic surgery, a Delphi study protocol
por: Josefina Bendersky
Publicado: (2023)
por: Josefina Bendersky
Publicado: (2023)
RMGAP: Benchmarking the Generalization of Reward Models across Diverse Preferences
por: Zhou, Yangyang, et al.
Publicado: (2026)
por: Zhou, Yangyang, et al.
Publicado: (2026)
The Evolving Landscape of Modern Regression: A Systematic Review and Mapping Study of Penalized, Algorithmic, and Interpretable Models
por: Michael Bendersky, et al.
Publicado: (2026)
por: Michael Bendersky, et al.
Publicado: (2026)
Hierarchical Conditional Tabular GAN for Multi-Tabular Synthetic Data Generation
por: Ågren, Wilhelm, et al.
Publicado: (2024)
por: Ågren, Wilhelm, et al.
Publicado: (2024)
A Comprehensive Survey of Synthetic Tabular Data Generation
por: Shi, Ruxue, et al.
Publicado: (2025)
por: Shi, Ruxue, et al.
Publicado: (2025)
Learning Ordinal Probabilistic Reward from Preferences
por: Chen, Longze, et al.
Publicado: (2026)
por: Chen, Longze, et al.
Publicado: (2026)
Generating Multi-Aspect Queries for Conversational Search
por: Abbasiantaeb, Zahra, et al.
Publicado: (2024)
por: Abbasiantaeb, Zahra, et al.
Publicado: (2024)
RAG-RewardBench: Benchmarking Reward Models in Retrieval Augmented Generation for Preference Alignment
por: Jin, Zhuoran, et al.
Publicado: (2024)
por: Jin, Zhuoran, et al.
Publicado: (2024)
Towards Anatomically Plausible Human Image Generation via Synthetic Localized Preferences
por: Li, Bao, et al.
Publicado: (2026)
por: Li, Bao, et al.
Publicado: (2026)
VisionReward: Fine-Grained Multi-Dimensional Human Preference Learning for Image and Video Generation
por: Xu, Jiazheng, et al.
Publicado: (2024)
por: Xu, Jiazheng, et al.
Publicado: (2024)
CINDI: Conditional Imputation and Noisy Data Integrity with Flows in Power Grid Data
por: Baumgartner, David, et al.
Publicado: (2026)
por: Baumgartner, David, et al.
Publicado: (2026)
Can Query Expansion Improve Generalization of Strong Cross-Encoder Rankers?
por: Li, Minghan, et al.
Publicado: (2023)
por: Li, Minghan, et al.
Publicado: (2023)
Best-of-Venom: Attacking RLHF by Injecting Poisoned Preference Data
por: Baumgärtner, Tim, et al.
Publicado: (2024)
por: Baumgärtner, Tim, et al.
Publicado: (2024)
Listwise Preference Optimization with Element-wise Confusions for Aspect Sentiment Quad Prediction
por: Lai, Wenna, et al.
Publicado: (2025)
por: Lai, Wenna, et al.
Publicado: (2025)
From Self-Evolving Synthetic Data to Verifiable-Reward RL: Post-Training Multi-turn Interactive Tool-Using Agents
por: Gao, Jiaxuan, et al.
Publicado: (2026)
por: Gao, Jiaxuan, et al.
Publicado: (2026)
Ejemplares similares
-
Multilingual Fine-Grained News Headline Hallucination Detection
por: Shen, Jiaming, et al.
Publicado: (2024) -
PLaD: Preference-based Large Language Model Distillation with Pseudo-Preference Pairs
por: Zhang, Rongzhi, et al.
Publicado: (2024) -
LAMPO: Large Language Models as Preference Machines for Few-shot Ordinal Classification
por: Qin, Zhen, et al.
Publicado: (2024) -
Integrating Planning into Single-Turn Long-Form Text Generation
por: Liang, Yi, et al.
Publicado: (2024) -
Predicting Text Preference Via Structured Comparative Reasoning
por: Yan, Jing Nathan, et al.
Publicado: (2023)