Personalized Group Relative Policy Optimization for Heterogenous Preference Alignment
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Jialu, Peters, Heinrich, Butt, Asad A., Hashemi, Navid, Hashemi, Alireza, Ghari, Pouya M., Hoover, Joseph, Rae, James, Dehghani, Morteza |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Generalizable Error Modeling for Human Data Annotation: Evidence From an Industry-Scale Search Data Annotation Program
por: Peters, Heinrich, et al.
Publicado: (2023)
por: Peters, Heinrich, et al.
Publicado: (2023)
The Homogenizing Effect of Large Language Models on Human Expression and Thought
por: Sourati, Zhivar, et al.
Publicado: (2025)
por: Sourati, Zhivar, et al.
Publicado: (2025)
CoCo-CoLa: Evaluating and Improving Language Adherence in Multilingual LLMs
por: Rahmati, Elnaz, et al.
Publicado: (2025)
por: Rahmati, Elnaz, et al.
Publicado: (2025)
CodeAlignBench: Assessing Code Generation Models on Developer-Preferred Code Adjustments
por: Mehralian, Forough, et al.
Publicado: (2025)
por: Mehralian, Forough, et al.
Publicado: (2025)
pFedWN: A Personalized Federated Learning Framework for D2D Wireless Networks with Heterogeneous Data
por: Ni, Zhou, et al.
Publicado: (2025)
por: Ni, Zhou, et al.
Publicado: (2025)
Cost-Efficient Subjective Task Annotation and Modeling through Few-Shot Annotator Adaptation
por: Golazizian, Preni, et al.
Publicado: (2024)
por: Golazizian, Preni, et al.
Publicado: (2024)
Personalized Federated Learning with Mixture of Models for Adaptive Prediction and Model Fine-Tuning
por: Ghari, Pouya M., et al.
Publicado: (2024)
por: Ghari, Pouya M., et al.
Publicado: (2024)
Flip-Flop Consistency: Unsupervised Training for Robustness to Prompt Perturbations in LLMs
por: Hejabi, Parsa, et al.
Publicado: (2025)
por: Hejabi, Parsa, et al.
Publicado: (2025)
Secret Keepers: The Impact of LLMs on Linguistic Markers of Personal Traits
por: Sourati, Zhivar, et al.
Publicado: (2024)
por: Sourati, Zhivar, et al.
Publicado: (2024)
Training-Free Group Relative Policy Optimization
por: Cai, Yuzheng, et al.
Publicado: (2025)
por: Cai, Yuzheng, et al.
Publicado: (2025)
Personalized Federated Learning-Driven Beamforming Optimization for Integrated Sensing and Communication Systems
por: Ni, Zhou, et al.
Publicado: (2025)
por: Ni, Zhou, et al.
Publicado: (2025)
Constrained Group Relative Policy Optimization
por: Girgis, Roger, et al.
Publicado: (2026)
por: Girgis, Roger, et al.
Publicado: (2026)
On-Policy Optimization with Group Equivalent Preference for Multi-Programming Language Understanding
por: Wu, Haoyuan, et al.
Publicado: (2025)
por: Wu, Haoyuan, et al.
Publicado: (2025)
Reasoning on a Spectrum: Aligning LLMs to System 1 and System 2 Thinking
por: Ziabari, Alireza S., et al.
Publicado: (2025)
por: Ziabari, Alireza S., et al.
Publicado: (2025)
Group Preference Optimization: Few-Shot Alignment of Large Language Models
por: Zhao, Siyan, et al.
Publicado: (2023)
por: Zhao, Siyan, et al.
Publicado: (2023)
Scaling Learning based Policy Optimization for Temporal Logic Tasks by Controller Network Dropout
por: Hashemi, Navid, et al.
Publicado: (2024)
por: Hashemi, Navid, et al.
Publicado: (2024)
Self-Augmented Preference Optimization: Off-Policy Paradigms for Language Model Alignment
por: Yin, Yueqin, et al.
Publicado: (2024)
por: Yin, Yueqin, et al.
Publicado: (2024)
FedPDPO: Federated Personalized Direct Preference Optimization for Large Language Model Alignment
por: Zhu, Kewen, et al.
Publicado: (2026)
por: Zhu, Kewen, et al.
Publicado: (2026)
Budgeted Online Model Selection and Fine-Tuning via Federated Learning
por: Ghari, Pouya M., et al.
Publicado: (2024)
por: Ghari, Pouya M., et al.
Publicado: (2024)
No Preference Left Behind: Group Distributional Preference Optimization
por: Yao, Binwei, et al.
Publicado: (2024)
por: Yao, Binwei, et al.
Publicado: (2024)
Cost-Aware Retrieval-Augmentation Reasoning Models with Adaptive Retrieval Depth
por: Hashemi, Helia, et al.
Publicado: (2025)
por: Hashemi, Helia, et al.
Publicado: (2025)
Teaching LLM to be Persuasive: Reward-Enhanced Policy Optimization for Alignment from Heterogeneous Rewards
por: Zeng, Xia, et al.
Publicado: (2025)
por: Zeng, Xia, et al.
Publicado: (2025)
Statistical Rejection Sampling Improves Preference Optimization
por: Liu, Tianqi, et al.
Publicado: (2023)
por: Liu, Tianqi, et al.
Publicado: (2023)
Drift: Decoding-time Personalized Alignments with Implicit User Preferences
por: Kim, Minbeom, et al.
Publicado: (2025)
por: Kim, Minbeom, et al.
Publicado: (2025)
Is On-Policy Data always the Best Choice for Direct Preference Optimization-based LM Alignment?
por: Sun, Zetian, et al.
Publicado: (2025)
por: Sun, Zetian, et al.
Publicado: (2025)
Latent-GRPO: Group Relative Policy Optimization for Latent Reasoning
por: Deng, Jingcheng, et al.
Publicado: (2026)
por: Deng, Jingcheng, et al.
Publicado: (2026)
Preference Ranking Optimization for Human Alignment
por: Song, Feifan, et al.
Publicado: (2023)
por: Song, Feifan, et al.
Publicado: (2023)
Semantic-Aware and Goal-Oriented Communications for Object Detection in Wireless End-to-End Image Transmission
por: Safaeipour, Fatemeh Zahra, et al.
Publicado: (2024)
por: Safaeipour, Fatemeh Zahra, et al.
Publicado: (2024)
Visiting Distant Neighbors in Graph Convolutional Networks
por: Hashemi, Alireza, et al.
Publicado: (2023)
por: Hashemi, Alireza, et al.
Publicado: (2023)
Bayes-Split-Edge: Bayesian Optimization for Constrained Collaborative Inference in Wireless Edge Systems
por: Safaeipour, Fatemeh Zahra, et al.
Publicado: (2025)
por: Safaeipour, Fatemeh Zahra, et al.
Publicado: (2025)
A Survey on Personalized and Pluralistic Preference Alignment in Large Language Models
por: Xie, Zhouhang, et al.
Publicado: (2025)
por: Xie, Zhouhang, et al.
Publicado: (2025)
On Group Relative Policy Optimization Collapse in Agent Search: The Lazy Likelihood-Displacement
por: Deng, Wenlong, et al.
Publicado: (2025)
por: Deng, Wenlong, et al.
Publicado: (2025)
Malicious Repurposing of Open Science Artefacts by Using Large Language Models
por: Hashemi, Zahra, et al.
Publicado: (2026)
por: Hashemi, Zahra, et al.
Publicado: (2026)
GroupDPO: Memory efficient Group-wise Direct Preference Optimization
por: Leng, Jixuan, et al.
Publicado: (2026)
por: Leng, Jixuan, et al.
Publicado: (2026)
PACIFIC: Can LLMs Discern the Traits Influencing Your Preferences? Evaluating Personality-Driven Preference Alignment in LLMs
por: Zhao, Tianyu, et al.
Publicado: (2026)
por: Zhao, Tianyu, et al.
Publicado: (2026)
PCA-DDReach: Efficient Statistical Reachability Analysis of Stochastic Dynamical Systems via Principal Component Analysis
por: Hashemi, Navid, et al.
Publicado: (2025)
por: Hashemi, Navid, et al.
Publicado: (2025)
Refuelling Behaviour and Electric Vehicle Uptake: Evidence From a Behavioural Transition Framework in Western Australia
por: Navid Hashemi Taba, et al.
Publicado: (2026)
por: Navid Hashemi Taba, et al.
Publicado: (2026)
Policy Optimization Prefers The Path of Least Resistance
por: Sanyal, Debdeep, et al.
Publicado: (2025)
por: Sanyal, Debdeep, et al.
Publicado: (2025)
Can Group Relative Policy Optimization Improve Thai Legal Reasoning and Question Answering?
por: Akarajaradwong, Pawitsapak, et al.
Publicado: (2025)
por: Akarajaradwong, Pawitsapak, et al.
Publicado: (2025)
Group Preference Alignment: Customized LLM Response Generation from In-Situ Conversations
por: Mondal, Ishani, et al.
Publicado: (2025)
por: Mondal, Ishani, et al.
Publicado: (2025)
Ejemplares similares
-
Generalizable Error Modeling for Human Data Annotation: Evidence From an Industry-Scale Search Data Annotation Program
por: Peters, Heinrich, et al.
Publicado: (2023) -
The Homogenizing Effect of Large Language Models on Human Expression and Thought
por: Sourati, Zhivar, et al.
Publicado: (2025) -
CoCo-CoLa: Evaluating and Improving Language Adherence in Multilingual LLMs
por: Rahmati, Elnaz, et al.
Publicado: (2025) -
CodeAlignBench: Assessing Code Generation Models on Developer-Preferred Code Adjustments
por: Mehralian, Forough, et al.
Publicado: (2025) -
pFedWN: A Personalized Federated Learning Framework for D2D Wireless Networks with Heterogeneous Data
por: Ni, Zhou, et al.
Publicado: (2025)