Group Preference Optimization: Few-Shot Alignment of Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhao, Siyan, Dang, John, Grover, Aditya |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Probing the Decision Boundaries of In-context Learning in Large Language Models
par: Zhao, Siyan, et autres
Publié: (2024)
par: Zhao, Siyan, et autres
Publié: (2024)
Peering Through Preferences: Unraveling Feedback Acquisition for Aligning Large Language Models
par: Bansal, Hritik, et autres
Publié: (2023)
par: Bansal, Hritik, et autres
Publié: (2023)
Prepacking: A Simple Method for Fast Prefilling and Increased Throughput in Large Language Models
par: Zhao, Siyan, et autres
Publié: (2024)
par: Zhao, Siyan, et autres
Publié: (2024)
Comparing Bad Apples to Good Oranges: Aligning Large Language Models via Joint Preference Optimization
par: Bansal, Hritik, et autres
Publié: (2024)
par: Bansal, Hritik, et autres
Publié: (2024)
Accelerated Preference Optimization for Large Language Model Alignment
par: He, Jiafan, et autres
Publié: (2024)
par: He, Jiafan, et autres
Publié: (2024)
Sequence-level Large Language Model Training with Contrastive Preference Optimization
par: Feng, Zhili, et autres
Publié: (2025)
par: Feng, Zhili, et autres
Publié: (2025)
Self-Play Preference Optimization for Language Model Alignment
par: Wu, Yue, et autres
Publié: (2024)
par: Wu, Yue, et autres
Publié: (2024)
Personalized Group Relative Policy Optimization for Heterogenous Preference Alignment
par: Wang, Jialu, et autres
Publié: (2026)
par: Wang, Jialu, et autres
Publié: (2026)
d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning
par: Zhao, Siyan, et autres
Publié: (2025)
par: Zhao, Siyan, et autres
Publié: (2025)
Few-Shot Recalibration of Language Models
par: Li, Xiang Lisa, et autres
Publié: (2024)
par: Li, Xiang Lisa, et autres
Publié: (2024)
ZeroUnlearn: Few-Shot Knowledge Unlearning in Large Language Models
par: Lin, Yujie, et autres
Publié: (2026)
par: Lin, Yujie, et autres
Publié: (2026)
LifeAlign: Lifelong Alignment for Large Language Models with Memory-Augmented Focalized Preference Optimization
par: Li, Junsong, et autres
Publié: (2025)
par: Li, Junsong, et autres
Publié: (2025)
LAMPO: Large Language Models as Preference Machines for Few-shot Ordinal Classification
par: Qin, Zhen, et autres
Publié: (2024)
par: Qin, Zhen, et autres
Publié: (2024)
Few-Shot Cross-Lingual Transfer for Prompting Large Language Models in Low-Resource Languages
par: Toukmaji, Christopher
Publié: (2024)
par: Toukmaji, Christopher
Publié: (2024)
FSPO: Few-Shot Optimization of Synthetic Preferences Personalizes to Real Users
par: Singh, Anikait, et autres
Publié: (2025)
par: Singh, Anikait, et autres
Publié: (2025)
Towards Robust Alignment of Language Models: Distributionally Robustifying Direct Preference Optimization
par: Wu, Junkang, et autres
Publié: (2024)
par: Wu, Junkang, et autres
Publié: (2024)
ROPO: Robust Preference Optimization for Large Language Models
par: Liang, Xize, et autres
Publié: (2024)
par: Liang, Xize, et autres
Publié: (2024)
Online Intrinsic Rewards for Decision Making Agents from Large Language Model Feedback
par: Zheng, Qinqing, et autres
Publié: (2024)
par: Zheng, Qinqing, et autres
Publié: (2024)
RLHF Can Speak Many Languages: Unlocking Multilingual Preference Optimization for LLMs
par: Dang, John, et autres
Publié: (2024)
par: Dang, John, et autres
Publié: (2024)
Binary Classifier Optimization for Large Language Model Alignment
par: Jung, Seungjae, et autres
Publié: (2024)
par: Jung, Seungjae, et autres
Publié: (2024)
Solving General Natural-Language-Description Optimization Problems with Large Language Models
par: Zhang, Jihai, et autres
Publié: (2024)
par: Zhang, Jihai, et autres
Publié: (2024)
Mitigating Hallucinated Translations in Large Language Models with Hallucination-focused Preference Optimization
par: Tang, Zilu, et autres
Publié: (2025)
par: Tang, Zilu, et autres
Publié: (2025)
Enabling Autoregressive Models to Fill In Masked Tokens
par: Israel, Daniel, et autres
Publié: (2025)
par: Israel, Daniel, et autres
Publié: (2025)
BARE: Leveraging Base Language Models for Few-Shot Synthetic Data Generation
par: Zhu, Alan, et autres
Publié: (2025)
par: Zhu, Alan, et autres
Publié: (2025)
Meta-Tool: Efficient Few-Shot Tool Adaptation for Small Language Models
par: Kumar, Sachin
Publié: (2026)
par: Kumar, Sachin
Publié: (2026)
Learning from Reference Answers: Versatile Language Model Alignment without Binary Human Preference Data
par: Zhao, Shuai, et autres
Publié: (2025)
par: Zhao, Shuai, et autres
Publié: (2025)
BAPO: Base-Anchored Preference Optimization for Overcoming Forgetting in Large Language Models Personalization
par: Lee, Gihun, et autres
Publié: (2024)
par: Lee, Gihun, et autres
Publié: (2024)
Spectral Editing of Activations for Large Language Model Alignment
par: Qiu, Yifu, et autres
Publié: (2024)
par: Qiu, Yifu, et autres
Publié: (2024)
Beyond Bradley-Terry Models: A General Preference Model for Language Model Alignment
par: Zhang, Yifan, et autres
Publié: (2024)
par: Zhang, Yifan, et autres
Publié: (2024)
Active Preference Learning for Large Language Models
par: Muldrew, William, et autres
Publié: (2024)
par: Muldrew, William, et autres
Publié: (2024)
Anchored Preference Optimization and Contrastive Revisions: Addressing Underspecification in Alignment
par: D'Oosterlinck, Karel, et autres
Publié: (2024)
par: D'Oosterlinck, Karel, et autres
Publié: (2024)
Large Language Models are Null-Shot Learners
par: Taveekitworachai, Pittawat, et autres
Publié: (2024)
par: Taveekitworachai, Pittawat, et autres
Publié: (2024)
Few-Shot Optimization for Sensor Data Using Large Language Models: A Case Study on Fatigue Detection
par: Ronando, Elsen, et autres
Publié: (2025)
par: Ronando, Elsen, et autres
Publié: (2025)
Document-Level In-Context Few-Shot Relation Extraction via Pre-Trained Language Models
par: Ozyurt, Yilmazcan, et autres
Publié: (2023)
par: Ozyurt, Yilmazcan, et autres
Publié: (2023)
Gradient-Adaptive Policy Optimization: Towards Multi-Objective Alignment of Large Language Models
par: Li, Chengao, et autres
Publié: (2025)
par: Li, Chengao, et autres
Publié: (2025)
One-Shot Safety Alignment for Large Language Models via Optimal Dualization
par: Huang, Xinmeng, et autres
Publié: (2024)
par: Huang, Xinmeng, et autres
Publié: (2024)
From Noisy Traces to Stable Gradients: Bias-Variance Optimized Preference Optimization for Aligning Large Reasoning Models
par: Zhu, Mingkang, et autres
Publié: (2025)
par: Zhu, Mingkang, et autres
Publié: (2025)
MAPLE: Micro Analysis of Pairwise Language Evolution for Few-Shot Claim Verification
par: Zeng, Xia, et autres
Publié: (2024)
par: Zeng, Xia, et autres
Publié: (2024)
RS-DPO: A Hybrid Rejection Sampling and Direct Preference Optimization Method for Alignment of Large Language Models
par: Khaki, Saeed, et autres
Publié: (2024)
par: Khaki, Saeed, et autres
Publié: (2024)
Stepwise Alignment for Constrained Language Model Policy Optimization
par: Wachi, Akifumi, et autres
Publié: (2024)
par: Wachi, Akifumi, et autres
Publié: (2024)
Documents similaires
-
Probing the Decision Boundaries of In-context Learning in Large Language Models
par: Zhao, Siyan, et autres
Publié: (2024) -
Peering Through Preferences: Unraveling Feedback Acquisition for Aligning Large Language Models
par: Bansal, Hritik, et autres
Publié: (2023) -
Prepacking: A Simple Method for Fast Prefilling and Increased Throughput in Large Language Models
par: Zhao, Siyan, et autres
Publié: (2024) -
Comparing Bad Apples to Good Oranges: Aligning Large Language Models via Joint Preference Optimization
par: Bansal, Hritik, et autres
Publié: (2024) -
Accelerated Preference Optimization for Large Language Model Alignment
par: He, Jiafan, et autres
Publié: (2024)