A Survey on Personalized and Pluralistic Preference Alignment in Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Xie, Zhouhang, Wu, Junda, Shen, Yiran, Xia, Yu, Li, Xintong, Chang, Aaron, Rossi, Ryan, Kumar, Sachin, Majumder, Bodhisattwa Prasad, Shang, Jingbo, Ammanabrolu, Prithviraj, McAuley, Julian |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
In-context Ranking Preference Optimization
von: Wu, Junda, et al.
Veröffentlicht: (2025)
von: Wu, Junda, et al.
Veröffentlicht: (2025)
Active Learning for Direct Preference Optimization
von: Kveton, Branislav, et al.
Veröffentlicht: (2025)
von: Kveton, Branislav, et al.
Veröffentlicht: (2025)
Pluralistic Off-policy Evaluation and Alignment
von: Huang, Chengkai, et al.
Veröffentlicht: (2025)
von: Huang, Chengkai, et al.
Veröffentlicht: (2025)
MASS-DPO: Multi-negative Active Sample Selection for Direct Policy Optimization
von: Surana, Rohan, et al.
Veröffentlicht: (2026)
von: Surana, Rohan, et al.
Veröffentlicht: (2026)
Simultaneous Multi-objective Alignment Across Verifiable and Non-verifiable Rewards
von: Shen, Yiran, et al.
Veröffentlicht: (2025)
von: Shen, Yiran, et al.
Veröffentlicht: (2025)
Importance Sampling for Multi-Negative Multimodal Direct Preference Optimization
von: Li, Xintong, et al.
Veröffentlicht: (2025)
von: Li, Xintong, et al.
Veröffentlicht: (2025)
Few-shot Dialogue Strategy Learning for Motivational Interviewing via Inductive Reasoning
von: Xie, Zhouhang, et al.
Veröffentlicht: (2024)
von: Xie, Zhouhang, et al.
Veröffentlicht: (2024)
Preference-Based Learning in Audio Applications: A Systematic Analysis
von: Broukhim, Aaron, et al.
Veröffentlicht: (2025)
von: Broukhim, Aaron, et al.
Veröffentlicht: (2025)
Latent Factor Models Meets Instructions: Goal-conditioned Latent Factor Discovery without Task Supervision
von: Xie, Zhouhang, et al.
Veröffentlicht: (2025)
von: Xie, Zhouhang, et al.
Veröffentlicht: (2025)
AMPS: Adaptive Modality Preference Steering via Functional Entropy
von: Huang, Zihan, et al.
Veröffentlicht: (2026)
von: Huang, Zihan, et al.
Veröffentlicht: (2026)
Evaluation on Entity Matching in Recommender Systems
von: Huang, Zihan, et al.
Veröffentlicht: (2026)
von: Huang, Zihan, et al.
Veröffentlicht: (2026)
Visual Prompting in Multimodal Large Language Models: A Survey
von: Wu, Junda, et al.
Veröffentlicht: (2024)
von: Wu, Junda, et al.
Veröffentlicht: (2024)
InstructGraph: Boosting Large Language Models via Graph-centric Instruction Tuning and Preference Alignment
von: Wang, Jianing, et al.
Veröffentlicht: (2024)
von: Wang, Jianing, et al.
Veröffentlicht: (2024)
OCEAN: Offline Chain-of-thought Evaluation and Alignment in Large Language Models
von: Wu, Junda, et al.
Veröffentlicht: (2024)
von: Wu, Junda, et al.
Veröffentlicht: (2024)
SceneAlign: Aligning Multimodal Reasoning to Scene Graphs in Complex Visual Scenes
von: Wang, Chuhan, et al.
Veröffentlicht: (2026)
von: Wang, Chuhan, et al.
Veröffentlicht: (2026)
SAND: Boosting LLM Agents with Self-Taught Action Deliberation
von: Xia, Yu, et al.
Veröffentlicht: (2025)
von: Xia, Yu, et al.
Veröffentlicht: (2025)
Beyond Needle(s) in the Embodied Haystack: Environment, Architecture, and Training Considerations for Long Context Reasoning
von: Kim, Bosung, et al.
Veröffentlicht: (2025)
von: Kim, Bosung, et al.
Veröffentlicht: (2025)
A Practitioner's Guide to Multi-turn Agentic Reinforcement Learning
von: Wang, Ruiyi, et al.
Veröffentlicht: (2025)
von: Wang, Ruiyi, et al.
Veröffentlicht: (2025)
Mitigating Visual Knowledge Forgetting in MLLM Instruction-tuning via Modality-decoupled Gradient Descent
von: Wu, Junda, et al.
Veröffentlicht: (2025)
von: Wu, Junda, et al.
Veröffentlicht: (2025)
CoMMIT: Coordinated Multimodal Instruction Tuning
von: Li, Xintong, et al.
Veröffentlicht: (2024)
von: Li, Xintong, et al.
Veröffentlicht: (2024)
Explainable Chain-of-Thought Reasoning: An Empirical Analysis on State-Aware Reasoning Dynamics
von: Yu, Sheldon, et al.
Veröffentlicht: (2025)
von: Yu, Sheldon, et al.
Veröffentlicht: (2025)
From Reviews to Dialogues: Active Synthesis for Zero-Shot LLM-based Conversational Recommender System
von: Surana, Rohan, et al.
Veröffentlicht: (2025)
von: Surana, Rohan, et al.
Veröffentlicht: (2025)
Accepted with Minor Revisions: Value of AI-Assisted Scientific Writing
von: Hazra, Sanchaita, et al.
Veröffentlicht: (2025)
von: Hazra, Sanchaita, et al.
Veröffentlicht: (2025)
To Tell The Truth: Language of Deception and Language Models
von: Hazra, Sanchaita, et al.
Veröffentlicht: (2023)
von: Hazra, Sanchaita, et al.
Veröffentlicht: (2023)
Skill-R1: Agent Skill Evolution via Reinforcement Learning
von: Vishe, Yash, et al.
Veröffentlicht: (2026)
von: Vishe, Yash, et al.
Veröffentlicht: (2026)
OLIVIA: Online Learning via Inference-time Action Adaptation for Decision Making in LLM ReAct Agents
von: Yu, Sheldon, et al.
Veröffentlicht: (2026)
von: Yu, Sheldon, et al.
Veröffentlicht: (2026)
Listwise Preference Diffusion Optimization for User Behavior Trajectories Prediction
von: Huang, Hongtao, et al.
Veröffentlicht: (2025)
von: Huang, Hongtao, et al.
Veröffentlicht: (2025)
DICE: Dynamic In-Context Example Selection in LLM Agents via Efficient Knowledge Transfer
von: Wang, Ruoyu, et al.
Veröffentlicht: (2025)
von: Wang, Ruoyu, et al.
Veröffentlicht: (2025)
Knowledge-Aware Query Expansion with Large Language Models for Textual and Relational Retrieval
von: Xia, Yu, et al.
Veröffentlicht: (2024)
von: Xia, Yu, et al.
Veröffentlicht: (2024)
CTRLS: Chain-of-Thought Reasoning via Latent State-Transition
von: Wu, Junda, et al.
Veröffentlicht: (2025)
von: Wu, Junda, et al.
Veröffentlicht: (2025)
PDB-Eval: An Evaluation of Large Multimodal Models for Description and Explanation of Personalized Driving Behavior
von: Wu, Junda, et al.
Veröffentlicht: (2025)
von: Wu, Junda, et al.
Veröffentlicht: (2025)
How Reasoning Evolves from Post-Training Data: An Empirical Study Using Chess
von: Dionisopoulos, Lucas, et al.
Veröffentlicht: (2026)
von: Dionisopoulos, Lucas, et al.
Veröffentlicht: (2026)
Personalization Aids Pluralistic Alignment Under Competition
von: Collina, Natalie, et al.
Veröffentlicht: (2026)
von: Collina, Natalie, et al.
Veröffentlicht: (2026)
Multi-Agent Collaborative Filtering: Orchestrating Users and Items for Agentic Recommendations
von: Xia, Yu, et al.
Veröffentlicht: (2025)
von: Xia, Yu, et al.
Veröffentlicht: (2025)
Futga: Towards Fine-grained Music Understanding through Temporally-enhanced Generative Augmentation
von: Wu, Junda, et al.
Veröffentlicht: (2024)
von: Wu, Junda, et al.
Veröffentlicht: (2024)
Tell, Don't Show!: Language Guidance Eases Transfer Across Domains in Images and Videos
von: Kalluri, Tarun, et al.
Veröffentlicht: (2024)
von: Kalluri, Tarun, et al.
Veröffentlicht: (2024)
AI Safety Should Prioritize the Future of Work
von: Hazra, Sanchaita, et al.
Veröffentlicht: (2025)
von: Hazra, Sanchaita, et al.
Veröffentlicht: (2025)
WS-GRPO: Weakly-Supervised Group-Relative Policy Optimization for Rollout-Efficient Reasoning
von: Mundada, Gagan, et al.
Veröffentlicht: (2026)
von: Mundada, Gagan, et al.
Veröffentlicht: (2026)
CachePrune: Teaching LLMs What Not to Follow via KV-Cache Editing
von: Wang, Rui, et al.
Veröffentlicht: (2025)
von: Wang, Rui, et al.
Veröffentlicht: (2025)
Mitigating Hallucination in Fictional Character Role-Play
von: Sadeq, Nafis, et al.
Veröffentlicht: (2024)
von: Sadeq, Nafis, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
In-context Ranking Preference Optimization
von: Wu, Junda, et al.
Veröffentlicht: (2025) -
Active Learning for Direct Preference Optimization
von: Kveton, Branislav, et al.
Veröffentlicht: (2025) -
Pluralistic Off-policy Evaluation and Alignment
von: Huang, Chengkai, et al.
Veröffentlicht: (2025) -
MASS-DPO: Multi-negative Active Sample Selection for Direct Policy Optimization
von: Surana, Rohan, et al.
Veröffentlicht: (2026) -
Simultaneous Multi-objective Alignment Across Verifiable and Non-verifiable Rewards
von: Shen, Yiran, et al.
Veröffentlicht: (2025)