Adversarial Preference Optimization: Enhancing Your Alignment via RM-LLM Game
Fuente:
arXiv
Guardado en:
| Autores principales: | Cheng, Pengyu, Yang, Yifan, Li, Jian, Dai, Yong, Hu, Tianhao, Cao, Peixin, Du, Nan, Li, Xiaolong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Self-playing Adversarial Language Game Enhances LLM Reasoning
por: Cheng, Pengyu, et al.
Publicado: (2024)
por: Cheng, Pengyu, et al.
Publicado: (2024)
On Diversified Preferences of Large Language Model Alignment
por: Zeng, Dun, et al.
Publicado: (2023)
por: Zeng, Dun, et al.
Publicado: (2023)
Test-Time Preference Optimization: On-the-Fly Alignment via Iterative Textual Feedback
por: Li, Yafu, et al.
Publicado: (2025)
por: Li, Yafu, et al.
Publicado: (2025)
Self-supervised Preference Optimization: Enhance Your Language Model with Preference Degree Awareness
por: Li, Jian, et al.
Publicado: (2024)
por: Li, Jian, et al.
Publicado: (2024)
Chunk, Align, Select: A Simple Long-sequence Processing Method for Transformers
por: Xie, Jiawen, et al.
Publicado: (2023)
por: Xie, Jiawen, et al.
Publicado: (2023)
Teaching Your Models to Understand Code via Focal Preference Alignment
por: Wu, Jie, et al.
Publicado: (2025)
por: Wu, Jie, et al.
Publicado: (2025)
SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning
por: Chen, Jiaqi, et al.
Publicado: (2025)
por: Chen, Jiaqi, et al.
Publicado: (2025)
ImplicitRM: Unbiased Reward Modeling from Implicit Preference Data for LLM alignment
por: Wang, Hao, et al.
Publicado: (2026)
por: Wang, Hao, et al.
Publicado: (2026)
MetaRM: Shifted Distributions Alignment via Meta-Learning
por: Dou, Shihan, et al.
Publicado: (2024)
por: Dou, Shihan, et al.
Publicado: (2024)
SparseRM: A Lightweight Preference Modeling with Sparse Autoencoder
por: Liu, Dengcan, et al.
Publicado: (2025)
por: Liu, Dengcan, et al.
Publicado: (2025)
Your Weak LLM is Secretly a Strong Teacher for Alignment
por: Tao, Leitian, et al.
Publicado: (2024)
por: Tao, Leitian, et al.
Publicado: (2024)
PACIFIC: Can LLMs Discern the Traits Influencing Your Preferences? Evaluating Personality-Driven Preference Alignment in LLMs
por: Zhao, Tianyu, et al.
Publicado: (2026)
por: Zhao, Tianyu, et al.
Publicado: (2026)
Probability-Consistent Preference Optimization for Enhanced LLM Reasoning
por: Yang, Yunqiao, et al.
Publicado: (2025)
por: Yang, Yunqiao, et al.
Publicado: (2025)
Preference Ranking Optimization for Human Alignment
por: Song, Feifan, et al.
Publicado: (2023)
por: Song, Feifan, et al.
Publicado: (2023)
Look Before You Leap: Towards Decision-Aware and Generalizable Tool-Usage for Large Language Models
por: Gui, Anchun, et al.
Publicado: (2024)
por: Gui, Anchun, et al.
Publicado: (2024)
CodeTool: Enhancing Programmatic Tool Invocation of LLMs via Process Supervision
por: Lu, Yifei, et al.
Publicado: (2025)
por: Lu, Yifei, et al.
Publicado: (2025)
TODO: Enhancing LLM Alignment with Ternary Preferences
por: Guo, Yuxiang, et al.
Publicado: (2024)
por: Guo, Yuxiang, et al.
Publicado: (2024)
Enhancing LLM Safety via Constrained Direct Preference Optimization
por: Liu, Zixuan, et al.
Publicado: (2024)
por: Liu, Zixuan, et al.
Publicado: (2024)
Improving LLM General Preference Alignment via Optimistic Online Mirror Descent
por: Zhang, Yuheng, et al.
Publicado: (2025)
por: Zhang, Yuheng, et al.
Publicado: (2025)
StoicLLM: Preference Optimization for Philosophical Alignment in Small Language Models
por: Khan, Ishmam, et al.
Publicado: (2026)
por: Khan, Ishmam, et al.
Publicado: (2026)
The Lighthouse of Language: Enhancing LLM Agents via Critique-Guided Improvement
por: Yang, Ruihan, et al.
Publicado: (2025)
por: Yang, Ruihan, et al.
Publicado: (2025)
Panacea: Pareto Alignment via Preference Adaptation for LLMs
por: Zhong, Yifan, et al.
Publicado: (2024)
por: Zhong, Yifan, et al.
Publicado: (2024)
PA-RAG: RAG Alignment via Multi-Perspective Preference Optimization
por: Wu, Jiayi, et al.
Publicado: (2024)
por: Wu, Jiayi, et al.
Publicado: (2024)
Margin Matching Preference Optimization: Enhanced Model Alignment with Granular Feedback
por: Kim, Kyuyoung, et al.
Publicado: (2024)
por: Kim, Kyuyoung, et al.
Publicado: (2024)
Micro-Act: Mitigating Knowledge Conflict in LLM-based RAG via Actionable Self-Reasoning
por: Huo, Nan, et al.
Publicado: (2025)
por: Huo, Nan, et al.
Publicado: (2025)
From 1,000,000 Users to Every User: Scaling Up Personalized Preference for User-level Alignment
por: Li, Jia-Nan, et al.
Publicado: (2025)
por: Li, Jia-Nan, et al.
Publicado: (2025)
Enhancing Multilingual Counterfactual Generation through Alignment-as-Preference Optimization
por: Wang, Yilong, et al.
Publicado: (2026)
por: Wang, Yilong, et al.
Publicado: (2026)
GameArena: Evaluating LLM Reasoning through Live Computer Games
por: Hu, Lanxiang, et al.
Publicado: (2024)
por: Hu, Lanxiang, et al.
Publicado: (2024)
Adversarial Preference Learning for Robust LLM Alignment
por: Wang, Yuanfu, et al.
Publicado: (2025)
por: Wang, Yuanfu, et al.
Publicado: (2025)
Beyond the Surface: Enhancing LLM-as-a-Judge Alignment with Human via Internal Representations
por: Lai, Peng, et al.
Publicado: (2025)
por: Lai, Peng, et al.
Publicado: (2025)
Stable Preference Optimization: A Bilevel Approach to Catastrophic Preference Shift
por: Jian, Chengtao, et al.
Publicado: (2025)
por: Jian, Chengtao, et al.
Publicado: (2025)
CATNIP: LLM Unlearning via Calibrated and Tokenized Negative Preference Alignment
por: Yang, Zhengbang, et al.
Publicado: (2026)
por: Yang, Zhengbang, et al.
Publicado: (2026)
EAMET: Robust Massive Model Editing via Embedding Alignment Optimization
por: Dai, Yanbo, et al.
Publicado: (2025)
por: Dai, Yanbo, et al.
Publicado: (2025)
Is On-Policy Data always the Best Choice for Direct Preference Optimization-based LM Alignment?
por: Sun, Zetian, et al.
Publicado: (2025)
por: Sun, Zetian, et al.
Publicado: (2025)
Reasoning over Boundaries: Enhancing Specification Alignment via Test-time Deliberation
por: Zhang, Haoran, et al.
Publicado: (2025)
por: Zhang, Haoran, et al.
Publicado: (2025)
Provable Defense Framework for LLM Jailbreaks via Noise-Augumented Alignment
por: Cheng, Zehua, et al.
Publicado: (2026)
por: Cheng, Zehua, et al.
Publicado: (2026)
DecoupledESC: Enhancing Emotional Support Generation via Strategy-Response Decoupled Preference Optimization
por: Zhang, Chao, et al.
Publicado: (2025)
por: Zhang, Chao, et al.
Publicado: (2025)
Traits Run Deep: Enhancing Personality Assessment via Psychology-Guided LLM Representations and Multimodal Apparent Behaviors
por: Li, Jia, et al.
Publicado: (2025)
por: Li, Jia, et al.
Publicado: (2025)
CE-RM: A Pointwise Generative Reward Model Optimized via Two-Stage Rollout and Unified Criteria
por: Hu, Xinyu, et al.
Publicado: (2026)
por: Hu, Xinyu, et al.
Publicado: (2026)
RM-Distiller: Exploiting Generative LLM for Reward Model Distillation
por: Zhou, Hongli, et al.
Publicado: (2026)
por: Zhou, Hongli, et al.
Publicado: (2026)
Ejemplares similares
-
Self-playing Adversarial Language Game Enhances LLM Reasoning
por: Cheng, Pengyu, et al.
Publicado: (2024) -
On Diversified Preferences of Large Language Model Alignment
por: Zeng, Dun, et al.
Publicado: (2023) -
Test-Time Preference Optimization: On-the-Fly Alignment via Iterative Textual Feedback
por: Li, Yafu, et al.
Publicado: (2025) -
Self-supervised Preference Optimization: Enhance Your Language Model with Preference Degree Awareness
por: Li, Jian, et al.
Publicado: (2024) -
Chunk, Align, Select: A Simple Long-sequence Processing Method for Transformers
por: Xie, Jiawen, et al.
Publicado: (2023)