Adversarial Preference Learning for Robust LLM Alignment
Fuente:
arXiv
Saved in:
| Main Authors: | Wang, Yuanfu, Wang, Pengyu, Xi, Chenyang, Tang, Bo, Zhu, Junyi, Wei, Wenqiang, Chen, Chen, Yang, Chao, Zhang, Jingfeng, Lu, Chaochao, Niu, Yijun, Mao, Keming, Li, Zhiyu, Xiong, Feiyu, Hu, Jie, Yang, Mingchuan |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Proxy-RLHF: Decoupling Generation and Alignment in Large Language Model with Proxy
by: Zhu, Yu, et al.
Published: (2024)
by: Zhu, Yu, et al.
Published: (2024)
Native Reasoning Models: Training Language Models to Reason on Unverifiable Data
by: Wang, Yuanfu, et al.
Published: (2026)
by: Wang, Yuanfu, et al.
Published: (2026)
NewsBench: A Systematic Evaluation Framework for Assessing Editorial Capabilities of Large Language Models in Chinese Journalism
by: Li, Miao, et al.
Published: (2024)
by: Li, Miao, et al.
Published: (2024)
Attention Heads of Large Language Models: A Survey
by: Zheng, Zifan, et al.
Published: (2024)
by: Zheng, Zifan, et al.
Published: (2024)
Xinyu AI Search: Enhanced Relevance and Comprehensive Results with Rich Answer Presentations
by: Tang, Bo, et al.
Published: (2025)
by: Tang, Bo, et al.
Published: (2025)
Beyond Binary Edits Robust Multimodal Knowledge Editing with Adversarial Subspace Alignment
by: Wang, Haoyuan, et al.
Published: (2026)
by: Wang, Haoyuan, et al.
Published: (2026)
Enhancing Diffusion-based Unrestricted Adversarial Attacks via Adversary Preferences Alignment
by: Jiang, Kaixun, et al.
Published: (2025)
by: Jiang, Kaixun, et al.
Published: (2025)
Empowering Large Language Models to Set up a Knowledge Retrieval Indexer via Self-Learning
by: Liang, Xun, et al.
Published: (2024)
by: Liang, Xun, et al.
Published: (2024)
Xinyu: An Efficient LLM-based System for Commentary Generation
by: Wu, Yiquan, et al.
Published: (2024)
by: Wu, Yiquan, et al.
Published: (2024)
SurveyX: Academic Survey Automation via Large Language Models
by: Liang, Xun, et al.
Published: (2025)
by: Liang, Xun, et al.
Published: (2025)
Inference-Time Language Model Alignment via Integrated Value Guidance
by: Liu, Zhixuan, et al.
Published: (2024)
by: Liu, Zhixuan, et al.
Published: (2024)
Boosting Adversarial Transferability with Spatial Adversarial Alignment
by: Chen, Zhaoyu, et al.
Published: (2025)
by: Chen, Zhaoyu, et al.
Published: (2025)
Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models
by: Zhang, Yang, et al.
Published: (2025)
by: Zhang, Yang, et al.
Published: (2025)
Adversarial Preference Optimization: Enhancing Your Alignment via RM-LLM Game
by: Cheng, Pengyu, et al.
Published: (2023)
by: Cheng, Pengyu, et al.
Published: (2023)
PERMA: Benchmarking Personalized Memory Agents via Event-Driven Preference and Realistic Task Environments
by: Liu, Shuochen, et al.
Published: (2026)
by: Liu, Shuochen, et al.
Published: (2026)
Jigsaw-R1: A Study of Rule-based Visual Reinforcement Learning with Jigsaw Puzzles
by: Wang, Zifu, et al.
Published: (2025)
by: Wang, Zifu, et al.
Published: (2025)
SARA: Structural and Adversarial Representation Alignment for Training-efficient Diffusion Models
by: Chen, Hesen, et al.
Published: (2025)
by: Chen, Hesen, et al.
Published: (2025)
GuessArena: Guess Who I Am? A Self-Adaptive Framework for Evaluating LLMs in Domain-Specific Knowledge and Reasoning
by: Yu, Qingchen, et al.
Published: (2025)
by: Yu, Qingchen, et al.
Published: (2025)
$\text{Memory}^3$: Language Modeling with Explicit Memory
by: Yang, Hongkang, et al.
Published: (2024)
by: Yang, Hongkang, et al.
Published: (2024)
Thinking Preference Optimization
by: Yang, Wang, et al.
Published: (2025)
by: Yang, Wang, et al.
Published: (2025)
On Diversified Preferences of Large Language Model Alignment
by: Zeng, Dun, et al.
Published: (2023)
by: Zeng, Dun, et al.
Published: (2023)
HopRAG: Multi-Hop Reasoning for Logic-Aware Retrieval-Augmented Generation
by: Liu, Hao, et al.
Published: (2025)
by: Liu, Hao, et al.
Published: (2025)
MoM: Mixtures of Scenario-Aware Document Memories for Retrieval-Augmented Generation Systems
by: Zhao, Jihao, et al.
Published: (2025)
by: Zhao, Jihao, et al.
Published: (2025)
HRDE: Retrieval-Augmented Large Language Models for Chinese Health Rumor Detection and Explainability
by: Chen, Yanfang, et al.
Published: (2024)
by: Chen, Yanfang, et al.
Published: (2024)
Text2Mem: A Unified Memory Operation Language for Memory Operating System
by: Wang, Yi, et al.
Published: (2025)
by: Wang, Yi, et al.
Published: (2025)
Bridging the Gap Between Preference Alignment and Machine Unlearning
by: Feng, Xiaohua, et al.
Published: (2025)
by: Feng, Xiaohua, et al.
Published: (2025)
SkillsVote: Lifecycle Governance of Agent Skills from Collection, Recommendation to Evolution
by: Liu, Hongyi, et al.
Published: (2026)
by: Liu, Hongyi, et al.
Published: (2026)
Listwise Preference Alignment Optimization for Tail Item Recommendation
by: Li, Zihao, et al.
Published: (2025)
by: Li, Zihao, et al.
Published: (2025)
Grimoire is All You Need for Enhancing Large Language Models
by: Chen, Ding, et al.
Published: (2024)
by: Chen, Ding, et al.
Published: (2024)
MemReader: From Passive to Active Extraction for Long-Term Agent Memory
by: Kang, Jingyi, et al.
Published: (2026)
by: Kang, Jingyi, et al.
Published: (2026)
MoC: Mixtures of Text Chunking Learners for Retrieval-Augmented Generation System
by: Zhao, Jihao, et al.
Published: (2025)
by: Zhao, Jihao, et al.
Published: (2025)
A Reverse Suture Anchor Technique for Arthroscopic Posterior Cruciate Ligament Avulsion Fractures Repair
by: Chenyang Meng, et al.
Published: (2025)
by: Chenyang Meng, et al.
Published: (2025)
Text2Struct: A Machine Learning Pipeline for Mining Structured Data from Text
by: Zhou, Chaochao, et al.
Published: (2022)
by: Zhou, Chaochao, et al.
Published: (2022)
Exploring the Adversarial Robustness of Face Forgery Detection with Decision-based Black-box Attacks
by: Chen, Zhaoyu, et al.
Published: (2023)
by: Chen, Zhaoyu, et al.
Published: (2023)
MemFactory: Unified Inference & Training Framework for Agent Memory
by: Guo, Ziliang, et al.
Published: (2026)
by: Guo, Ziliang, et al.
Published: (2026)
Robust Preference Alignment via Directional Neighborhood Consensus
by: Mao, Ruochen, et al.
Published: (2025)
by: Mao, Ruochen, et al.
Published: (2025)
Decoding the Ear: A Framework for Objectifying Expressiveness from Human Preference Through Efficient Alignment
by: Lin, Zhiyu, et al.
Published: (2025)
by: Lin, Zhiyu, et al.
Published: (2025)
ComPO: Preference Alignment via Comparison Oracles
by: Chen, Peter, et al.
Published: (2025)
by: Chen, Peter, et al.
Published: (2025)
xVerify: Efficient Answer Verifier for Reasoning Model Evaluations
by: Chen, Ding, et al.
Published: (2025)
by: Chen, Ding, et al.
Published: (2025)
RSC-SNN: Exploring the Trade-off Between Adversarial Robustness and Accuracy in Spiking Neural Networks via Randomized Smoothing Coding
by: Wu, Keming, et al.
Published: (2024)
by: Wu, Keming, et al.
Published: (2024)
Similar Items
-
Proxy-RLHF: Decoupling Generation and Alignment in Large Language Model with Proxy
by: Zhu, Yu, et al.
Published: (2024) -
Native Reasoning Models: Training Language Models to Reason on Unverifiable Data
by: Wang, Yuanfu, et al.
Published: (2026) -
NewsBench: A Systematic Evaluation Framework for Assessing Editorial Capabilities of Large Language Models in Chinese Journalism
by: Li, Miao, et al.
Published: (2024) -
Attention Heads of Large Language Models: A Survey
by: Zheng, Zifan, et al.
Published: (2024) -
Xinyu AI Search: Enhanced Relevance and Comprehensive Results with Rich Answer Presentations
by: Tang, Bo, et al.
Published: (2025)