Margin Matching Preference Optimization: Enhanced Model Alignment with Granular Feedback
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kim, Kyuyoung, Seo, Ah Jeong, Liu, Hao, Shin, Jinwoo, Lee, Kimin |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Spread Preference Annotation: Direct Preference Judgment for Efficient LLM Alignment
par: Kim, Dongyoung, et autres
Publié: (2024)
par: Kim, Dongyoung, et autres
Publié: (2024)
Learning to Contextualize Web Pages for Enhanced Decision Making by LLM Agents
par: Lee, Dongjun, et autres
Publié: (2025)
par: Lee, Dongjun, et autres
Publié: (2025)
Personalized Language Models via Privacy-Preserving Evolutionary Model Merging
par: Kim, Kyuyoung, et autres
Publié: (2025)
par: Kim, Kyuyoung, et autres
Publié: (2025)
Self-Refining Language Model Anonymizers via Adversarial Distillation
par: Kim, Kyuyoung, et autres
Publié: (2025)
par: Kim, Kyuyoung, et autres
Publié: (2025)
RedacBench: Can AI Erase Your Secrets?
par: Jeon, Hyunjun, et autres
Publié: (2026)
par: Jeon, Hyunjun, et autres
Publié: (2026)
Confidence-aware Reward Optimization for Fine-tuning Text-to-Image Models
par: Kim, Kyuyoung, et autres
Publié: (2024)
par: Kim, Kyuyoung, et autres
Publié: (2024)
Alignment Tampering: How Reinforcement Learning from Human Feedback Is Exploited to Optimize Misaligned Biases
par: Hahm, Dongyoon, et autres
Publié: (2026)
par: Hahm, Dongyoon, et autres
Publié: (2026)
AMaPO: Adaptive Margin-attached Preference Optimization for Language Model Alignment
par: Deng, Ruibo, et autres
Publié: (2025)
par: Deng, Ruibo, et autres
Publié: (2025)
Recursive Chain-of-Feedback Prevents Performance Degradation from Redundant Prompting
par: Ahn, Jinwoo, et autres
Publié: (2024)
par: Ahn, Jinwoo, et autres
Publié: (2024)
DiaTool-DPO: Multi-Turn Direct Preference Optimization for Tool-Augmented Large Language Models
par: Jung, Sunghee, et autres
Publié: (2025)
par: Jung, Sunghee, et autres
Publié: (2025)
Test-Time Preference Optimization: On-the-Fly Alignment via Iterative Textual Feedback
par: Li, Yafu, et autres
Publié: (2025)
par: Li, Yafu, et autres
Publié: (2025)
Correct Answers from Sound Reasoning: Verifiable Process Supervision for Language Models
par: Kim, Kyuyoung, et autres
Publié: (2026)
par: Kim, Kyuyoung, et autres
Publié: (2026)
Length-Controlled Margin-Based Preference Optimization without Reference Model
par: Li, Gengxu, et autres
Publié: (2025)
par: Li, Gengxu, et autres
Publié: (2025)
ReMoDetect: Reward Models Recognize Aligned LLM's Generations
par: Lee, Hyunseok, et autres
Publié: (2024)
par: Lee, Hyunseok, et autres
Publié: (2024)
SCIRGC: Multi-Granularity Citation Recommendation and Citation Sentence Preference Alignment
par: Li, Xiangyu, et autres
Publié: (2025)
par: Li, Xiangyu, et autres
Publié: (2025)
Enhancing Multilingual Counterfactual Generation through Alignment-as-Preference Optimization
par: Wang, Yilong, et autres
Publié: (2026)
par: Wang, Yilong, et autres
Publié: (2026)
Robust Preference Optimization via Dynamic Target Margins
par: Sun, Jie, et autres
Publié: (2025)
par: Sun, Jie, et autres
Publié: (2025)
Model-based Preference Optimization in Abstractive Summarization without Human Feedback
par: Choi, Jaepill, et autres
Publié: (2024)
par: Choi, Jaepill, et autres
Publié: (2024)
Preference Optimization for Reasoning with Pseudo Feedback
par: Jiao, Fangkai, et autres
Publié: (2024)
par: Jiao, Fangkai, et autres
Publié: (2024)
Alignment Data Map for Efficient Preference Data Selection and Diagnosis
par: Lee, Seohyeong, et autres
Publié: (2025)
par: Lee, Seohyeong, et autres
Publié: (2025)
Larger or Smaller Reward Margins to Select Preferences for Alignment?
par: Huang, Kexin, et autres
Publié: (2025)
par: Huang, Kexin, et autres
Publié: (2025)
What Really Matters in Many-Shot Attacks? An Empirical Study of Long-Context Vulnerabilities in LLMs
par: Kim, Sangyeop, et autres
Publié: (2025)
par: Kim, Sangyeop, et autres
Publié: (2025)
BESPOKE: Benchmark for Search-Augmented Large Language Model Personalization via Diagnostic Feedback
par: Kim, Hyunseo, et autres
Publié: (2025)
par: Kim, Hyunseo, et autres
Publié: (2025)
Topology-Enhanced Alignment for Large Language Models: Trajectory Topology Loss and Topological Preference Optimization
par: Pan, Yurui, et autres
Publié: (2026)
par: Pan, Yurui, et autres
Publié: (2026)
Improbable Bigrams Expose Vulnerabilities of Incomplete Tokens in Byte-Level Tokenizers
par: Jang, Eugene, et autres
Publié: (2024)
par: Jang, Eugene, et autres
Publié: (2024)
ReTAG: Retrieval-Enhanced, Topic-Augmented Graph-Based Global Sensemaking
par: Kim, Boyoung, et autres
Publié: (2025)
par: Kim, Boyoung, et autres
Publié: (2025)
Drift: Decoding-time Personalized Alignments with Implicit User Preferences
par: Kim, Minbeom, et autres
Publié: (2025)
par: Kim, Minbeom, et autres
Publié: (2025)
Aligning to Thousands of Preferences via System Message Generalization
par: Lee, Seongyun, et autres
Publié: (2024)
par: Lee, Seongyun, et autres
Publié: (2024)
Training Text-to-Molecule Models with Context-Aware Tokenization
par: Kim, Seojin, et autres
Publié: (2025)
par: Kim, Seojin, et autres
Publié: (2025)
Speech-Worthy Alignment for Japanese SpeechLLMs via Direct Preference Optimization
par: Zhao, Mengjie, et autres
Publié: (2026)
par: Zhao, Mengjie, et autres
Publié: (2026)
StoicLLM: Preference Optimization for Philosophical Alignment in Small Language Models
par: Khan, Ishmam, et autres
Publié: (2026)
par: Khan, Ishmam, et autres
Publié: (2026)
Improving Conversational Abilities of Quantized Large Language Models via Direct Preference Alignment
par: Lee, Janghwan, et autres
Publié: (2024)
par: Lee, Janghwan, et autres
Publié: (2024)
BAPO: Base-Anchored Preference Optimization for Overcoming Forgetting in Large Language Models Personalization
par: Lee, Gihun, et autres
Publié: (2024)
par: Lee, Gihun, et autres
Publié: (2024)
Offline Preference Optimization via Maximum Marginal Likelihood Estimation
par: Najafi, Saeed, et autres
Publié: (2025)
par: Najafi, Saeed, et autres
Publié: (2025)
SeDi-Instruct: Enhancing Alignment of Language Models through Self-Directed Instruction Generation
par: Kim, Jungwoo, et autres
Publié: (2025)
par: Kim, Jungwoo, et autres
Publié: (2025)
Preference Ranking Optimization for Human Alignment
par: Song, Feifan, et autres
Publié: (2023)
par: Song, Feifan, et autres
Publié: (2023)
Mamba Drafters for Speculative Decoding
par: Choi, Daewon, et autres
Publié: (2025)
par: Choi, Daewon, et autres
Publié: (2025)
Self-supervised Preference Optimization: Enhance Your Language Model with Preference Degree Awareness
par: Li, Jian, et autres
Publié: (2024)
par: Li, Jian, et autres
Publié: (2024)
BPO: Revisiting Preference Modeling in Direct Preference Optimization
par: Sun, Lin, et autres
Publié: (2025)
par: Sun, Lin, et autres
Publié: (2025)
Rethinking the Role of Proxy Rewards in Language Model Alignment
par: Kim, Sungdong, et autres
Publié: (2024)
par: Kim, Sungdong, et autres
Publié: (2024)
Documents similaires
-
Spread Preference Annotation: Direct Preference Judgment for Efficient LLM Alignment
par: Kim, Dongyoung, et autres
Publié: (2024) -
Learning to Contextualize Web Pages for Enhanced Decision Making by LLM Agents
par: Lee, Dongjun, et autres
Publié: (2025) -
Personalized Language Models via Privacy-Preserving Evolutionary Model Merging
par: Kim, Kyuyoung, et autres
Publié: (2025) -
Self-Refining Language Model Anonymizers via Adversarial Distillation
par: Kim, Kyuyoung, et autres
Publié: (2025) -
RedacBench: Can AI Erase Your Secrets?
par: Jeon, Hyunjun, et autres
Publié: (2026)