M3PO: Multimodal-Model-Guided Preference Optimization for Visual Instruction Following
Fuente:
arXiv
Salvato in:
| Autori principali: | Gao, Ruirui, Johnson, Emily, Tan, Bowen, Qian, Yanfei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Reverse Preference Optimization for Complex Instruction Following
di: Huang, Xiang, et al.
Pubblicazione: (2025)
di: Huang, Xiang, et al.
Pubblicazione: (2025)
PrefPO: Pairwise Preference Prompt Optimization
di: Singhal, Rahul, et al.
Pubblicazione: (2026)
di: Singhal, Rahul, et al.
Pubblicazione: (2026)
ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization
di: Yoon, Hee Suk, et al.
Pubblicazione: (2025)
di: Yoon, Hee Suk, et al.
Pubblicazione: (2025)
AMaPO: Adaptive Margin-attached Preference Optimization for Language Model Alignment
di: Deng, Ruibo, et al.
Pubblicazione: (2025)
di: Deng, Ruibo, et al.
Pubblicazione: (2025)
MMedPO: Aligning Medical Vision-Language Models with Clinical-Aware Multimodal Preference Optimization
di: Zhu, Kangyu, et al.
Pubblicazione: (2024)
di: Zhu, Kangyu, et al.
Pubblicazione: (2024)
FocalPO: Enhancing Preference Optimizing by Focusing on Correct Preference Rankings
di: Liu, Tong, et al.
Pubblicazione: (2025)
di: Liu, Tong, et al.
Pubblicazione: (2025)
SeaPO: Strategic Error Amplification for Robust Preference Optimization of Large Language Models
di: Rao, Jun, et al.
Pubblicazione: (2025)
di: Rao, Jun, et al.
Pubblicazione: (2025)
CiPO: Counterfactual Unlearning for Large Reasoning Models through Iterative Preference Optimization
di: Li, Junyi, et al.
Pubblicazione: (2026)
di: Li, Junyi, et al.
Pubblicazione: (2026)
IOPO: Empowering LLMs with Complex Instruction Following via Input-Output Preference Optimization
di: Zhang, Xinghua, et al.
Pubblicazione: (2024)
di: Zhang, Xinghua, et al.
Pubblicazione: (2024)
ComPO: Community Preferences for Language Model Personalization
di: Kumar, Sachin, et al.
Pubblicazione: (2024)
di: Kumar, Sachin, et al.
Pubblicazione: (2024)
MIA-Bench: Towards Better Instruction Following Evaluation of Multimodal LLMs
di: Qian, Yusu, et al.
Pubblicazione: (2024)
di: Qian, Yusu, et al.
Pubblicazione: (2024)
IHEval: Evaluating Language Models on Following the Instruction Hierarchy
di: Zhang, Zhihan, et al.
Pubblicazione: (2025)
di: Zhang, Zhihan, et al.
Pubblicazione: (2025)
A Systematic Examination of Preference Learning through the Lens of Instruction-Following
di: Kim, Joongwon, et al.
Pubblicazione: (2024)
di: Kim, Joongwon, et al.
Pubblicazione: (2024)
$f$-PO: Generalizing Preference Optimization with $f$-divergence Minimization
di: Han, Jiaqi, et al.
Pubblicazione: (2024)
di: Han, Jiaqi, et al.
Pubblicazione: (2024)
LiPO: Listwise Preference Optimization through Learning-to-Rank
di: Liu, Tianqi, et al.
Pubblicazione: (2024)
di: Liu, Tianqi, et al.
Pubblicazione: (2024)
Reasoning Strategies in Large Language Models: Can They Follow, Prefer, and Optimize?
di: Zhang, Yanjian, et al.
Pubblicazione: (2025)
di: Zhang, Yanjian, et al.
Pubblicazione: (2025)
DiffPO: Diffusion-styled Preference Optimization for Efficient Inference-Time Alignment of Large Language Models
di: Chen, Ruizhe, et al.
Pubblicazione: (2025)
di: Chen, Ruizhe, et al.
Pubblicazione: (2025)
Improving the Accuracy and Efficiency of Legal Document Tagging with Large Language Models and Instruction Prompts
di: Johnson, Emily, et al.
Pubblicazione: (2025)
di: Johnson, Emily, et al.
Pubblicazione: (2025)
DecIF: Improving Instruction-Following through Meta-Decomposition
di: Hui, Tingfeng, et al.
Pubblicazione: (2025)
di: Hui, Tingfeng, et al.
Pubblicazione: (2025)
Text as Images: Can Multimodal Large Language Models Follow Printed Instructions in Pixels?
di: Li, Xiujun, et al.
Pubblicazione: (2023)
di: Li, Xiujun, et al.
Pubblicazione: (2023)
SimPO: Simple Preference Optimization with a Reference-Free Reward
di: Meng, Yu, et al.
Pubblicazione: (2024)
di: Meng, Yu, et al.
Pubblicazione: (2024)
HREF: Human Response-Guided Evaluation of Instruction Following in Language Models
di: Lyu, Xinxi, et al.
Pubblicazione: (2024)
di: Lyu, Xinxi, et al.
Pubblicazione: (2024)
PerPO: Perceptual Preference Optimization via Discriminative Rewarding
di: Zhu, Zining, et al.
Pubblicazione: (2025)
di: Zhu, Zining, et al.
Pubblicazione: (2025)
Sparkles: Unlocking Chats Across Multiple Images for Multimodal Instruction-Following Models
di: Huang, Yupan, et al.
Pubblicazione: (2023)
di: Huang, Yupan, et al.
Pubblicazione: (2023)
MidPO: Dual Preference Optimization for Safety and Helpfulness in Large Language Models via a Mixture of Experts Framework
di: Qi, Yupeng, et al.
Pubblicazione: (2025)
di: Qi, Yupeng, et al.
Pubblicazione: (2025)
RankPO: Preference Optimization for Job-Talent Matching
di: Zhang, Yafei, et al.
Pubblicazione: (2025)
di: Zhang, Yafei, et al.
Pubblicazione: (2025)
Balancing Continuous Pre-Training and Instruction Fine-Tuning: Optimizing Instruction-Following in LLMs
di: Jindal, Ishan, et al.
Pubblicazione: (2024)
di: Jindal, Ishan, et al.
Pubblicazione: (2024)
CoGenesis: A Framework Collaborating Large and Small Language Models for Secure Context-Aware Instruction Following
di: Zhang, Kaiyan, et al.
Pubblicazione: (2024)
di: Zhang, Kaiyan, et al.
Pubblicazione: (2024)
Self-Steering Optimization: Autonomous Preference Optimization for Large Language Models
di: Xiang, Hao, et al.
Pubblicazione: (2024)
di: Xiang, Hao, et al.
Pubblicazione: (2024)
AIR: A Systematic Analysis of Annotations, Instructions, and Response Pairs in Preference Dataset
di: He, Bingxiang, et al.
Pubblicazione: (2025)
di: He, Bingxiang, et al.
Pubblicazione: (2025)
SoLoPO: Unlocking Long-Context Capabilities in LLMs via Short-to-Long Preference Optimization
di: Sun, Huashan, et al.
Pubblicazione: (2025)
di: Sun, Huashan, et al.
Pubblicazione: (2025)
KnowPO: Knowledge-aware Preference Optimization for Controllable Knowledge Selection in Retrieval-Augmented Language Models
di: Zhang, Ruizhe, et al.
Pubblicazione: (2024)
di: Zhang, Ruizhe, et al.
Pubblicazione: (2024)
Evaluating Large Language Models at Evaluating Instruction Following
di: Zeng, Zhiyuan, et al.
Pubblicazione: (2023)
di: Zeng, Zhiyuan, et al.
Pubblicazione: (2023)
Pragmatic Instruction Following and Goal Assistance via Cooperative Language-Guided Inverse Planning
di: Zhi-Xuan, Tan, et al.
Pubblicazione: (2024)
di: Zhi-Xuan, Tan, et al.
Pubblicazione: (2024)
Instruction Following without Instruction Tuning
di: Hewitt, John, et al.
Pubblicazione: (2024)
di: Hewitt, John, et al.
Pubblicazione: (2024)
Automatic Layout Planning for Visually-Rich Documents with Instruction-Following Models
di: Zhu, Wanrong, et al.
Pubblicazione: (2024)
di: Zhu, Wanrong, et al.
Pubblicazione: (2024)
TAB-PO: Preference Optimization with a Token-Level Adaptive Barrier for Token-Critical Structured Generation
di: Fodeh, Samah, et al.
Pubblicazione: (2026)
di: Fodeh, Samah, et al.
Pubblicazione: (2026)
Advantage-Guided Distillation for Preference Alignment in Small Language Models
di: Gao, Shiping, et al.
Pubblicazione: (2025)
di: Gao, Shiping, et al.
Pubblicazione: (2025)
MDCure: A Scalable Pipeline for Multi-Document Instruction-Following
di: Liu, Gabrielle Kaili-May, et al.
Pubblicazione: (2024)
di: Liu, Gabrielle Kaili-May, et al.
Pubblicazione: (2024)
M-IFEval: Multilingual Instruction-Following Evaluation
di: Dussolle, Antoine, et al.
Pubblicazione: (2025)
di: Dussolle, Antoine, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Reverse Preference Optimization for Complex Instruction Following
di: Huang, Xiang, et al.
Pubblicazione: (2025) -
PrefPO: Pairwise Preference Prompt Optimization
di: Singhal, Rahul, et al.
Pubblicazione: (2026) -
ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization
di: Yoon, Hee Suk, et al.
Pubblicazione: (2025) -
AMaPO: Adaptive Margin-attached Preference Optimization for Language Model Alignment
di: Deng, Ruibo, et al.
Pubblicazione: (2025) -
MMedPO: Aligning Medical Vision-Language Models with Clinical-Aware Multimodal Preference Optimization
di: Zhu, Kangyu, et al.
Pubblicazione: (2024)